算子开发自主编码智能体,英伟达 AVO 让不懂 CUDA 的 AI 写出顶级 GPU 内核 “盲编程“时代来了: 算子开发自主编码智能体 盲编程时代来了英伟达 AVO 让不懂 CUDA 的 AI 写出顶级 GPU 内核 agennt你指的应该是英伟达在 2026 年 3 月发布的AVOAgentic Variation Operator智能体变异算子技术。这是一项让 AI 智能体自主进化、优化 GPU 内核代码的重磅研究在开发者圈子里引发了很大震动。核心亮点维度详情全称Agentic Variation Operator智能体变异算子发布时间2026 年 3 月 25 日论文提交至 arXiv核心思想用自主编码智能体取代传统进化搜索中的固定变异/交叉操作实现全流程无人干预的代码优化测试平台NVIDIA Blackwell B200 GPU优化目标多头注意力MHA内核——Transformer 的核心算子实验结果AVO 智能体在7 天内无人工干预、自主运行探索了500个优化方向迭代出40个有效内核版本BF16 吞吐量1668 TFLOPS相比 cuDNN英伟达官方闭源库最高提升3.5%相比 FlashAttention-4当前最强开源基准最高提升10.5%为什么这件事很炸裂注意力内核已经被人类顶尖 GPU 专家优化了多年FlashAttention 系列和 cuDNN 代表了当前业界巅峰。在这种逼近硬件极限的领域AVO 还能继续压榨出性能而且是通过 AI 自主完成的。更关键的是它的泛化能力将 MHA 的优化迁移到分组查询注意力GQA任务AVO 仅用30 分钟自主适配性能仍比 cuDNN 高7.0%比 FlashAttention-4 高9.3%。AVO 发现的典型优化策略无分支累加器重调8.1%消除条件分支带来的线程同步开销修正/MMA 流水线重叠1.1%让修正工序与第二阶段 GEMM 并行跨 warp 组寄存器重平衡2.1%重新分配寄存器减少溢出到慢速内存盲编程理念研究团队许冰、Terry Chen、Zhifan Ye自称一开始并不懂 GPU 编程因此从一开始就致力于开发完全自动化、无需人工干预的系统称之为“盲编程blind coding”。从第二代智能体开始系统就进入了自我演化状态目前每个智能体的代码量约10 万行。如果你想深入了解某个方面——比如技术架构细节、对算子工程师的影响、或者论文原文——可以告诉我。论文原文标题AVO: Agentic Variation Operators for Autonomous Evolutionary Search作者Terry Chen, Zhifan Ye, Bing Xu, Zihao Ye, Timmy Liu, Ali Hassani, Tianqi Chen, Andrew Kerr, Haicheng Wu, Yang Xu, Yu-Jung Chen, Hanfeng Chen, Aditya Kane, Ronny Krashinsky, Ming-Yu Liu, Vinod Grover, Luis Ceze, Roger Bringmann, John Tran, Wei Liu, Fung Xie, Michael Lightstone, Humphrey Shi共 23 人机构NVIDIA发布时间2026 年 3 月 25 日arXiv 编号2603.24517论文主页含 PDF 下载https://arxiv.org/abs/2603.24517PDF 直链https://arxiv.org/pdf/2603.24517技术架构细节一、核心范式从「LLM-in-the-loop」到「LLM-as-operator」传统进化搜索如 FunSearch、AlphaEvolve把 LLM 关在固定流水线里只让它做「候选生成器」——框架负责父代采样、评估、种群管理LLM 只负责单次调用输出一个候选解。AVO 彻底打破这个范式LLM 本身就是变异算子。智能体自主决定查什么资料、改哪段代码、什么时候验证形成一个自我导向的闭环。二、智能体循环Self-directed Agent LoopAVO 的变异过程被建模为一个自主循环智能体可以主动能力说明查询谱系Lineage访问所有先前方案的完整历史理解进化轨迹查阅知识库调用领域特定知识库 K如 CUDA 编程指南、PTX ISA 文档、Blackwell 架构手册执行反馈获取编译器输出、Profiler 性能计数器、正确性验证结果提出修改自主规划并实施代码编辑修复 Bug根据编译/运行失败信息自主调试批判验证对自己的方案进行批判性评估决定是否提交这个循环不是单轮的而是长周期、多轮迭代的——智能体可以在一次变异任务中持续运行数小时甚至数天。三、双层进化机制AVO 采用外层 内层的双层架构外层进化负责优化种群中的个体即 GPU 内核代码追求更高的评分函数 f吞吐量。内层进化专门进化变异算子本身——智能体的策略、超参数、工具调用方式会随着进化过程不断优化。类比理解外层是培养学生内层是培养更懂教学的老师。四、智能体工具链与持久记忆AVO 智能体基于 NVIDIA 内部开发的通用编码智能体未针对内核优化做特定修改具备以下能力自主代码编辑Shell 命令执行文件系统导航文档检索持久记忆通过对话历史维护累积内容包括先前所有编辑记录编译器输出性能分析结果Profiler整个进化过程中的推理链条五、评分函数与评估评分函数 f以吞吐量TFLOPS为核心指标在前向预填充阶段测量。正确性验证每次变异后的内核必须通过数值正确性测试。滑动窗口评估采用滑动窗口机制最近 50 代的应用效果动态影响算子权重优秀算子会产生马太效应。六、实验部署细节项目配置GPUNVIDIA Blackwell B200CUDA13.1PyTorch2.10.0基线cuDNN v9.19.1、FlashAttention-4 (commit 71bf77c)精度BF16头维度128头数16MHA、32 查询头GQA序列长度4096 ~ 32768总 token 数固定 32k通过调整 batch size 实现七、7 天进化轨迹中的关键版本性能提升呈阶梯式跃迁而非平滑增长每个拐点对应一个重大微架构发现版本优化策略性能增益v8QK-PV 交错与位掩码遮蔽架构拐点v13单次 Softmax 重构架构拐点v20无分支累加器重缩放Branchless Accumulator Rescaling8.1%v30修正/MMA 流水线重叠1.1%v33跨 Warp 组寄存器重平衡2.1%八、自我演化特性核心开发者许冰Bing Xu提到“在过去一年半的时间里我们两人在两个智能体系统中开发了四代智能体。从第二代开始这些智能体栈就开始自我演化。现在每个智能体的代码行数都约为 10 万行非空代码。”这意味着 AVO 的智能体系统本身也在进化——不是人类在写更多代码而是智能体在改进自己的实现。如果你想进一步深挖某个具体部分比如某个优化策略的 CUDA/PTX 实现细节、或者 AVO 与 AlphaEvolve 的架构对比可以继续问我。AVO 代码不公开截至目前2026 年 7 月AVO 的完整代码并未开源。论文中只公开了方法论和实验结果没有发布智能体系统或进化框架的代码仓库。这符合英伟达一贯的做法——论文公开、核心代码内部保留类似 cuDNN 闭源策略。类似的开源项目与源码虽然没有 AVO 本身但有几个方向接近的开源项目可以参考1. FlashAttention-4AVO 的基线完全开源AVO 的实验直接以 FlashAttention-4 为起点进行进化这是目前最强开源注意力内核。GitHubDao-AILab/flash-attention特点CUDA CUTLASS CuTe DSL支持 Blackwell代码量庞大但结构清晰是理解高性能注意力内核的最佳教材。2. cuLAInclusionAI线性注意力 Agentic 优化路线GitHubInclusionAI/cuLA特点用 CuTe DSL 和 CUTLASS C 写的线性注意力 CUDA 内核。其 Roadmap 中明确提到“Continuous optimization via agentic methods such as AVO.”价值如果你想复现 AVO 的思路cuLA 提供了一个完整的 CUDA 内核开发基线你可以在此基础上搭建自己的智能体优化流水线。3. AutoKernelarxiv 2603.21331论文AutoKernel: autonomous GPU kernel optimization via iterative agent-driven search特点与 AVO 同期2026 年 3 月发布的类似工作用智能体迭代驱动 GPU 内核搜索。如果后续开源将是最接近 AVO 的替代品。4. 经典进化搜索框架LLM-in-the-loop 路线这些项目把 LLM 嵌入固定进化流水线可以作为 AVO 的简化版参考项目链接核心思想FunSearchdeepmind/funsearchLLM 生成 进化搜索解决数学问题AlphaEvolve论文公开代码未开源DeepMind 的进化搜索发现矩阵乘法算法OptiGuide多个开源实现用 LLM 优化代码性能5. 通用编码智能体框架AVO 的核心是自主编码智能体以下框架可以作为构建类似系统的底座Claude Code / Cursor / Codex这些工具具备自主编辑、Shell 执行、文件导航能力与 AVO 中描述的通用编码智能体能力一致。OpenHands (原 OpenDevin)All-Hands-AI/OpenHands — 开源的自主编码智能体支持长时间运行任务可以作为 AVO 智能体的替代实现。如果你想复现 AVO最现实的路线是以 FlashAttention-4 或 cuLA 为种子程序提供初始 CUDA 内核用 OpenHands 或 Claude Code 作为智能体引擎提供自主编辑、编译、调试能力搭建评分函数正确性验证 nsys/ncu 性能分析实现谱系管理保存所有历史版本和性能数据供智能体查询让智能体自主循环查询历史 → 查阅文档 → 修改代码 → 编译验证 → 性能测试 → 提交/回滚这条路线的难点不在于技术栈而在于运行成本——AVO 跑了 7 天、探索了 500 方向LLM API 调用量巨大且需要持续访问高端 GPUB200 级别。如果你有具体的复现方向比如只想验证某个优化策略或者在小规模模型上跑可以告诉我我可以帮你进一步拆解。这三个项目代表了「LLM 进化/优化」这条技术线上的三个不同节点从数学发现到算法发现再到工程解释各有侧重。下面逐一展开。1. FunSearch2023—— LLM 进化搜索的开山之作发布Google DeepMind2023 年 12 月论文登Nature。核心思想FunSearch 的名字来自FunctionSearch——搜索函数。它将预训练 LLM 与自动评估器配对通过迭代进化来发现新的数学构造和算法。架构流程程序池初始种子程序 ↓ 采样 → 送入 LLMPaLM 2→ 生成新程序 ↓ 自动评估器验证正确性 评分 ↓ 高分程序回写程序池 ↓ 循环迭代...关键设计多样性策略避免种群停滞刻意维持解的多样性并行进化多个工作节点异步运行数据库作为共享状态可解释输出输出的是完整程序人类可以阅读和理解构造逻辑关键成果上限集问题Cap Set Problem发现了全新构造法将下界从 2.27n 提升到2.36n是过去 20 年最大增幅。陶哲轩评价这是「数学家将被重新定义」的里程碑。装箱问题Bin Packing发现更高效的启发式算法可用于提升数据中心效率。开源状态已开源https://github.com/google-deepmind/funsearch局限性FunSearch 的 LLM 被关在固定流水线里——框架负责采样、评估、种群管理LLM 只负责「单次调用生成一个候选」。这限制了智能体的自主性也是 AVO 后来要打破的范式。2. AlphaEvolve2025—— 从数学到工程的全面突破发布Google DeepMind2025 年 5 月论文登Nature。核心思想AlphaEvolve 是 FunSearch 的直系升级版同样基于「LLM 生成 评估器验证 进化迭代」的循环但能力边界大幅扩展——不仅能发现数学构造还能进化完整代码库、优化复杂算法甚至改进硬件电路。架构四组件异步循环组件职责LLMGemini 系列基于当前最优程序生成改进版本评估器自动执行候选程序返回标量评分 正确性验证程序数据库存储所有通过验证的程序作为共享状态采样器从数据库中选择父代程序送入 LLM整个循环在多个工作节点上异步并行运行没有中心化协调数据库充当共享状态。评估器是核心约束必须满足自动化、快速、全面。这决定了 AlphaEvolve 适合「正确性可精确验证」的问题矩阵乘法、几何组合、电路验证不适合模糊目标如 UI 设计、产品策略。关键成果领域成果意义矩阵乘法4×4 复数矩阵乘法仅需48 次标量乘法打破 Strassen 1969 年的 49 次纪录56 年来首次改进数学构造50 开放问题中 75% 匹配最佳解20%超越人类包括接吻数问题11 维 593 个球、Erdős 最小重叠问题上界AI 训练Gemini 大型矩阵乘法核加速23%训练时间缩短 1%直接部署到谷歌生产环境数据中心调度启发式函数优化节省0.7%计算资源规模效应下节省巨额成本芯片设计TPU 硬件电路 RTL 级优化减少面积和功耗关键洞察「完全自由探索」AlphaEvolve 的成功秘诀之一是不预设对称性或分块策略。传统人类算法设计常受「对称性陷阱」限制而 AlphaEvolve 在复数域自由搜索时意外发现复数算法在实数域同样有效从而突破了 56 年的壁垒。开源状态论文公开代码未开源。局限性在更大矩阵5×5、6×6上未能超越现有最优解。研究人员认为这是因为更大矩阵需要特定归纳偏置如对称性来缩小搜索空间而 AlphaEvolve 的通用性在此成为劣势——需要在「完全开放搜索」和「人工约束」之间找平衡。3. OptiGuide2023—— 另一条路线用 LLM 解释优化结果发布Microsoft Research2023 年 7 月arXiv:2307.03875。核心思想OptiGuide 走的不是「发现新算法」路线而是**「解释已有优化结果」**。它解决的是供应链优化中的一个真实痛点优化求解器如 Gurobi能算出最优解但业务人员看不懂、不信任、无法做「如果-怎样」分析。架构流程用户自然语言查询 ↓ 编码器将问题转化为结构化格式 ↓ LLMGPT-4生成优化代码 ↓ 安全检查防止有害代码 ↓ 优化求解器Gurobi执行计算 ↓ 结果返回 LLM → 生成人类可读的自然语言答案应用场景部署在Microsoft Azure 供应链中处理服务器从仓库到数据中心的分配调度智能履行系统 IFS。规划者可以问“如果供应商 B 替代供应商 A成本怎么变”“某个区域的需求翻倍会怎样”“为什么系统选择了这个供应商”技术特点不替代优化器LLM 不直接求解而是生成修改优化模型的代码由 Gurobi 等求解器完成计算隐私保护专有数据不直接发送给 LLM只发送优化代码和结果上下文学习通过精心设计的 prompt 教授 LLM 领域知识无需昂贵微调开源状态论文公开未找到官方开源仓库。但论文提供了完整的评估基准涵盖设施选址、网络流、劳动力分配、TSP 等多种优化问题可用于复现。三者与 AVO 的关系对比维度FunSearch (2023)AlphaEvolve (2025)OptiGuide (2023)AVO (2026)机构DeepMindDeepMindMicrosoftNVIDIALLM 角色候选生成器in-the-loop候选生成器in-the-loop代码翻译器 解释器变异算子本身as-operator进化深度固定流水线固定流水线无进化单次查询自主闭环长周期迭代目标领域数学构造、组合优化数学 算法 硬件供应链优化解释GPU 内核代码优化自主性低框架控制一切中框架控制LLM 生成低单次查询响应高智能体自主决策代码开源✅ 是❌ 否❌ 否❌ 否这条时间线很清晰FunSearch证明了 LLM 进化搜索可以发现新知识AlphaEvolve证明了这套方法可以打破人类保持了几十年的纪录并部署到生产环境AVO则更进一步——不再把 LLM 关在固定流水线里当「生成器」而是让它成为进化过程本身的「算子」自主决定查什么、改什么、什么时候验证实现了从LLM-in-the-loop到LLM-as-operator的范式跃迁。OptiGuide 则是另一条平行线它解决的是「优化结果的可解释性」问题与 AVO 的「自主发现更优代码」形成互补。未来很可能会出现融合两者的新系统自主发现代码 自主解释代码 自主验证代码。

本月热点