ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI4AI‑Bench:面向递归自我提升的算法设计大模型智能体评测基准

AI4AI‑Bench:面向递归自我提升的算法设计大模型智能体评测基准 AI4AI‑Bench:面向递归自我提升的算法设计大模型智能体评测基准论文来源:arXiv:2608.20318v1摘要递归自我提升(Recursive Self‑Improvement, RSI)研究关注AI系统能否改进生成AI系统本身的流程,让下一代模型继承本次改进成果。该流程的核心就是训练算法:一套更优的目标函数或者更新规则,会提升后续每一轮训练的算力‑能力转换效率,包括生成下一代智能体的训练过程。因此递归自我提升能否成立,关键在于智能体能否自主完成训练算法设计。但目前没有专门隔离该能力的评测基准:现有评测大多依靠收集数据集、调超参数来取得高分,无法区分“修改训练运行执行方式”和“修改模型本身学习规则”这两类完全不同的改动。本文提出AI4AI‑Bench基准,包含10个冻结的科研代码仓库,覆盖10大类训练算法。每一项任务中,智能体在单张B300显卡上拥有4小时时间,对训练算法做代码改写;改写后的源码会从零重新运行最多12小时;由对智能体不可见的固定评测器打分,和原仓库自带算法做同等条件对比。由于10项任务原始指标量纲不可直接比较,本文设计统一进展坐标刻度:0代表无信息基线模型,0.1代表仓库原始算法性能,1.0代表任务理论最优。本文在6套系统、29种配置下完成全部10项任务实验,平均得分0.166;最优系统平均得分0.250。也就是说即便是最强系统,距离“原始算法→理论最优”的完整提升空间,也只完成不到五分之一。对提交补丁的分析揭示性能瓶颈来源:绝大多数提交完全没有改动模型的学习逻辑;只有少数提交触及算法层,这部分平均得分(\boldsymbol{0.226}),其余仅(\boldsymbol{0.126})。提升推理努力主要是提高智能体“敢于去修改学习算法层”的意愿:高推理配置下,触及算法层的提交占比从8%提升到64%,整体平均分从0.094提升至0.196。本文完整开放任务套件、评测器以及全部打分过的提交补丁,方便后续随着大模型迭代重复开展该评测。关键词:递归自我提升;AI智能体;自动机器学习;训练算法;评测基准;代码智能体1 引言递归自我提升的闭环:AI系统改进生成后继系统的流程,后继系统继承该改进。这个闭环可以被编码智能体自动化的分为三个层级:系统工程层:内核、并行、通信优化;受硬件性能天花板约束,到达硬件极限之后收益消失。数据层:数据集混合、合成、过滤;受人类文本总存量约束,同时合成数据大多只是复述模型已有知识;损失每进一步减半,需要成倍增加token开销。算法设计层:目标函数、更新规则、正则化、调度策略。算法层收益具备一次投入、多次复用的特点。Adam、层归一化、DPO、GRPO只需要一次算法创新,后续所有训练都持续获益。如果递归自我提升可以实现复利式增长,绝大部分复利增益必须来自算法设计层。现有的评测基准无法隔离算法设计层能力:Kaggle类竞赛基准:比拼特征工程、集成学习,学习算法本身直接调用库函数,智能体不会修改,改动无法被后继训练继承。PostTrainBench:重点在于数据组装、初始化,而不是目标算法。RSIBench‑Data:冻结后训练全栈,只允许做和数据相关决策。MLS‑Bench:改进ML系统组件,但把执行层面改进和学习算法改动的分数混在一起。Autoresearch:交给智能体单个训练脚本,但不是完整科研仓库;在对比实验中,智能体修改效果等价超参搜索,不如CMA‑ES、TPE这类经典超参优化算法。修改源码 ≠ 设计算法。二者区分不在于改动代码行数,而在于改动对象:超参数:训练算法的外部输入数值;算法改动:重写损失、梯度更新规则。这是机器学习科学家在工业训练系统中实际做的工作:读取训练动态(损失曲线、梯度范数、策略熵、参考模型散度、优势分布、分token损失),定位算法失效机制,针对性修改机制本身。本文贡献隔离算法层的评测基准AI4AI‑Bench:10套冻结科研仓库,覆盖10大类训练算法;统一协议区分4小时智能体开发窗口,和最多12小时从零重跑打分流程。面向改动行为的测量方案,不只看最终分数:对每一份提交补丁做改动分类,把“智能体是否改进训练算法”从一句结论变成可核验事实,而不是单纯由分数反推。揭示算法探索与实际性能提升之间的鸿沟:真正带来性能提升的是算法设计层改动,但绝大多数提交不会触及该层;增大推理算力主要提升智能体尝试修改算法层的意愿。2 AI4AI‑Bench基准2.1 任务形式化定义一项任务为元组(C,a0,q,m,d)(C,a_{0},q,m,d)(C,a0​,q,m,d)CCC:冻结仓库源码;a0a_0a0​:任务起始基础模型;qqq:开发阶段可自由调用的低成本代理指标;mmm:最终评测指标;d∈↑,↓d\in{\uparrow,\downarrow}d∈↑,↓:指标优化方向(越大越好 / 越小越好)。智能体观察(C,a0,q)(C,a_0,q)(C,a0​,
返回列表