
2025 年如果你问一个做大模型的人现在训练推理能力最大的瓶颈是什么十有八九他会告诉你不是算力是标注数据。你可能觉得这很奇怪。大模型不是应该越来越聪明越来越不需要人管吗但事实恰恰相反越往后训练麻烦越大。因为要让模型学会做数学题、写代码、解物理题你得先告诉它这道题的正确答案是什么这样它才能知道自己做对了还是做错了。可当模型的推理能力已经超过大多数人类标注员的时候谁来告诉它答案对不对这不是一个遥远的假设问题。现在最前沿的模型在一些数学竞赛题上的表现已经超过了普通的标注团队继续雇人标注不仅贵可能还标错了。于是研究者们想了一个办法既然没有标准答案那就让模型自己给自己打分。这个思路叫**自我奖励** 自我奖励Self-rewarding模型不依赖外部标注而是根据自己生成的多个答案用投票、置信度等方式自己判断对错然后拿这个判断结果当作训练信号。听起来挺聪明对不对但这篇论文要讲的第一件事就是这个聪明办法背后藏着一个致命的坑。一个人自己给自己打分会出什么问题设想一下这个场景你让一个学生做十道题然后规定多数答案一致的那个就算对。如果这个学生对某类题目本身就有系统性的理解偏差比如他一直把某个物理公式记错了那他做十次这道题大概率十次都用错了公式也就是说十次答案都指向同一个错误结果。按照多数投票即为真理的规则这个错误答案反而会被判定为正确然后被当作训练目标反过来加强这个错误。这就是自我奖励的核心问题**如果奖励信号来自模型自己的输出那么模型的偏见没有任何外部力量去打破只会被不断放大**论文里管这个叫自我确认的动力学后面我们会看到严格的数学证明。但直觉上很好理解你没法靠一个人自己检查自己的作业来发现他真正不懂的地方因为他不懂的地方恰恰是他自己也检查不出来的地方。论文测试了几种主流的自我奖励方法包括根据多数投票打分的 TTRL、根据模型对自己答案的置信度打分的 Intuitor、根据预测熵打分的 RENT结果都出现了同一种现象训练到后期模型的输出越来越单一多样性坍缩甚至直接训练崩溃。论文里图 4 画出了这个过程你能清楚看到 RENT 这类方法的奖励方差迅速趋近于零回复长度突然暴增或者直接发散模型准确率随之掉头向下。这不是偶然的实验失误是这套机制注定会走到的地方。找一个不认识的人来打分那怎么破这个局论文提出的思路其实很朴素既然一个人自己检查不出自己的问题那就找另一个人来检查。这个另一个人得满足一个条件他的犯错模式跟你不一样。如果两个人在同一类题目上犯同样的错误那互相检查也没用还是会一起认错为对。这背后的原理其实是机器学习里一个很老的概念叫协同训练。 协同训练Co-training1998 年由 Blum 和 Mitchell 提出的理论核心思想是如果两个视角彼此独立一个视角犯的错误另一个视角大概率不会犯同样的错误那么让它们互相提供监督信号就能获得比单独训练更好的效果。基于这个思路论文提出了他们的方法叫 **CO-RL** CO-RLCo-Reinforcement Learning协同强化学习让多个互不共享参数、互不传递梯度的独立模型同时在同一批无标注题目上生成答案然后彼此把对方的多数投票结果当作标准答案来打分各自用这个分数训练自己。这里有个细节特别重要训练的时候两个模型之间完全没有梯度交换没有参数共享唯一的联系就是奖励信号。A 模型看 B 模型的答案给自己打分B 模型看 A 模型的答案给自己打分两条训练线各走各的只在打分这一步产生交集。这就好比两个从没见过面、背景经历完全不同的阅卷老师各自独立批改同一份试卷然后把两人的判卷结果互相对照。如果两位老师的知识背景差异够大一个人漏看的错误另一个人往往能发现这种交叉验证比一个人反复检查自己的答案要可靠得多。反过来说如果这两位老师其实是师徒关系学的是同一套教材那交叉验证基本就退化成自我验证了起不到纠错作用。具体的训练机制是这样运作的假设有两个智能体 A 和 B面对同一道无标注的题目各自独立采样出若干个答案。A 智能体的这些答案里出现次数最多的那个答案会被拿去当作 B 智能体的参考答案反之亦然。B 智能体生成的答案如果和这个参考答案一致就得到奖励 1否则得 0。这个过程用图 3 表示得很清楚两条通路完全对称谁也不用谁的梯度。论文用的策略优化算法是 **GRPO** GRPOGroup Relative Policy Optimization组相对策略优化一种不需要额外训练价值网络的强化学习算法做法是对同一个问题采样一组回答把这组回答的奖励做组内标准化得到每个回答相对于组内平均水平的优势值再据此更新策略。DeepSeek-R1 等模型的训练中大量使用了这个算法。如果不搞这套互相打分的机制会发生什么论文用一个对照实验说明了这点把两个同样的模型各自单独用自我奖励方法训练然后推理的时候把两者的回答简单合并投票这种伪装成多智能体的做法效果明显不如真正的 CO-RL。数据摆在那里文本任务上 CO-RL 集成后的平均分是 66.9而两个独立训练模型简单集成的分数是 64.9差了整整两个百分点。这说明关键不在于多训练了一个模型而在于训练过程中真的产生了跨模型的纠错。差异性从哪里来越大越好吗既然核心逻辑是两个视角要足够不同才能互相纠错那接下来的问题就是怎么让两个模型尽可能不一样论文给出了几条路径。第一条路径是选用完全不同的模型家族。Qwen 和 Llama 在分词器、词表大小、架构选择、预训练语料上全部不同Gemma 又用了 25 万词表和局部全局交替注意力这类独特设计。这些差异从预训练阶段就开始积累模型学到的思维习惯天然不同。论文附录里专门做了一个量化实验衡量不同模型对之间的错误重叠率。结果发现同一模型家族内部哪怕换个随机种子的错误重叠度普遍偏高卡帕系数Cohens κ在 0.51 到 0.58 之间而跨家族模型对的卡帕系数能降到 0.31 到 0.42。 Cohens κ一种衡量两个分类结果一致程度、并排除随机巧合影响的统计指标数值越低说明两者的判断越不相关也就是错误越不重叠。翻译成人话就是同一个模型换个种子重新训练一次出错的地方还是差不多但换一个完全不同架构的模型出错的地方明显不一样。这个发现直接支撑了论文的核心主张跨家族搭配比同家族搭配的纠错能力更强。第二条路径是模型规模的差异。不同参数量的模型天然有不同的推理风格和能力边界一个 7B 模型和一个 3B 模型面对同一道题错的地方往往也不一样这也是一种天然的互补性来源。第三条路径最有意思叫数据解耦。论文用 DeepSeek-V3 把 MATH 数据集里的每道题改写成一个新场景比如原题是三角形 ABC 中 ABAC14BC26求最短角平分线长度改写后变成一个三角形公园两条边长 14 米第三条边 26 米城市打算修一条最短的角平分线步道答案不变但表述完全不同。然后一个智能体学原题另一个学改写版。这样即便是同一个基座模型也不会因为死记硬背某种题目表述方式而产生一模一样的偏差。这三条路径其实分别对应着模型不同规模不同看到的题目表述不同三种维度的差异化论文管这套组合拳统一称为提升队伍多样性cohort diversity。而实验证明这个多样性越高效果越好。图 2 里能看到一个很直观的趋势跨家族训练的两个模型彼此之间的一致率agreement走势比同家族的更平稳伪标签准确率更高最终在 MATH-500 上的准确率也更高。如果反过来想用两个完全一样的模型互相监督会怎样论文其实也测了这种同家族设置结果显示确实还是有提升比基座模型提升 8.0% 和 4.0%但幅度明显不如跨家族设置。这说明互相监督这个框架本身有用但差异有多大直接决定了这套机制能挖出多少潜力。数学上到底发生了什么前面讲的都是直觉和实验现象但论文还给出了一套严谨的理论证明这部分挺硬核值得拆开看看。论文把问题简化成一个二元模型假设某道题只有对和错两种结果用 p 表示模型答对这道题的概率。训练过程就是看 p 怎么随时间演化。在自我奖励的情形下论文证明了一个很扎心的结论叫**自我确认动力学**self-confirming dynamics只要 p 一开始小于 0.5也就是模型本身在这道题上更倾向于答错那么随着训练进行p 会持续下降最终收敛到 0。反过来如果 p 一开始大于 0.5则会收敛到 1。这意味着什么意味着自我奖励这套机制根本没有纠错能力它只会把模型原本的倾向放大到极致无论这个倾向对不对。这跟前面讲的学生自己检查自己作业的比喻完全对应上了如果学生原本就有 60% 的把握认为某个错误答案是对的自我奖励只会把这个把握越推越高直到他百分之百确信一个错误的答案。这个 pA pB 1 的分界线在数学上叫做鞍点分割线是整个系统的临界地带。这个结论最厉害的地方在于它给出了一个具体的数值例子。假设 A 智能体在一半题目上有 90% 把握答对、另一半只有 20% 把握B 智能体正好反过来一半 20%、另一半 90%。两个智能体各自的平均正确率都只有 55%用自我奖励训练各自最多只能在自己擅长的那一半题目上收敛到正确整体准确率停留在 50%。但用 CO-RL 训练因为在每一道题目上 pA pB 都等于 1.1超过了临界值 1所以理论上两个智能体在所有题目上都能收敛到正确答案整体准确率达到 100%。这个例子说明了协同训练真正的威力所在不是要求每个智能体都很强而是要求它们的强项能够互补。哪怕两个人各自水平平平只要擅长的地方不重叠合作起来就能远超各自单打独斗的上限。这就像一场接力赛两个队员单独跑都跑不完全程但如果一个人擅长前半程冲刺另一个人擅长后半程耐力接力棒交接得当反而能完成一个人根本完不成的距离。如果不这样安排接力而是让两人各自重复跑同一段最拿手的赛程看似都在发挥所长实际上团队整体成绩反而被限制在了各自的舒适区里。实验结果从数学题到看图说话理论讲完了实际效果到底怎么样论文在文本和多模态两条线上都做了大规模验证。文本方面训练数据用的是 MATH 数据集里难度 3 到 5 级的题目测试覆盖七个基准包括小学数学题 GSM8K、竞赛数学 MATH-500 和 AMC、代码生成 HumanEval、MBPP 和 LiveCodeBench还有需要广泛知识面的 GPQA。| 方法 | GSM8K | MATH500 | AMC | HEval | GPQA | MBPP | LCB | 平均 ||---|---|---|---|---|---|---|---|---|| 基座模型 | 73.4 | 56.6 | 28.9 | 39.0 | 21.2 | 52.2 | 13.7 | 40.7 || 有标签训练(GT-Reward) | 76.2 | 64.6 | 36.1 | 65.2 | 20.7 | 54.4 | 14.5 | 47.4 || TTRL | 80.4 | 66.4 | 31.3 | 63.4 | 22.2 | 51.8 | 15.9 | 47.3 || CO-RL同家族 | 78.5 | 66.0 | 37.4 | 65.8 | 22.2 | 56.0 | 15.2 | 48.7 || CO-RL跨家族 | 80.1 | 66.8 | 33.7 | 64.0 | 22.7 | 56.8 | 15.2 | 48.5 || **CO-RL跨家族数据解耦** | **81.0** | 66.6 | 36.1 | 62.8 | 25.8 | 55.6 | **17.2** | **49.3** |这是 Qwen2.5-3B 在这套体系下的表现跨家族加数据解耦版本平均分达到 49.3%比基座模型高出接近 9 个百分点甚至超过了用真实标签训练的 GT-Reward47.4%。多模态方面同样验证了这个规律。论文用 Qwen2.5-VL、InternVL3.5、Gemma-3 三个视觉语言模型家族在 MathVision、MathVerse、MathVista、We-Math 四个多模态数学推理基准上测试。这几个模型家族在视觉编码器的选择上差异很大Qwen2.5-VL 用的是原生动态分辨率 ViTInternVL 用 InternViTGemma 用 SigLIP这天然就是一种强多样性场景。结果是 CO-RL 在 12B 规模的 Gemma-3 上甚至超过了有标签训练的版本47.56% 对 45.17%。论文还特意跟已有的多智能体强化学习方法 CoMAS 做了对比。CoMAS 需要一个额外的 LLM 裁判来给多轮辩论打分机制更复杂用了三个智能体。而 CO-RL 只用两个智能体不需要任何裁判模型最终平均分反而比 CoMAS 高出 4 个百分点62.97% 对 58.94%。这说明引入外部裁判这件事本身未必是必需的只要智能体之间有足够的差异性简单的交叉投票就够用了。论文还进一步试了三个智能体同时训练的场景把 Qwen2.5-3B、Llama-3.2-3B-Instruct、Qwen3-1.7B 放在一起互相监督结果三个模型的平均提升幅度分别是 7.8%、6.0%、8.2%证明这套框架不局限于两两配对可以自然扩展到更多智能体组成的圈子。训练过程中到底发生了什么变化光看最终分数还不够直观论文进一步观察了训练过程中的动态指标主要是三个验证集准确率、奖励标准差、回复长度。图 4 里能看到一个很有代表性的对比。RENT 这类自我奖励方法训练几十步之后奖励标准差就迅速塌陷到接近零意味着模型对每一批回答的判断趋同了同时回复长度突然暴增这通常是训练走向崩溃的前兆信号。TTRL 相对稳定一些但奖励方差还是逐渐下降验证集表现也不如 CO-RL。而 CO-RL 全程保持奖励方差不塌陷回复长度稳定准确率持续爬升。论文对多模态设置也做了类似观察图 5 显示两个智能体之间的一致率agreement在训练过程中始终保持在一个不算太高的水平同时它们交换的伪标签准确率却在持续上升。这个现象很关键**两个智能体没有趋同成一模一样的行为而是各自保留了独特性同时给对方提供的参考信息越来越准**这跟理论分析完全吻合。自我奖励的问题根源在于奖励来自智能体自己一旦它对某个错误越来越自信这份自信本身就成了奖励信号形成正反馈死循环。CO-RL 打断了这个循环因为奖励来自另一个视角完全不同的智能体只要两者错误不完全重叠纠错空间就一直存在。写在后面读到这篇论文的理论部分时最触动我的其实不是 CO-RL 本身的设计而是那个 pA pB 1 的临界条件。它把一个原本很模糊的直觉多样性有用变成了一个可以计算的数字门槛。这意味着理论上你可以提前估算两个模型配对之后到底有没有可能通过协同训练把彼此都拉到正确答案上去而不是拍脑袋决定要不要凑一对。论文里有个细节我反复看了几遍同一个模型换一个随机种子重新训练错误重叠率卡帕系数跟换一个完全不同家族的模型比起来居然差距没有想象中那么小。这说明多跑几次采样取平均这种朴素的做法可能远远达不到真正意义上的视角独立这也解释了为什么单纯的模型集成ensemble效果不如跨家族协同训练。还有一点值得琢磨这篇论文其实暗示了一个更大的问题当模型能力超越人类标注水平之后真理该由谁来裁定CO-RL 给出的答案是没有绝对权威但可以靠视角的多样性逼近它。这跟人类社会里很多共识形成的机制比如同行评审、陪审团制度在逻辑上有种说不清道不明的相似性。这算不算是把一个古老的社会协作智慧重新在机器学习里发现了一遍QAQ1CO-RL 是什么ACO-RL 是一种不需要标注答案的多智能体强化学习方法让多个互不共享参数的模型同时训练各自用另一个模型的多数投票结果当作参考答案打分从而在没有真实标签的情况下持续提升推理能力。Q2CO-RL 和自我奖励方法比如 TTRL 有什么本质区别ATTRL 这类自我奖励方法用模型自己的多数投票结果给自己打分容易把自身偏见不断放大导致训练崩溃CO-RL 用另一个独立训练的模型的投票结果打分两者错误不完全重叠能互相纠正对方犯的错误。Q3CO-RL 需要两个模型完全不同吗用同一个模型行不行A同一个模型互相监督也能带来提升但效果不如跨模型家族配置。论文实验显示模型家族差异越大、错误重叠率越低最终训练效果越好跨家族加数据改写的组合效果最佳。