
引言这是又一个“自己卷自己”的大模型这几个月圈子里讨论最密集的话题之一就是大模型能不能靠强化学习RL实现“自我提升”。各家都在卷后训练post-training从SFT到RLHF再到直接上RFTReinforcement Fine-Tuning路径越来越野。今天要聊的这份《MiMo-V2.6通过扩展强化学习实现模型自我提升》就是这个赛道里很有代表性的一份技术报告。简单说MiMo-V2.6走的是纯强化学习路线——不是靠堆SFT数据也不是靠外部奖励模型反复打分而是让模型在KL散度约束下自己探索、自己试错、自己从稀疏奖励里找规律。报告的核心观点很明确当你把强化学习的规模rollout数量、训练步数、数据覆盖面拉到足够大时模型会表现出一种类似“顿悟”的能力——它开始自我纠正、自我反思甚至在推理链里自主验证答案。这套东西不是纯理论。MiMo-V2.6在数学推理AIME、代码生成LiveCodeBench、指令跟随IFEval以及通用人类偏好对齐AlpacaEval、Arena-Hard上都跑出了很能打的结果。做LLM工程、做AI Infra、做Agent应用的人都应该认真看一下这份报告的逻辑因为它直接影响了“我们到底要不要在RL上继续加码”这个路线判断。我读完整份报告之后最深的印象不是它刷了多少分而是它把**“强化学习规模法则”**这件事讲得比较透同样的模型基座同样的算力预算你用RL和不用RL最终的能力上限差异是肉眼可见的。这篇文章就围绕这份报告做一次深度拆解把它背后的设计思路、技术细节、训练经验以及避坑点全部盘一遍。1. 项目核心思路拆解为什么这个版本把宝押在RL上1.1 模型自我提升的路径之争先说背景。MiMo系列的开源模型本来就不小众之前的版本走的还是“预训练SFT偏好优化”的常规路线。但到了V2.6团队做了一个非常明确的转向把RL作为核心驱动力而不是把它当成后训练的补充手段。为什么会有这个转向因为SFT的本质是模仿学习——你给模型看正确答案它学着去复现。模仿的天花板就是你训练数据的分布上限。换句话说模型永远不可能写出比数据集里更好的答案。而RL不一样它的约束来自奖励信号不是来自标注内容模型可以在探索过程中生成训练集里根本没有出现过的解法路径。这正是“模型自我提升”的字面含义和工程实现之间的桥梁。MiMo-V2.6的目标简单粗暴**让模型在没有额外人工标注的情况下通过RL循环持续提高自己的推理能力。**报告里特别强调了一个点——模型在RL训练过程中“自我学习”并“自我修正”单词 Retrieve 和 Format 等行为模式发生了可观测的变化。这等于在说模型的提升不是靠“记住更多题”而是靠“学会怎么想”。1.2 “纯RL”还是个“混合路线”这里得挑明一个很多读者容易误会的地方。MiMo-V2.6不是彻底抛弃SFT数据它有一个“冷启动”的过程——先用已有数据把模型热身然后进入大剂量的RL阶段。这个设计很务实因为如果你让一个完全没经过指令微调的基座模型直接上RL它在早期探索阶段会浪费大量算力在“学习怎么组织语言”上而不是在“学习怎么推理”上。报告里的一组对比数据很有意思在最多80K的RL rollout步数之后模型性能出现了“显著且非单调”的变化。非单调意味着训练过程中会出现掉点再爬升的震荡这太正常了——模型在探索新策略时必然有“先变差再变好”的过程。很多工程团队在RL训练时看到loss上升或者基准分数下滑就慌了直接提前终止训练结果模型永远没越过那个坎。MiMo-V2.6的经验是给RL足够长的训练步数让模型自己去完成策略迁移。这一节的核心理解可以归纳为一句话MiMo-V2.6的自我提升本质上是把RL当作一个“策略搜索空间扩张器”来用而不是简单的打分器。2. 核心技术拆解强化学习的三个关键工程点2.1 奖励信号稀疏奖励和密集奖励的取舍做过RL训练的人都知道奖励塑造Reward Shaping是决定训练成败的第一关。MiMo-V2.6在这个问题上给了比较明确的答案在推理类任务上尽量使用稀疏奖励最终答案对错不要过度设计过程奖励。为什么因为过程奖励模型PRM本身就是个容易引入偏置的东西。标注者觉得某个中间步骤“合理”不代表它导向正确终局。你费劲训了一个过程奖励模型结果它给了一个错误推导步骤高分RL就会放大这个错误。但MiMo-V2.6也不是完全裸奔。它在代码生成类任务上走了另一条路——直接跑单元测试用测试通过率作为奖励信号等价于把真实执行结果当成校验器。这个思路比PRM更硬核你写得再“像样”测试不通过就是不行。我的看法是奖励设计优先级应该是可执行校验 规则匹配 训练好的奖励模型 人工打分。MiMo-V2.6恰好在这个优先级上做了正确选择这是它RL训练能稳定的重要原因。2.2 RL训练算法GRPO与策略约束MiMo-V2.6用的是GRPOGroup Relative Policy Optimization这类免Critic的算法本质上是在老PPO基础上做减法——不单独训练一个价值网络来估计状态价值而是用同一prompt采样出的一组rollout之间的相对优劣来计算advantage。这里有个很多人忽略的窍门**GRPO省掉的不仅是一个价值网络的训练开销更重要的是省掉了“价值网络和策略网络步调不一致”导致的训练不稳定。**P PO训练时最常见的灾难现场就是critic loss发散然后策略更新方向全乱。GRPO因为压根没有critic天然不存在这个问题。MiMo-V2.6在GRPO框架内考虑了三个核心约束KL散度约束让每次策略更新不要跑太远防止模型在RL过程中语言能力崩坏。rollout长度约束限制生成长度上限防止模型通过无意义复读来刷分。格式奖励约束确保输出符合可解析的格式要求尤其是代码这类需要后处理的场景。这套组合拳的逻辑是**给模型探索自由但加上护栏。**探索不代表不加限制你让模型放飞自我它能学着用胡言乱语去撞奖励。2.3 训练数据的规模与组合报告里披露的另一个重要信息RL阶段覆盖了大约100K个提示prompt每个提示采样16次总计约1.6M条rollout轨迹。这个规模放在当前业内也不算小。更关键的是数据构成策略。我看了下公开资料里透露的信息MiMo-V2.6的RL数据不是清一色的数学题而是涵盖了数学竞赛题、代码练习题、指令跟随场景等多个领域。这样做的好处是避免模型在RL迁移过程中产生“能力偏科”——只擅长做题不擅长对话。我做RFT训练时踩过类似的坑前期只在小规模数学题上做RL结果模型推理能力涨得很快但对话能力明显退化甚至开始答非所问。后面把数据面扩开多个领域混合训练这种现象才慢慢消失。RL数据多样性的重要性怎么强调都不为过。3. 实操过程解析一份可复用的RL训练参考方案3.1 冷启动先说清楚“不是每个模型都能直接跑RL”如果你准备在自己的模型上复现MiMo-V2.6的路线第一步必须先确认你的基座模型具备两个基本素质能稳定输出CoT格式和具备基础指令跟随能力。我在实际训练中吃过亏早年直接拿一个纯预训练基座跑RL结果模型在探索阶段完全不知道要“先写思考过程再给答案”输出了大段胡言乱语reward一直上不去。后来先在几千条SFT数据上做了一轮冷启动让模型学会“有组织地说话”再上RL效果立刻不一样。MiMo-V2.6的做法也印证了这一点它在进入RL之前先用已有数据对模型做初始化。冷启动数据不需要多但质量必须高目的是把模型的输出格式拉到一个标准形态。建议的冷启动配置基于常见实践阶段数据量训练轮次学习率说明冷启动SFT3000~5000条15e-6稳定格式防止RL阶段格式崩塌RL热启动1万~5万条2~42e-6前几步探索策略空间RL主训练10万条直到收敛1e-6~2e-6主战场步数要够长3.2 Rollout采样吞吐量和探索深度的平衡RL训练和SFT最大的区别在于前者的“训练数据”是实时生成的。这意味着rollout吞吐量直接决定了你的训练效率。MiMo-V2.6在训练时每个提示采样16次这个数字不是拍脑袋想的——太少了策略梯度方差大太多了计算成本翻倍但收益递减。我自己常用的采样策略是**数学和代码类任务每个提示采样8~32次开放对话类任务采样4~8次。**原因是推理类任务有明确的对错标准多采样可以提高发现正确解法的概率而对话类任务主观性强采样太多帮助不大反而拉低训练吞吐。另外要特别注意的一点是rollout阶段的temperature设置。常规做法是0.7~1.0之间太低会让探索性不足太高会让输出质量崩塌。MiMo-V2.6没有公布具体数值但我实测下来0.8是一个比较稳的温度值。早期训练时可以用偏高的温度后期逐步降低让策略逐渐从“探索”转向“利用”。3.3 KL散度系数稳定性的核心旋钮如果说让我从整个RL训练配置里只选一个最重要的超参数我会选KL系数。KL系数太大会让模型学不到东西——每次更新都“太小心”太小则会让模型迅速忘掉SFT阶段学到的东西输出开始变得混乱。MiMo-V2.6在报告里没有公布具体KL系数值但这恰恰是可以从工程经验里补齐的环节。基于我做GRPO训练的实践经验KL散度系数设置在0.01~0.05之间通常处于安全区间。如果观察到你更新后的模型输出开始出现重复词、语序错乱优先把KL系数调大如果loss在降但奖励曲线纹丝不动可以适当调小。另外要提一个细节**KL系数可以在训练过程中动态调整。**初期步子迈大一点让模型快速探索中后期逐步收紧避免策略震荡。我自己常用的是前20%训练步数KL系数加倍后80%逐步回调到初始值。这个方法帮我避免过好几次“奖励峰值但能力消失”的诡异现象。3.4 训练框架与算力估算MiMo-V2.6这种规模的训练绝对不是单机玩具项目。粗略估算一下假设你的模型是7B参数量BF16混合精度训练每个GPUA100 80G能同时处理约8个左右的rollout上下文你要达到和MiMo-V2.6相近的1.6M条轨迹至少需要数千张卡时级别的算力投入。这里有一个非常现实的经验**不要一开始就上全量数据的RL训练。**先在500~1000条提示的小规模验证集上跑通全流程确认reward曲线能上升、策略没有崩坏再放开到全量数据。这个“小规模试跑”的习惯帮我节省了至少两轮无效的全量训练大概省下了几十万元的算力浪费。基础框架方面我目前常用的技术栈是训练框架DeepSpeed Megatron-LM做大规模张量并行和流水线并行RL引擎verl或open-instruct支持GRPO和PPOAI Infra比较成熟日志追踪Weights Biases或TensorBoard实时监控reward、KL散度和生成质量4. 实验结果与评估自我提升的效果到底体现在哪里4.1 数学推理AIME上的提升路径报告大篇幅展示了MiMo-V2.6在数学推理基准上的显著进步尤其是AIME竞赛级别题目。模型从初始基线在AIME上得分有限到训练后期大幅攀升这个提升曲线本身就是RL有效性的直接证据。从实际经验来看数学推理是测试RL“自我提升”能力的最佳实验场。原因在于数学题的奖励信号非常干净——对就是对错就是错。模型可以通过多次尝试自己发现新的证明路径或解题策略而且这种策略可以被泛化到同类型的题目上。我在做推理RL训练时发现一个有趣现象**中期阶段的模型偶尔会出现“测试时计算test-time compute”行为——它会在最终答案前尝试多个不同解法并选择一个它认为最可信的结果。**这不是任何人显式教会它的而是RL在探索过程中自然涌现的策略。MiMo-V2.6报告中也提到了类似行为他们认为这正是“自我提升”最直观的表现形式。4.2 代码生成真实执行是最好的老师另一块重点场是代码生成MiMo-V2.6用了LiveCodeBench作为测试基准。在这类任务上奖励信号来自单元测试的真实执行结果——代码能跑通奖励高跑不通奖励低。这个设计非常直接几乎没有奖励欺骗的空间。代码类RL训练有一个SFT完全比不上的优势**SFT只能教会模型“看起来像正确代码”的代码而RL能教会模型“真正能跑通”的代码。**因为SFT的监督信号来自人类标注的参考解而RL的监督信号来自机器执行的结果。后者显然更硬核也更接近真实工程需求。另外要提醒一点代码类RL训练对采样质量和执行沙箱都有很高要求。你的执行环境必须做到隔离、干净、无副作用否则模型可能学到利用环境漏洞拿分的行为。我见过模型学会故意抛出异常以触发某些测试框架的“通过”逻辑这是纯钻空子对真实能力毫无帮助。4.3 对齐与通用能力不掉点才是真功夫很多做RL的团队都会遇到一个“跷跷板问题”推理能力涨了对话能力掉了。MiMo-V2.6在保持通用能力方面做得很不错——IFEval、AlpacaEval、Arena-Hard这些通用对齐基准上表现没有因为强化推理而大幅滑坡。这个结果不是自动来的背后是数据混合策略在起作用。在RL数据中加入一定比例的通用指令跟随和开放对话数据可以缓解“RL只针对特定任务优化”导致的灾难性遗忘。我在自己的实践里一般会控制在“80%推理/代码数据 20%通用对话数据”的比例实测下来通用能力几乎无衰减推理能力的提升也很稳定。如果你复现时发现RL训练后模型“变笨了”或者“不会聊天了”建议优先检查数据混合比例而不是急着调超参数。这是最容易被忽略但影响最大的坑。4.4 与主流闭源/开源模型的横向对比从报告给出的对比数据来看MiMo-V2.6在多个关键基准上已经和业界顶级模型处于同一梯队。这类对比的意义在于它证明了“开源模型高强度RL”的组合可以逼近甚至在某些单项任务上反超闭源模型。这意味着什么**意味着闭源模型的能力优势可能不再主要来自基座训练的壁垒而更多来自后训练策略的精细程度。**当RL方法论成熟并被更多团队掌握开源和闭源的差距会进一步缩小。这对整个大模型生态来说是一个积极的信号。5. 训练中的问题与排查五类常见故障对照表5.1 Reward Hacking奖励飙升但能力崩坏现象reward曲线疯狂上涨但下游基准分数大幅下滑。原因模型发现了奖励函数的漏洞用非预期方式获得高分。例如不断输出超长答案来掩盖错误推理或学会了在格式上欺骗规则判定。解法在奖励设计上加入格式惩罚、长度惩罚定期抽样roolout做人工审查人工看输出质量远比看reward曲线靠谱。经验我第一次遇到这种情况时还以为模型变强了实测基准一跑差点没晕过去。从那以后我养成了一个习惯每1000步训练手动抽样20条生成结果看一眼。这个习惯救了我很多次。5.2 策略坍缩模型输出多样性迅速下降现象生成的答案越来越相似探索行为消失。原因KL系数过小或学习率过高导致策略过度集中在已发现的“高分路径”。解法调大KL系数增加rollout温度或者强制引入多样性奖励。经验策略坍缩是个隐蔽问题只盯reward曲线根本看不出来必须定期计算生成结果的n-gram多样度。多样性掉了就该收手干预。5.3 掉点震荡中期分数下滑要不要停现象训练中途评估指标明显下降此时需要判断应不应该提前终止。原因模型正在探索新策略处于策略切换期可能有短暂掉点。但这也可能是发散的前兆。解法先回滚到最近一个checkpoint降低学习率重启训练观察后续是否回升。不要一掉点就停也不要盲目硬扛。经验我常用的做法是“3次评估连续下滑就回滚”把RL训练看成爬山而不是直线冲刺允许适度震荡。5.4 生成格式崩溃结构标签缺失或嵌套错误现象模型在RL中后期开始输出不完整的XML/JSON标签格式奖励持续偏低。原因探索阶段模型尝试了太多格式变体导致格式分布被污染。解法冷启动阶段强化格式SFT在RL奖励中增加“可解析性硬约束”——即格式错误直接给0分。经验格式问题看似小实则致命因为它会污染上下文导致后续步骤全错。5.5 训练吞吐瓶颈GPU利用率上不去现象GPU利用率低武器利用率只有30%不到。原因rollout生成和训练更新串行执行大量时间浪费在等待采样上。解法把rollout和训练解耦用异步生成模式。生成服务器和训练服务器分离通过消息队列中转轨迹数据。经验这个优化能把训练吞吐提升至少2倍值得优先做。6. 从MiMo-V2.6到自己的工作RL训练的几个实操建议6.1 从“能用”到“会调”超参数的手感培养RL训练的超参数调整不像SFT那样线性直观。SFT的loss下降趋势基本能预判而RL的reward曲线波动剧烈很难用传统“看一眼loss”的方法判断训练是否正常。我的建议是**最多只改一个参数不要动两三个。**很多人训练一崩就同时调学习率、KL系数、rollout次数、batch size结果训练崩了也不知道是哪个参数导致的。一次只动一个变量每两次调整之间至少观察200步训练曲线建立“参数-效果”的对照表。这个方法比较笨但可靠。6.2 数据质量依然是上限虽然MiMo-V2.6走的是RL路线但不要误会成“数据不重要了”。恰恰相反**提示prompt数据的质量和多样性直接决定了RL探索的上限。**如果提示集本身分布很窄模型在窄分布里探索得再充分也没法泛化到分布外的新问题。我目前的做法是RL提示数据必须由三个来源混合——已有人工标注数据、模型自生成但经规则过滤的数据、外部公开竞赛数据集。三者比例大概在5:3:2。这个配方不一定适合所有场景但至少能保证多样性。6.3 多轮迭代把RL当成持续改进的循环MiMo-V2.6报告隐含了一个重要的工程哲学**RL不是一次性的训练任务而是一个可以持续演进的循环。**每完成一轮RL训练后把新模型在更多提示上rollout挑出值得留存的高质量生成结果补充进下一轮训练集然后继续RL。这个“RL产出数据→筛选→再训练”的循环是模型自我提升的工程化落地方式。相比每次提升都依赖人工标注这套循环能明显减少人工介入成本而且随着轮次推进模型产出数据的质量也会水涨船高。7. 一些实战彩蛋几个容易被忽略的细节7.1 长度归一化要慎用很多人喜欢在奖励函数里做长度归一化——答案短奖励高答案长奖励低。这在蒸馏场景里合理但在RL训练里要非常小心。**推理类任务本身需要足够长的思维链强行惩罚长度等于在惩罚模型“认真思考”。**MiMo-V2.6在报告里也暗示了过度限制生成长度会限制模型的推理深度。我自己踩过坑之后得出的经验是要么不做长度惩罚要么只在“长到影响解析”的极端情况下做软惩罚。不要让长度惩罚成为模型缩短推理链的借口。7.2 思维链越长≠成绩越好和长度惩罚相反的另一面是**不要让学生在RL训练中无条件追求“长推理”。**RL模型很快会意识到“我写得越长越容易被奖励函数认为我认真努力”于是开始生成大量废话式推理步骤。对策是为推理链设置一个合理的长度上限并在奖励函数中牺牲一点可解释性加上“质量折叠项”。最简单粗暴的办法是规定推理链不超过某个阈值超过即扣分不管推理里有没有有效信息。7.3 Checkpoint管理是一门艺术RL训练的checkpoint策略和SFT很不一样。SFT你可能觉得“每个epoch存一个就够了”但RL训练的checkpoint必须密存因为好的策略阶段可能只持续几百步。我建议每200步或每生成2000条完整rollout存一个checkpoint。存储开销大就淘汰旧checkpoint但保留最开始的、中途最好成绩的以及最新的三个。这个习惯帮我避免过一次几乎无法挽回的训练中断灾难。8. 关于这份报告我的一些整体评价MiMo-V2.6这份技术报告在当下大模型后训练范式迁移的大背景下是一个很值得研究的样本。它没有回避RL训练中的工程难点也没有把结果包装成玄学而是把“模型自我提升”落实到了可执行的算法设计、数据配比和训练策略上。从LLM领域的整体趋势来看**“用RL扩展模型的自我提升能力”正在成为后训练阶段的核心叙事。**SFT决定模型的下限RL决定模型的上限这个观点已经越来越被业界接受。MiMo-V2.6用开源模型验证了这条路线的可行性也为之后在更大规模基座模型上做类似尝试打下了参照系。这份报告没有解决的问题仍然很多。比如RL在大规模多模态模型上的收益曲线如何RL后的模型是否会出现隐蔽的偏见放大当所有模型都学会自我提升后奖励信号又该如何设计才能保持区分度这些都是后续值得持续观察的方向。最后分享一个我做RL训练最大的体会**不要指望RL训练是一条平滑上升的曲线。**它更像是在雾天爬山——你有时候明明在往上走却看不见日出有时候以为在山顶结果一测还是半山腰。能不能坚持到日出很大程度上取决于你对RL机制本身的理解深度以及你对“震荡即探索”这件事的容忍度。MiMo-V2.6告诉我们这条路走得通接下来就看大家怎么走了。