
大模型开源圈过去一年最明显的变化不是谁又在长文本榜上刷了多少分而是越来越多团队把资源压到了强化学习这条线上。MiMo-V2.6的技术报告能在社区引发这么大讨论根本原因不是某个benchmark又涨了几个点而是它把自我改进的强化学习规模化这个方向完整写成了一套可以照着复现的recipe一个开源大模型如何用自己生成的样本不断训练自己在超大规模计算集群上把强化学习训练曲线稳稳压住。这篇解析我前后读了三遍打算从报告传递的核心信号、自我改进闭环的机制设计、规模化强化学习中的稳定性问题、因果强化学习CRL、相关算法谱系对照以及开源生态里的部署和复现建议几个维度把报告里值得抠的细节、没写进报告但实际一定会踩的坑都拆开聊一遍。适合看这篇解析的读者大概是三类正在用开源模型做对齐训练的人想复现RL规模化路线但还没有摸到门路的工程师或研究生以及想判断自我改进到底是真方向还是营销词的决策者。我尽量不讲虚的多谈方法、依据和实操里的取舍。1. MiMo-V2.6报告的成色开源头名背后不只是算力堆砌1.1 在开源榜头名意味着什么第一开源大模型这个说法准确理解应该是开源榜单上的头名梯队它表达的不只是模型跑分高而是这个版本在通用对话、推理任务和指令跟随这几类能力上都已经排到了开源阵营最靠前的位置。MiMo-V2.6在这个时间点放出完整技术报告本身就是一个很值得咀嚼的信号开源模型和闭源模型的差距重点已经从预训练数据规模转移到对齐工程的精细度。闭源阵营能持续领先核心原因不只是算力多而是它们有一套高度成熟的强化学习系统能够在模型已经比较强的基础上再榨出一大截能力并且这套系统可以长期、稳定地在生产环境里跑。MiMo-V2.6想证明的是这套系统开源社区也能做而且可以做得足够规范。另一个信号是开源二字的分量。很多研究报告只公布结论和指标但MiMo-V2.6把训练recipe里的大量细节公开了包括强化学习阶段的数据配比、奖励信号的构造方式、模型自身的迭代流程、在多机多卡环境下的吞吐设计。对于一个做实际训练的人来说这些信息比benchmark数字有用得多——因为模型能力是结果能把结果稳定复现出来的过程才是真正稀缺的东西。1.2 V2.6的核心版本叙事从堆预训练料转向堆强化学习如果只读摘要可能觉得V2.6只是又大了一版的新模型。但从报告整体的方法论倾斜度来看这一版的关键动作不是继续无脑扩大预训练数据或者增加上下文长度而是把重心放在了两件事上一是强化学习的规模化训练二是自我改进机制带来的数据闭环。这个转向不是心血来潮。预训练阶段的Scaling Law到现在已经很成熟数据质量和数量堆到一定量级之后边际收益下降得非常明显。而强化学习阶段不一样同样的模型权重经过精心设计的RL训练之后推理和指令跟随能力可能产生肉眼可见的跳变。换句话说预训练决定一个模型能力的底盘强化学习则决定底盘能发挥出多少。V2.6真正想表达的技术主张我理解为在大模型场景下强化学习不是锦上添花而是可以规模化、可以迭代、甚至可以让模型自我改进的主引擎。这个主张的支撑是报告里呈现出的完整训练闭环——模型生成候选回答奖励机制对回答进行评估再把这些带有反馈信号的数据送回训练流程如此循环。这个循环每一次跑通模型都会比上一轮更强一点而循环能跑多快、多稳取决于强化学习工程系统做得多扎实。这一点对于做实际训练的人尤为关键你拿着一个70B模型如果只做预训练和SFT能力的上限基本已经锁死但如果你能搭出一个稳定的RL闭环哪怕只有很小的奖励信号提升经过多轮迭代之后模型的整体表现可能完全不一样。MiMo-V2.6报告本质上就是在告诉社区这条路被系统性地验证过了。2. 自我改进闭环自己出题、自己考试、自己订正的技术真相2.1 自我改进不是一个比喻而是一条具体的数据飞轮自我改进这四个字听起来很玄但它背后其实是一条非常工程化的数据飞轮模型先针对一批提示词生成若干候选答案然后用奖励模型或规则验证器给这些答案打分选出相对好的样本再把它们作为训练数据重新喂给模型。下一轮迭代中模型因为见过更好的回答风格和推导过程生成质量整体抬升于是又能产生质量更高的数据。如此反复模型像滚雪球一样越滚越好。我在复现这类流程时最大的感受是这和我们平时说的用大模型生成数据训练小模型有一点本质区别。蒸馏式训练中教师模型是外部固定的学生只是模仿而自我改进里教师和学生是同一个模型模型既当考生又当阅卷人。这就不只是一个算法问题而是一个工程问题整个闭环中至少要管理四个子系统——生成推理服务、奖励评估服务、训练框架、数据筛选管线。任何一个环节的吞吐跟不上闭环都会变成瓶颈。以生成阶段为例强化学习里的rollout采样生成和普通推理有本质不同普通推理追求低延迟强化学习采样追求高吞吐和多样性。同一个提示词可能要生成8个甚至16个不同的候选答案而且温度、top_p这些采样参数会直接影响奖励信号的分布。MiMo-V2.6报告里能看出它们的做法是让rollout服务和训练进程解耦用单独的推理引擎扛住采样吞吐训练框架只负责消费已经生成的数据。这样整个闭环的扩展性才会好。2.2 自我改进里最容易被低估的三个设计点第一是候选采样规模K值。K值就是每条提示词大概会采样多少条候选回答。K值太小好样本不够改进速度会很慢K值太大模型会快速趋向单一成功模式多样性崩塌奖励模型的偏好被反复利用反而导致过拟合。这在强化学习里叫策略坍塌policy collapse生成结果不再多样化全都朝着奖励模型最偏爱的那个句式收敛。实际跑下来我发现K值需要和训练轮数、KL惩罚强度一起联动调整只调K不调别的很难得到理想效果。第二是奖励模型的更新节奏。很多人做自我改进时会犯一个错误同一版奖励模型从头用到尾。随着策略模型越变越强它生成的样本风格会逐渐偏离奖励模型的训练分布于是奖励打分会失真。MiMo-V2.6报告的思路我认为更合理奖励模型阶段性更新但更新时要保留一个固定校验集来防止奖励模型本身迭代漂移。这等于给整个飞轮加了一个校准器。第三是数据去重要比想象中重要。自我改进最怕的不是模型变强而是模型自我洗脑同一类错误反复出现在训练集里模型不但不纠正反而越来越确信它是对的。我在实践中会做一步很笨但有效的操作对生成的回答做语义聚类如果同一类错误答案占比忽然升高就降低这类样本的采样权重。这也是报告里提到数据质量管线的意义所在。2.3 收益递减是常态关键看停止条件这里必须泼一盆冷水任何自我改进流程都不是无限循环的。第一轮改进增益往往最明显第二轮开始递减第三轮可能只剩很小的涨幅。如果继续硬跑甚至可能出现模型在奖励指标上越来越高、但在真实人类评测里反而变差的倒挂现象。所以好的自我改进设计必须提前定义什么时候停。常见做法是看验证集上的奖励分数是否连续若干轮不再上涨或者看模型在外部基准测试比如推理任务榜单上的表现是否进入平台期。MiMo-V2.6的方向其实不是追求无限循环而是把每一轮改进的增量尽量做大同时控制成本和数据风险。理解了这一点你就知道自我改进和无限自我进化完全是两码事前者是严谨的工程流程后者只是科幻修辞。3. 强化学习规模化到底scale了什么算力、样本与训练稳定性3.1 RL的规模曲线和预训练完全不同很多人以为强化学习规模化就是给更多GPU、跑更久规模上去了自然有效。但实际情况是预训练阶段我们熟知的Scaling Law——模型参数、数据量、算力按比例增长loss稳定下降——在RL阶段并不会原样成立。RL的收益更陡峭但也更早遇到饱和而且它极度依赖奖励信号的质量。一个简单的类比预训练像让一个人读书读得越多知识面越广虽然也会边际递减但总体稳定增长强化学习像让一个人练投篮练得多确实有进步但如果篮筐位置是歪的奖励信号有偏你练得越狠反而会把错误的投篮姿势练得越牢固。所以MiMo-V2.6报告里强调的规模化核心不是GPU变多而是三件事的同步规模化样本吞吐、奖励信号信息量、训练算法的稳定度。三者缺一个规模越大越容易翻车。这就是为什么报告会花大量篇幅讲rollout吞吐的优化讲奖励模型的多样性讲训练稳定性。RL规模化真正考验的是一座水桶的全部木板。3.2 在线PPO训练最容易翻车的三个细节我实际跑过从7B到几十B的RL训练基于PPO的在线强化学习有几个问题几乎必然遇到报告中可能一笔带过但实操中会消耗你大量时间。第一个是优势估计GAE的参数。大模型生成的序列很长奖励往往是稀疏的、只在最后出现GAE里的lambda参数决定了你拿多远处的奖励往回传播。lambda设得太小模型只会学到最后几步怎么办中间的长程推理学不到lambda设得太大又会让梯度信号变得特别噪。MiMo-V2.6这类长推理任务尤其吃这个参数建议每次换数据分布时都重新调一轮不要沿用上一个任务的最优值。第二个是旧策略数据和当前策略不同步的问题。在线RL训练中rollout用的是旧权重推理出来的数据但训练时梯度更新已经让当前权重变化了PPO用重要性采样比例来修正这个偏差。大规模训练里如果rollout数据太旧重要性采样比例会变得很大训练曲线就会出现明显的尖刺。实际操作中除了调小更新步数还可以给重要性采样比例设置一个动态截断阈值曲线会稳很多。第三个是最容易被忽视的——奖励模型的分布漂移。策略模型在RL训练中会迅速学会刷奖励探索出一些在奖励模型看来高分、但人类看起来很奇怪的回答。报告里强调的RLVR可验证奖励就是为了对抗这个问题数学题有确定答案、代码可以跑测试用例这类奖励不容易被刷。但通用对话没有标准答案只能靠奖励模型打分这时候就必须配合KL惩罚项让新策略不要偏离原始模型太远。3.3 可验证奖励与过程奖励RL规模化的两条腿MiMo-V2.6报告真正有价值的地方我认为是把奖励信号分成了两层。第一层是结果奖励尤其是可验证奖励。数学、代码这类任务最终答案对不对是确定的就算奖励模型打分有偏规则验证器不会骗你。这种干净信号的规模化带来的提升是最扎实的。第二层是过程奖励。推理过程中间可能有几十步只有最后一步有结果奖励中间步骤的梯度信号会非常稀疏。过程奖励就是给每一步中间结果打分相当于把稀疏的期末成绩拆成平时分。这套做法在训练长推理、数学证明、代码生成任务时效果非常明显。两条腿一起用整个RL训练的样本效率会高很多。这一点也直接影响我在第五章要讲的算法谱系——我们怎么把离线RL、基于模型的RL这些老方法重新接入大模型训练。4. 因果强化学习CRL把因果推断工具嵌入强化学习流程4.1 为什么RL到了规模化阶段反而要回头补因果强化学习训练到大规模之后一个非常隐蔽的问题会浮出水面奖励模型学到的更多是相关性而不是因果性。举个例子如果训练数据里有一类代码样例总带有特定风格的注释奖励模型可能会把这种注释风格误当成代码正确的原因。模型学到这个虚假相关性之后在分布内可能表现很好一旦提示词变得陌生它就会按照错误线索生成能力断崖式下跌。这种问题在传统RL里就叫reward hacking奖励欺骗和分布的泛化失败。解决方向之一就是热词里提到的因果强化学习Causal RL也就是把因果推断工具直接嵌入强化学习流程。其核心能力包括三块因果发现从数据中推断变量间的因果图、干预决定主动改变某个变量而不是被动观察、反事实推理回答如果当时采取了不同动作结果会怎样这类问题。MiMo-V2.6报告能让因果强化学习这个相对冷门的方向重新进入讨论区本身就是一件好事。它说明规模化RL做到一定程度技术瓶颈已经不只是算力和数据了而是如何让模型学到真正可迁移的规律而不是刷出一堆经不起推敲的相关性。4.2 CRL在MiMo-V2.6里可能的嵌入位置从报告方法论结构来推测CRL可以出现在几个关键环节一个是在状态表征层。大模型处理的问题文本可以拆成多个变量题目条件、约束、目标等。如果直接把这些原始文本全部丢给策略网络模型很难分辨哪些变量对结果有真实的因果作用哪些只是干扰项。CRL做的事情是先学一张因果图把关键变量之间的依赖关系画出来然后在状态表征里只保留因果相关的信息丢弃干扰变量。这就像医生诊断时先做检查排除无关因素而不是把病人的每一句话都当病因。另一个是在奖励分解层。单一的奖励分数很难解释到底是哪一步决策导致结果变好。CRL可以把最终奖励按因果路径拆算子算到具体步骤上让每个中间动作都能得到更精确的反馈。这正是过程奖励的因果版本——不是凭经验打过程分而是按因果贡献打分。还有一个是用在探索策略上。因果图可以指导模型优先在干预后效果未知的变量上尝试新动作而不是在所有方向上盲目乱试。这部分对样本效率的帮助在模拟环境中尤其明显。4.3 因果机制落地的现实阻力但我也要负责任地说一句因果学习现在落地在大模型训练上还不是一件非常顺手的事情。因果结构发现本身计算开销很大而且对数据质量要求很高语言任务里变量定义远不如物理系统那么清晰。你很难把一段自然语言问题干净地拆成结构化的因果变量。所以MiMo-V2.6如果做了CRL方向的尝试我更倾向于判断它采取的是一种轻量因果做法——比如在奖励分解和样本筛选环节引入因果约束而不是在端到端训练里完整跑SCM结构因果模型。对于想跟进这个方向的人我的建议是先不要指望完整因果图能端到端学出来而是在奖励分解这类具体任务上做增强。比如把一次生成的最终答案反推成若干个决策点再标注每个决策点的独立贡献相当于给奖励信号做了因果结构化。这个思路既不会引入过重计算又能缓解一部分虚假相关性问题我个人觉得是CRL方向最务实的一个落地点。5. 算法谱系对照离线RL、基于模型的RL与在线策略如何配合5.1 IQL与离线RL在低质量历史数据里榨出价值MiMo-V2.6的自我改进流程如果只用在线强化学习会有一个工程痛点每一步都要实时rollout大量样本整个训练管线的等待时间很长数据利用率也不高。这时候离线强化学习Offline RL就有用了。IQLImplicit Q-Learning隐式Q学习是离线RL里很常用的方法它的核心思路是不去拟合一个可能被低质量数据带偏的策略而是只学习价值函数并且用expectile回归的方式避免对分布外动作给出过高估计。说人话就是它更保守不会看到一堆胡写的数据就认为自己也能胡写而是从这些数据里尽量挖掘出哪些动作其实是被低估的。在MiMo-V2.6这种大规模训练场景里离线RL更适合做冷启动和数据提纯。先用离线RL从历史交互数据里学一个更稳的价值评估器再把这个评估器作为在线RL的初始化奖励信号来源之一可以让在线阶段的探索更少出错。换句话说离线RL负责从旧数据里找金子在线RL负责在新环境里挖新矿两者不是替代关系而是前后衔接的关系。5.2 基于模型的RL让模型在脑内先模拟几步另一个被讨论很多的方向是基于模型的强化学习Model-based RL。传统无模型RL直接在真实环境里试错代价高、步子碎基于模型的RL先学一个环境动态模型然后在脑内模拟大量轨迹再决定策略。这个方法放在大模型场景下思路就很有意思了语言模型其实天然自带一部分世界模型能力。它对很多问题虽然不能直接给答案但可以在内心模拟多条解题路径想象每一步做完之后大致会得到什么样的中间状态。如果把这个模拟过程显式地引入RL训练就可以大幅减少真实环境也就是外部奖励模型打分的调用次数样本效率会好很多。David Silver早年讲强化学习时就把这种规划能力当作智能体的高阶能力如今在大模型语境下重新看这段理论会觉得特别贴切。MiMo-V2.6在推理类任务上的表现我倾向于理解为它在用某种内部推理规划策略让模型在多个候选思路之间做模拟推演再选择最有希望的一条深入展开。这比单纯把采样宽度调大要高效得多。5.3 完整的强化学习训练配方一种合理的解读把上述算法谱系串起来MiMo-V2.6报告的训练流程大概可以拼出一张配方图冷启动阶段用离线RL方法接近IQL的思路从人类历史交互和已有SFT数据中学一个比较稳的初始价值评估器避免在线阶段一开始就乱探索。在线提升阶段用PPO类在线策略配合RLVR可验证奖励和过程奖励让模型在数学、代码等硬性任务上做长程强化。自我改进阶段把已经变强的模型作为数据生成引擎再对生成样本做奖励过滤和因果分解循环回SFT或RL训练。这个配方本身不算秘密真正拉开差距的是每一阶段的稳定度和数据质量。很多团队在线RL阶段跑崩很少是因为看不懂论文而是管线里任何一个环节抖动整条训练就废了。这也是我在后面第六章会重点强调工程环节的原因。6. 从技术报告到实际部署开源工具链与二次训练建议6.1 部署层的开源平台现况MiMo-V2.6再怎么强调训练方法论最后始终要落到部署。目前成熟的开源部署工具链大致可以分几类vLLM吞吐导向的推理引擎动态batching做得好比较适合在线服务场景是目前社区最通用的选项之一。SGLang在后端做了很多结构化生成和高效调度优化对需要多次rollout的RL采样场景尤其友好很多RL训练管线已经把它作为默认采样后端。TensorRT-LLM英伟达生态里的高性能推理方案能把模型压到FP8甚至更低精度的TensorRT engine适合对推理延迟要求比较高的生产服务。llama.cpp纯CPU或混合设备上也能跑的轻量方案适合个人PC和边缘设备体验模型能力但吞吐上限比GPU方案低不少。KServe、Ray Serve面向Kubernetes和分布式场景的模型服务编排层适合企业级多模型部署。说句实在话部署框架选型不需要一上来就追求最复杂的分布式方案。单机单卡能跑起来先用vLLM或者SGLang做在线服务需要更高吞吐、更稳定的工程化部署再上TensorRT-LLM做量化优化配合Ray或K8s做弹性伸缩。把链路一步一步加厚比一开始就搭一个大而全的系统稳得多。6.2 在有限算力下复现自我改进循环的最小闭环如果手头只有一两张消费级显卡怎么体验一下MiMo-V2.6报告里的自我改进流程我的建议是放下大模型执念先用7B参数规模搭最小闭环准备一个开源对话模型和一个奖励模型奖励模型可以用现成的偏好模型不一定要自己训练。用SGLang或vLLM起一个rollout服务给模型喂一批提示词每个提示词采样8条回答temperature设置在0.8到1.0之间角度多样化非常重要。用奖励模型给所有回答打分挑出每条提示词下分数最高的回答凑成一个新训练集。用这个新训练集对模型做一轮轻量SFT或RL微调保存新权重。用新权重再跑一轮rollout对比奖励分数分布的变化。这个最小闭环跑通之后你会对报告里的很多措辞有完全不一样的理解。比如我实际跑时发现第二轮迭代的奖励涨幅大概率不如第一轮这不是实验失败而是收益递减的正常现象。又比如你会发现reward模型打分和自己的主观判断经常不一致——这也是为什么报告里强调可验证奖励的原因因为机器觉得好和真的对是两回事。6.3 复现过程中值得盯紧的三个实战指标我在跟踪此类训练时会在日志里专门盯三个指标建议你也照着做。第一个是生成多样性也就是模型在几次采样中回答的重复度。如果多样性快速下降说明KL惩罚太弱或者采样参数不当模型已经开始坍缩。趁早调整不要等几百个step之后才回头检查。第二个是奖励修正量和KL散度的剪刀差。奖励分上涨本身是好消息但如果上涨的部分全部建立在KL散度急剧上升上说明模型不是变聪明了只是在讨好奖励模型。要设置一个上限KL超过阈值就降低学习率或者增加KL惩罚权重。第三个是外部验证集上的真实表现。我在训练时会把一部分不做任何修改的官方评测题留出来每轮迭代之后跑一遍。奖励模型分数再高都不如这个外部评测数字更有说服力。它是防止机器自嗨最有效的一道闸门。最后的最后聊一点我个人做这类工作的感受技术报告里的曲线往往是最理想的一版真实的复现之路总有稀奇古怪的工程问题。但MiMo-V2.6这份报告至少把方向上能不能成的问题回答了剩下的怎么做得更省、更稳、更好正是社区接下来要填的坑。如果你正准备上手复现请一定从小规模闭环开始把数据管线、奖励评估、训练稳定性这三个基础打牢再谈规模化。这个顺序反了后面的代价会成倍放大。