
1. 从能聊天到会进化MiMo-V2.6 到底在解决什么真问题大模型圈子这两年有个很尴尬的现状模型发布时跑分一个比一个漂亮真丢到生产环境里跑几周能力曲线基本是平的。你问它同一个类型的任务一百遍它不会因为前九十九次的反馈而变聪明一点点。这就是所谓的静态模型困境——训练完就冻结部署即巅峰之后全靠提示词工程硬撑。MiMo-V2.6 这份技术报告最抓我的点不是它又刷了什么榜单而是标题里那四个字自我改进。它想干的事情是让模型在部署之后依然能通过强化学习持续变强而且这个变强过程要能规模化不是实验室里跑个小玩具就完事。先把定位说清楚。MiMo-V2.6 是一个开源大模型采用MoE混合专家架构核心卖点是面向自我改进的强化学习规模化。关键词里还出现了Agentic RL说明它的强化学习不是传统那种单轮问答打分而是面向智能体多步决策场景的。适合谁看如果你在做模型后训练、RLHF/RLAIF 流水线、Agent 系统或者单纯想搞明白开源模型怎么在强化学习上跟闭源掰手腕这篇值得逐段啃。我先把结论摆前面这份报告真正的技术含量不在于它用了多大的强化学习集群而在于它把自我改进拆成了一条可工程化的闭环——采样、评估、筛选、训练、再采样每一环都有规模化的设计取舍。下面我按自己的理解把这条链路拆开讲。2. MoE 骨架决定了强化学习的玩法为什么不是普通稠密模型2.1 稀疏激活带来的训练经济学要理解 MiMo-V2.6 的强化学习设计得先理解它的 MoE 骨架。稠密模型每个 token 都要过全部参数MoE 则是每个 token 只激活一小撮专家。这带来的直接后果是总参数量可以很大但单次前向的计算量FLOPs可控。这对强化学习意味着什么强化学习最烧资源的地方不是训练那一步而是采样。你得让模型反复生成轨迹、反复试错采样量往往是训练量的几十倍甚至上百倍。稠密模型做大规模 RL采样成本会直接把预算烧穿。MoE 的稀疏激活让大容量 可承受的采样成本同时成立这是 MiMo-V2.6 敢谈规模化的物理基础。我自己的经验是做 RL 后训练时采样吞吐往往比训练吞吐更早成为瓶颈。你 GPU 集群再大如果每个 rollout 都要跑满全参数那有效样本产出率会低得让人抓狂。MoE 在这里的价值相当于把每次试错的电费打下来了一个量级。2.2 专家路由与策略稳定性的隐性冲突但 MoE 做 RL 有个坑报告里没明说但做过的都懂路由本身是不稳定的。同一个 prompt模型在不同训练步可能把 token 路由到不同专家导致策略的行为分布发生漂移。在监督微调里这问题不大但在强化学习里策略漂移会直接污染优势估计advantage estimation让梯度信号变噪。常见的应对思路有几类我按可靠性排个序路由冻结RL 阶段锁住路由网络只更新专家参数。稳但牺牲了路由的适应性。路由正则给路由分布加熵约束或 KL 约束防止塌缩到少数专家。折中方案调参麻烦。负载均衡奖励把专家负载均衡作为辅助目标塞进 RL 目标函数。灵活但容易和主任务目标打架。MiMo-V2.6 具体用了哪种报告细节需要结合实现看但从规模化这个诉求推断大概率是路由正则 负载均衡的组合因为纯冻结会限制模型容量利用纯自由又稳不住。这里给做类似工作的朋友一个提醒别在 RL 一开始就放开路由先用 SFT 把路由分布训到一个相对均衡的状态再进 RL能省掉大量排查策略为什么突然崩了的时间。2.3 容量与推理成本的再平衡还有一个容易被忽略的点MoE 在 RL 里的推理成本结构和稠密模型不同。稠密模型的推理成本是固定的MoE 则取决于路由分布——如果路由塌缩到少数专家实际计算量会下降但质量也下降如果路由过于分散通信开销专家并行场景下会飙升。所以在设计 RL 流水线时batch size 和序列长度的选择要重新算账。稠密模型时代那套能塞多大塞多大的经验在 MoE 上不一定成立。我的做法是先用小 batch 探路由分布的稳定性稳定了再逐步放大而不是一上来就拉满。3. 自我改进闭环的四个齿轮采样、评估、筛选、再训练3.1 采样环节多样性比正确性更稀缺自我改进的第一步是让模型生成大量候选轨迹。这里有个反直觉的结论在采样阶段多样性比单条质量更重要。如果你只采样模型最有把握的那条路径那自我改进就退化成自我确认模型永远学不到新东西。MiMo-V2.6 在采样上的规模化设计核心应该是温度调度 多策略采样。具体来说同一个 prompt 用不同温度、不同采样策略top-p、top-k 组合生成多条轨迹保证候选池里有高置信正确解也有低置信探索解。实操上我踩过的坑是温度设太高垃圾样本淹没有效信号温度设太低候选池同质化严重。一个比较稳的做法是分档采样——比如 30% 低温保证有可用正样本、50% 中温主力探索区、20% 高温探索边界。这个比例不是拍脑袋是根据有效样本率反推的低温档保证底线高温档提供梯度多样性。3.2 评估环节奖励模型的规模化是真正的瓶颈采样出来一堆轨迹怎么判断哪条好这就是评估环节。传统做法是训一个奖励模型RM来打分但 RM 本身有容量上限面对海量、多样化的轨迹RM 的评分会失真。MiMo-V2.6 报告里规模化三个字我理解很大一部分压力压在评估环节。可能的规模化路径包括评估方式优势规模化瓶颈单一奖励模型实现简单、成本低容量有限易被 reward hacking多奖励模型集成抗 hacking 能力强推理成本线性增长规则/程序化验证精确、无偏只适用于可验证任务模型自评估无需额外标注自评偏差容易自我强化错误从工程角度混合评估是最现实的方案可验证任务数学、代码用规则验证兜底开放任务用 RM 集成边界模糊的用模型自评估做初筛。这样既控制了成本又保证了信号质量。提示评估环节最怕的是 reward hacking。模型会找到奖励模型的漏洞生成看起来分高但实际没用的轨迹。缓解手段包括奖励模型定期用新数据重训、对高分轨迹做人工抽检、以及给奖励加长度惩罚等正则项。3.3 筛选环节不是所有好样本都该进训练集采样和评估之后你手里有一堆带分数的轨迹。直觉上分数高的都拿来训但这是错的。筛选的核心是平衡质量和信息量。一条满分但模型本来就会的轨迹对提升能力几乎没有贡献一条中等分数但模型之前从没见过的轨迹可能信息量巨大。所以筛选策略要同时考虑难度分层太简单和太难的样本都要控制比例主力放在跳一跳够得着的区间。去重语义重复的轨迹要合并否则训练集会被少数模式主导。分布覆盖保证任务类型、难度、领域的覆盖度避免偏科。我自己的做法是维护一个能力画像记录模型在各任务类型上的当前水平然后按略高于当前水平的原则采样训练数据。这本质上是一种课程学习curriculum learning在 RL 后训练里效果很稳。3.4 再训练环节策略更新的稳定性设计筛选完样本进入策略更新。这一步的规模化难点在于训练稳定性。RL 训练本来就比监督学习难收敛规模一大梯度噪声、优势估计偏差、策略崩溃的概率都会上升。常见的稳定性手段包括KL 约束限制新策略偏离旧策略的程度防止一步更新太猛。优势归一化对优势值做标准化减小方差。梯度裁剪常规操作但阈值要针对 MoE 调。参考模型锚定保留一个 SFT 阶段的参考模型定期做 KL 对齐。这里有个 MoE 特有的注意点不同专家的梯度尺度可能差异很大因为激活频率不同。高频专家梯度累积快低频专家梯度稀疏。如果不做处理低频专家会学得很慢甚至退化。一个实用技巧是按专家激活频率对梯度做重加权让低频专家获得相对更大的更新信号。4. Agentic RL从单轮打分到多步决策的范式切换4.1 为什么 Agent 场景不能套用传统 RLHF关键词里的Agentic RL是这份报告区别于普通 RLHF 的关键。传统 RLHF 处理的是单轮问答给一个 prompt模型生成一个回答奖励模型打一个分完事。但 Agent 场景是多步的模型要调用工具、观察结果、决定下一步、再调用……整个轨迹可能几十步奖励只在最后给一次。这带来两个核心难题信用分配credit assignment最终成功了到底是哪一步的功劳是第一步规划对了还是第五步工具调用选对了稀疏奖励很多任务只有成功/失败两种结果中间没有反馈信号学习效率极低。4.2 信用分配的工程化处理解决信用分配常见思路是过程奖励模型PRM——不只给最终结果打分给每一步也打分。但 PRM 的标注成本极高规模化困难。MiMo-V2.6 在 Agentic RL 上的规模化设计我推测采用了结果奖励 蒙特卡洛回传的组合用最终结果作为主信号通过多次采样估计每一步的期望回报把稀疏的最终奖励摊到各步上。这种方法不需要额外标注但计算量大正好契合它规模化的定位。实操上做 Agentic RL 时我会特别关注轨迹长度分布。如果模型学会拖长轨迹骗奖励比如反复调用无意义工具说明信用分配出了问题。缓解手段是给轨迹长度加惩罚或者对无效步骤做负奖励。4.3 工具调用的动作空间设计Agent 的动作空间比纯文本生成复杂得多——它包含工具选择、参数填充、调用时机等。动作空间设计不好RL 会陷入探索地狱。我的经验是分层动作空间比较稳先让模型学要不要调用工具二分类级别再学调用哪个工具多分类最后学参数怎么填生成。分层之后每层的探索空间都小很多学习效率显著提升。注意Agentic RL 里工具调用的失败反馈很关键。工具报错、超时、返回空结果这些都是宝贵的负样本信号别浪费。把它们结构化地喂回训练流程比单纯的成功/失败信号信息量大得多。5. 开源这件事对强化学习规模化的真实意义5.1 开源模型做 RL 的独特约束闭源模型做 RL可以随便调 API、随便采样成本是钱的问题。开源模型做 RL约束完全不同你得自己搭采样集群、自己管训练稳定性、自己处理数据流水线。MiMo-V2.6 作为开源模型谈规模化意味着它必须给出一套别人能复现的工程方案而不只是秀结果。这对社区的价值在于它把大规模 RL 后训练从少数大厂的专利变成了可学习、可复现的流程。你不需要有几千张卡理解它的设计取舍之后用十分之一的规模也能跑出可用的自我改进闭环。5.2 复现时的资源估算给想复现的朋友一个粗略的资源账。假设你要做一个中等规模的 Agentic RL 实验采样这是大头。按每条轨迹平均 10 步、每步 500 token 算一条轨迹 5000 token。要凑 10 万条有效训练样本考虑筛选率 20%得采样 50 万条轨迹即 25 亿 token 的生成量。评估如果用 RM 集成假设 3 个模型评估成本是采样成本的 3 倍左右每个轨迹要过 3 个 RM。训练相对便宜但 MoE 的专家并行通信开销要算进去。结论是采样和评估占了总成本的 80% 以上。所以规模化的关键不是训练集群多大而是采样和评估流水线的吞吐和效率。这也是为什么 MoE 架构在这里如此重要——它直接压低了采样成本。5.3 从 MiMo-V2.6 能抄到什么抛开具体实现这份报告给从业者的可迁移经验有几条自我改进的闭环必须工程化不能靠手工调。采样、评估、筛选、训练每一环都要有自动化流水线。评估环节是真正的瓶颈奖励模型的质量和规模决定了整个闭环的上限。MoE 和 RL 是天然搭配稀疏激活让大规模采样在经济上可行。Agentic RL 的信用分配是当前最值得投入的研究方向谁解决了稀疏奖励下的高效学习谁就拿到了下一代 Agent 的钥匙。6. 我在实操中踩过的几个坑和对应解法最后分享几个具体到操作层面的经验都是真金白银换来的。坑一奖励模型过拟合训练分布。RM 在训练集上打分很准一遇到 RL 探索出的新轨迹就乱打分。解法是 RM 要持续用新采样数据重训或者用多个 RM 做集成投票。坑二KL 系数设太大导致学不动。KL 约束是防策略崩溃的但设太大模型几乎不更新自我改进变成自我冻结。我的经验是 KL 系数从 0.01 起步观察策略熵的变化熵掉太快就调大熵不降就调小。坑三MoE 专家负载失衡。跑着跑着发现少数专家承担了 80% 的 token其余专家几乎不激活。解法是在 RL 目标里加负载均衡项或者定期做路由重初始化。坑四Agent 轨迹长度失控。模型学会用多调用几次工具来碰运气轨迹越来越长成本飙升。解法是给轨迹长度加软惩罚同时对无效步骤比如调用后结果没被使用做负奖励。坑五评估流水线成为吞吐瓶颈。采样很快评估很慢GPU 大量空转等评估结果。解法是评估和采样异步化用队列解耦评估慢就多开评估实例别让采样端等。这些坑的共同点是它们都不是算法问题而是工程问题。大规模 RL 后训练拼到最后拼的是流水线的健壮性和吞吐而不是某个花哨的算法。MiMo-V2.6 这份报告的价值恰恰在于它把工程细节摆到了台面上让后来者少走弯路。