ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

揭秘小米MiMo-V2.6-Flash-RL的强化学习:从全异步GRPO到Groupwise Agentic Grading的自我提升闭环

揭秘小米MiMo-V2.6-Flash-RL的强化学习:从全异步GRPO到Groupwise Agentic Grading的自我提升闭环 揭秘小米MiMo-V2.6-Flash-RL的强化学习从全异步GRPO到Groupwise Agentic Grading的自我提升闭环【免费下载链接】MiMo-V2.6-Flash-RL项目地址: https://ai.gitcode.com/XiaomiMiMo/MiMo-V2.6-Flash-RL小米MiMo-V2.6-Flash-RL是小米 MiMo-V2.6 系列的开源强化学习RL检查点也是该系列中效率均衡的一档。它围绕一个核心目标构建将强化学习规模化走向模型自我提升——同步扩大 RL 算力、环境多样性与阅卷算力让模型在探索与反馈中不断扩展能力边界。本文将用尽量通俗的语言拆解它的三大 RL 引擎全异步 GRPO 大规模训练、Groupwise Agentic GradingGRS GAR智能阅卷以及防刷分的 Aligned RL闭环。一、先认识 MiMo-V2.6-Flash-RL它是一台什么样的机器在讲强化学习之前先用一张表建立直觉。这个模型本体是一个稀疏 MoE混合专家架构同时原生支持文本、图像、视频、音频四种模态并拥有1M tokens 的上下文长度——足够塞进一个大型代码仓库或长程 Agent 工具调用轨迹。关键参数数值通俗理解总参数 / 激活参数309B / 15B大脑很大但每次只激活约 5%推理更省上下文长度1M tokens能一次性读完超长的代码库或操作日志模态文本、图像、视频、音频一个模型通吃四类输入视觉编码器681M 参数的 MiMo ViT专门看图看视频的 28 层网络音频编码器308M AudioTokenizer 127M 音频块编码器专门听音频的 24 层网络推测解码器MTP/DFlash5 层草稿模型一次预测 7 个 token边猜边验证生成速度更快这些结构信息都可以在仓库中直接查到主干架构定义在 modeling_mimo_v2.py超参数汇总在 config.json推测解码草稿模型的实现在 dflash/dflash.py 与 dflash/config.json。官方技术报告 MiMo_V2_6_technical_report.pdf 则给出了完整的训练细节。一句话定位Flash-RL 不是一个静态成品而是一套RL 训练系统跑出来的检查点——本文的重点就是这套系统。二、为什么要自我提升MiMo-V2.6 的 RL 三件套传统训练范式里模型能力上限往往由标注数据的规模决定。MiMo-V2.6 的思路是换一条路让 RL 本身可规模化同时扩展三样东西RL 算力每步训练消耗更大量的推理轨迹rollout环境多样性编码、通用 Agent、视觉、网络安全任务混在同一次训练里阅卷算力奖励信号本身也要变聪明而不是简单的对/错 0/1。这套组合带来两个非常实用的特性You Only RL Once一次 RL 打天下不再为每个领域单独跑一遍 RL。编码、Agent、视觉、安全任务被混合进同一个 batch不同能力相互强化训练中学到的策略还能迁移到训练中没见过的执行框架harness上。对齐的 RLAligned RL从自我纠正冷启动开始——模型先反思并重写自己答错的轮次再进入正式 RL训练全程用环境加固、对抗筛选和验证器交叉检查来防止模型钻漏洞刷分reward hacking。三、全异步 GRPO用超大班级把策略优化做快做大3.1 GRPO 是什么一个小组讨论的比喻GRPOGroup Relative Policy Optimization组相对策略优化是 MiMo 采用的强化学习算法。它和传统 RL 最大的区别在于不需要额外的价值模型打分管。打个比方同一个问题让同一个学生做 16 遍得到 16 份不同的答卷。教师不用绝对打分只需在这 16 份内部比较——哪份更好、哪份更差相对差距直接变成学习信号advantage优势值。做得比平均好的行为被鼓励差的被抑制。3.2 全异步与超大 batch 意味着什么MiMo-V2.6-Flash-RL 的 RL 把 batch 规模推到了很夸张的量级每个训练步 1,568 个 prompt × 16 条 rollout约 2.5 万条轨迹、数十亿 token。普通 RL 训练中采样rollout和更新参数往往串行等待算力大量空转全异步架构让两者解耦并行模型在不停出卷子、收卷子的同时参数更新也在持续进行。对普通用户的实际好处是模型见过海量的真实任务轨迹写代码、调工具、看截图、做渗透测试策略更稳也更抗套路。四、Groupwise Agentic Grading把阅卷人本身也规模化这是 MiMo-V2.6-Flash-RL 最有意思的创新。4.1 问题0/1 分评不出好答案之间的高下在编码或 Agent 任务里测试全部通过pass很容易但通过≠优秀有的解法 20 步搞定、逻辑清晰有的绕了 200 步、充满无效操作。传统的二元奖励通过1失败0对都通过的答卷一视同仁模型学不到什么叫更优。MiMo 的解法是把奖励信号本身当做一个可 scale 的系统引入一个智能阅卷 Agentagentic grader在每个组内部对比 rollout分两步走GRSGroupwise Reward Synthesis组级奖励合成离线拿同一道题的不同 rollout 做对比分析离线为任务自动构造打分细则rubric再把细则质量与实际测试通过情况融合得到比 0/1 更细致的组内奖励。GARGroupwise Advantage Redistribution组级优势再分配在线在训练在线环节对通过测试的轨迹继续排名把 GRPO 的 advantage 权重向质量更高的解法倾斜。4.2 为什么这构成自我提升闭环注意一个关键细节阅卷的标准是拿模型自己的样本互相比较而不是拿它和某个人工写好的标准答案比。于是训练形成一个正反馈循环模型生成 → 组内对比打分 → 更优解法获得更高优势 → 策略向更短路径、更少 token收敛 → 下一轮生成质量更高 → 对比出的更优标准随之水涨船高……效果上模型不仅更准还更省完成同一任务的路径更短、消耗的 token 更少。五、如何防止刷分Aligned RL 的三道保险奖励信号越灵活模型钻空子的空间越大。MiMo 用三层机制给闭环上锁保险作用自我纠正冷启动正式 RL 前模型先学会反思并改写自己跑偏的轮次起点更干净环境加固 对抗筛选持续升级任务环境的鲁棒性主动筛出模型试图作弊的漏洞验证器交叉检查用独立的验证器verifier复核奖励防止 grader 被骗六、RL 之后还有 MOPD2蒸馏接棒难验证任务混合 RL 跑完后MiMo 还会做一道多前缀多教师在线蒸馏MOPD2, Multi-Prefix Multi-Teacher On-Policy Distillation把学生自主 rollout与前缀条件单轮 rolloutTeacher-Prefix 与 SFT-Prefix结合起来直接复用教师轨迹和 SFT 示范的历史上下文让模型只重点学习关键决策点而不必重新生成前面的所有轮次价值在于覆盖 RL 难以自动验证的高难任务奖励信号不好构造的场景。七、成绩如何一组直观的评测数据README 中给出了与多家旗舰模型的横向对比节选基准Flash-RLV2.5 Pro上代提升幅度DeepSWE v1.1代码 Agent67.919.048.9Terminal Bench 4.0终端操作28.81.527.3AutomationBench v1.0.6通用 Agent52.316.036.3CyberGym网络安全95.140.055.1OSWorld-Verified桌面操作80.8--对比 Claude Opus 5、GPT-5.6 Sol 等闭源旗舰Flash-RL 在多个 Agent 与安全基准上处于同一梯队完整榜单见 README.md 第 3 节。可以看到RL 自我提升闭环带来的提升是跨领域、跨基准的而不只是某个单项刷分。八、快速上手本地部署 MiMo-V2.6-Flash-RL想亲手体验的话先克隆仓库模型权重随仓库提供含 64 个分片 safetensorsgit clone https://gitcode.com/XiaomiMiMo/MiMo-V2.6-Flash-RL官方推荐用 SGLang 部署完整参数见 README.md 第 5 节sglang serve --trust-remote-code \ --model-path XiaomiMiMo/MiMo-V2.6-Flash-RL \ --tp 8 --dp 2 --enable-dp-attention \ --speculative-algorithm EAGLE --speculative-num-steps 3 \ --reasoning-parser mimo --tool-call-parser mimovLLM 用户也可以直接vllm serve XiaomiMiMo/MiMo-V2.6-Flash-RL。官方推荐的采样参数temperature1.0top_p0.95——由于 RL 训练鼓励多样性探索偏高温度下表现更好。仓库文件导读文件说明README.md模型简介、评测榜单、部署指南MiMo_V2_6_technical_report.pdf官方技术报告RL 细节全在这里config.json主干模型配置MoE、混合注意力、量化modeling_mimo_v2.py模型结构实现dflash/dflash.pyDFlash 推测解码草稿模型audio_tokenizer/音频分词器子模型chat_template.jinja对话模板九、写在最后这套 RL 闭环值得借鉴的三点RL 三要素一起 scale算力、环境多样性、阅卷算力同步扩展自我提升才有燃料奖励信号要可比较组内相对比较GRPO 组内智能排名GAR让通过之外还有更优闭环必须有锁自我纠正冷启动、环境加固、验证器交叉检查缺一不可。对于想复现或研究 Agent RL 的团队来说MiMo-V2.6-Flash-RL 提供了一份相当完整的开源参照系从全异步大 batch GRPO 到 agentic grading每个环节都有技术报告与模型权重可查是入门自我提升式强化学习的好素材。【免费下载链接】MiMo-V2.6-Flash-RL项目地址: https://ai.gitcode.com/XiaomiMiMo/MiMo-V2.6-Flash-RL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表