
摘要本文解读 NeurIPS 2026 论文《Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems》。该论文提出逐智能体优势归一化agent-wise normalization把 GRPO 的全局基线换成每个 agent 自身的奖励统计 $(\mu_k, \sigma_k)$并配套统一 GPU 池的多 LLM 训练框架用以解决多智能体 LLM 系统强化学习后训练中的梯度范数爆炸问题其特别之处在于先用引理把不稳定形式化为逐 agent 梯度二阶矩的放大因子 $(\sigma_k^2 (\mu_k - \mu)^2)/\sigma^2$再用一行统计口径改动把该因子钉为 1。实验表明数学推理整体 5.6% avg16 与 4.6% pass16、多轮搜索 15.2% avg16 与 13.1% pass16其中 Qwen2.5-7B 非共享设置从 28.0/40.5 救回 43.8/58.3为多智能体 LLM 的强化学习后训练提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQDr. MAS 和 GRPO 的核心区别是什么为什么全局基线在多智能体系统里会失配非共享每个 agent 一套参数会不会更费 GPU逐 agent 归一化只对 GRPO 有效吗这套方法适合什么场景参考链接论文基本信息项目内容标题英文Dr. MAS: Stable Reinforcement Learning for Multi-Agent LLM Systems标题中文Dr. MAS多智能体 LLM 系统的逐智能体优势归一化稳定 RL作者Lang Feng1, Longtao Zheng1, Shuo He1, Fuxiang Zhang1, Bo An1机构1Nanyang Technological University, Singapore会议NeurIPS 2026arXivhttps://arxiv.org/abs/2602.08847项目网站https://github.com/langfengQ/DrMAS背景与动机多智能体 LLM 系统Multi-Agent System, MAS已经成为处理复杂任务的主流范式把一次任务拆成规划、检索、验证、综合等角色每个 agent 只负责自己擅长的子任务用角色专业化换来更强的推理与工具调用能力。但要把这种系统真正训起来业界长期缺少可靠方案。问题的根子在于分组强化学习的分组假设。GRPO 这类方法用同一分组内多个 rollout 的奖励均值 $\mu$ 与标准差 $\sigma$ 作为基线从而免去价值网络$A^i (R^i - \mu)/\sigma$。这一设计在单 agent 场景下很有效但多智能体系统里不同角色的 agent 被调用的频率、所处上下文、以及自身奖励分布都不一样。也就是说一个全局基线这个负载假设在异构 agent 上并不成立均值失配某些 agent 长期工作在高于全局均值的奖励区间例如总是负责最后一个关键决策的 verifier另一些则长期低于全局均值例如执行琐碎检索的 search agent。方差失配各 agent 奖励的离散程度也相差很大全局标准差无法同时校准所有角色。放大效应一旦失配标准化后的奖励会被系统性放大直接表现为梯度范数尖峰、训练振荡极端情况下出现 NaN。论文用实验结果把这个抽象风险落到了具体失败上在 Qwen2.5-7B 的非共享设置中原始 GRPO 因为梯度范数过高学会了完全不调用 search agent多轮搜索的平均分从 42.1 掉到 28.0、pass16 只有 40.5。这类训练把工具调用训没了的失败正是多智能体 RL 难以落地的典型症状。系统侧同样受限。veRL、OpenRLHF、ROLL、slime、AReaL 等通用框架把 rollout–train 循环做得越来越高效但它们的抽象仍以单一 LLM actor为中心verl-agent、VerlTool 开始强调多轮与工具集成多智能体方向的 MAPORL、ReMA、CoMAS 等把 group-relative 优化扩展到了 multi-agent但通常局限于同质 agent、单轮交互或依赖额外的奖励工程SPIRAL、MARSHAL 用自博弈造课程与奖励也多停留在两方协作。与本文最接近的是 ICLR 2026 的 Stronger-MASAT-GRPO它用 agent-turn-wise 分组与树式采样处理 MAS 的分组问题并额外引入了树搜索组件。真正缺的是一份既有理论解释、又能共训多个异构 LLM的配方。研究主线从问题到结论图 7研究主线——MAS 角色专业化带来的 GRPO 全局基线失配经逐 agent 统计归一化与统一 GPU 池共训在数学与搜索双任务上验证并消除梯度尖峰。基准/方法设计Dr. MAS 的设计可以概括成一次诊断、一个补救、一套系统。诊断把不稳定写成可计算的形式。对每个 agent $k$只统计它真正活跃的那些步也就是它输出动作的步得到它自己的奖励均值 $\mu_k$ 与方差 $\sigma_k^2$。在全局基线下该 agent 的梯度贡献等于标准化奖励乘以 score 函数对其取二阶矩会得到一个放大乘子自身方差加上与全局均值偏差的平方再除以全局方差。命题进一步指出只要「归一化均值偏差」或「方差比」任一项变大二阶矩就至少线性增长——梯度尖峰可以由任意一个失配的 agent 触发而随着 agent 数量增加、角色愈发异构失配的概率只会更高。补救让乘子恒等于 1。把全局基线换成 agent 自己的统计量即 $A (R - \mu_k)/\sigma_k$此时乘子等于 1二阶矩退化为该 agent 自身 score 的量级加上一个协方差修正项也就是完全由它自己的统计尺度界定。这里有一个容易被忽略的细节活跃步统计是按动作而非唯一轨迹定义的——同一轨迹里某个 agent 出现多次它的轨迹级奖励就会按出现次数重复计入统计这与目标函数「按活跃输出求平均」的口径严格一致因此 agent 之间的基线才真正可比。图 1Left算法GRPO 的全局基线会造成梯度范数不稳Dr. MAS 的逐 agent 归一化稳定 MAS 训练Right系统既有 RL 框架主要支持单一 LLM actorDr. MAS 支持多 LLM actor 共训。分类全景图 8优势归一化配置的全景分类——从 $(\mu, \sigma)$ 原始 GRPO 到 Dr. MAS 的 $(\mu_k, \sigma_k)$ 全逐智能体归一化。方法细节系统框架。见下图Dr. MAS 把多智能体与多 LLM解耦成四个部件可插拔编排orchestra定义 agent 角色与执行流支持顺序协作、条件路由与 per-agent active masking每一步由状态与上游输出决定谁被激活。Agent–模型映射逻辑 agent 被映射到物理 worker groupwg_id。共享模式下使用同一 LLM 的 agent 集合共用一个 wg、复用权重非共享模式下每个 agent 独占一个 wg可以用不同规模模型例如 7B verifier 3B search/answer。统一 GPU 池与生命周期管理所有ActorRollout后端由 Ray placement group 共置在同一个资源池用 sglang 提供推理服务后端暴露resume()与offload()只有活跃后端把权重与 KV cache 留在显存非活跃模型主动释放。这是非共享不额外占卡的关键。按 worker group 优化聚合批次按wg_id切分某个 agent 的轨迹只更新它绑定的 LLM 后端共享/非共享由映射自动处理。图 2多智能体 LLM RL 框架总览orchestrator 管理分布式 rolloutagent 映射到 LLM worker group可选 LLM 共享统一资源池调度 actor 后端做推理与逐模型优化。算法流程附录伪代码要点。训练循环分三步(A) 依据共享标志 $s$ 建立wg_to_agents_mapping并反推 rollout 用的agent_to_wg_mapping(B) 快照旧策略后并行跑 $N$ 条轨迹记录 $(i, t, k_t^i, \texttt{wg_id}, a_t^i, R^i)$ 五元组随后按 agent 在 $\mathcal{Y}_k$ 上计算 $\mu_k$、$\sigma_k$ 并写出逐 agent 优势(C) 把批次按wg_id分片各后端用自己的优势做 clip 更新可选 KL 正则。三段里只有 (B) 的第二小步是本文的算法贡献其余是系统实现——这正是改一行统计口径的含义。实验设计与结果评测协议。两个任务、四类模型数学推理solver verifier 两 agent 循环最多 2 轮训练语料 DAPO-Math评测 AIME24、AIME25、AMC23、MATH500、Minerva、OlympiadBench指标 avg16 / pass16模型 Qwen3-4B 与 Qwen3-8B。多轮搜索verifier → search / answer 三 agent 层级流水线协议沿用 Search-R1检索器 E5分组大小 5、最多 4 轮训练用 NQ HotpotQA 混合评测 NQ、TriviaQA、PopQA、HotpotQA、2Wiki、MuSiQue、Bamboogle模型 Qwen2.5-3B 与 Qwen2.5-7B。训练采用二值规则奖励成功 1 / 失败 0无效动作惩罚系数 0.1数学与 0.01搜索actor 学习率 $1\times10^{-6}$全部实验在 NVIDIA H100 上完成。主结果数学取 Qwen3-8B搜索取 Qwen2.5-3B设置Math avg16Math pass16Search avg16Search pass16GRPO · 共享57.872.134.852.9Dr. MAS · 共享62.3(4.5)77.6(5.5)36.7(1.8)53.8(0.9)GRPO · 非共享58.172.234.546.7Dr. MAS · 非共享60.7(2.6)74.2(2.0)36.9(2.4)53.0(6.3)跨全部模型与设置数学整体提升 5.6 个百分点的 avg16 与 4.6 个百分点的 pass16搜索整体提升 15.2 与 13.1 个百分点。最戏剧性的对比在 Qwen2.5-7B 非共享GRPO 的 28.0/40.5 被 Dr. MAS 拉回43.8/58.3不仅远超原始基线也超过了单智能体基线与共享设置。消融把均值与方差分开看Qwen2.5-7B非共享搜索任务归一化配置avg16pass16$(\mu, \sigma)$ 原始 GRPO28.040.5$(\mu_k, \sigma)$ 只换均值39.1 (11.1)53.5 (13.0)$(\mu, \sigma_k)$ 只换方差42.9 (14.9)57.6 (17.1)$(\mu_k, \sigma_k)$ Dr. MAS43.8(15.8)58.3(17.8)单独换掉均值或方差都已大幅改善其中换方差的收益更大说明 agent 之间的差异更多体现在优势的离散度而不是平均水平上两者都换取得最佳。把逐 agent 归一化叠加到另一个分组目标 GSPO 上平均分从 34.0 提升到37.17 个数据集全部提升说明它是一个可叠加的稳定机制而非只对 GRPO 生效的补丁。图 3Left数学任务的两 agent 循环——solver 提出/精修解verifier 决定接受或要求再一轮Right多轮搜索的三 agent 层级——顶层 verifier 选择性调用 search 或 answer。梯度范数是最直接的证据。在三 agent 搜索、非共享、Qwen2.5-3B 的设置下GRPO 的 search agent 早期就出现大幅尖峰verifier 与 answer 也有明显峰值Dr. MAS 三条曲线全程平滑低位。图 4三 agent 搜索编排、LLM 非共享Qwen2.5-3BGRPO 与 Dr. MAS 的训练准确率与逐 agent 梯度范数对比。把模型放大到 Qwen2.5-7B、并且非共享时问题从尖峰升级成爆炸search agent 的梯度范数迅速冲到 80 以上并最终变成 NaN。图 5Qwen2.5-7B 非共享下的梯度爆炸search agent 的梯度范数迅速冲到 80 以上并导致 NaNDr. MAS 全程保持低位收敛。异构部署则回答了这套系统实际怎么用。把 7B verifier 与两个 Llama-3.2-3Bsearch/answer组合性能与全 7B 同构方案基本持平每轨迹 token 数相当但延迟降低 31.6%、按 OpenRouter 市场价估算的 API 成本降低 41.8%。图 6同构全 7B与异构7B verifier 3B search/answer的搜索任务性能与效率对比性能与每轨迹 token 数相当延迟降 31.6%、成本降 41.8%。与 Stronger-MAS 的对比Qwen3-8B 数学推理共享设置下 Dr. MAS 三项全面胜出非共享下在 AIME25 与 OlympiadBench 更好AIME24 落后。需要注意这不是纯算法对等比较——对方包含 tree search 等额外组件。方法设置AIME24AIME25OlympiadBenchStronger-MAS共享50.035.256.8Dr. MAS共享54.839.459.3Stronger-MAS非共享57.040.056.6Dr. MAS非共享44.641.559.0训练成本附录资源表搜索任务 3B 共享 4×H100 约 12h、非共享约 13h7B 共享 8×H100 约 25h、非共享约 26h异构配置 8×H100 约 16h。数学任务 4B 为 4×H100 约 35h / 38h8B 为 8×H100 约 37h / 42h。结论很明确非共享并不额外占卡额外开销来自后端切换时的权重同步与 cache 清理。结果对比总结图 9结果对比总结——Qwen2.5-7B 非共享搜索从 28.0/40.5 提升到 43.8/58.3梯度范数不再出现 NaN 尖峰异构部署进一步带来延迟与成本收益。关键发现整体增益明确数学 5.6% avg16 / 4.6% pass16多轮搜索 15.2% avg16 / 13.1% pass16覆盖两个模型族、四个模型规模、共享与非共享两种设置。非共享收益更大Qwen3-4B 数学非共享从 57.5/74.4 提升到 61.1/77.7参数独立后 agent 行为分布分歧更大逐 agent 校准因此更关键。难题上增幅最大Qwen3-8B 共享在 AIME24 上从 42.7/66.7 跳到 54.8/80.0长链推理最怕高方差梯度。失效被精准救回Qwen2.5-7B 非共享时 GRPO 学会完全不调用 search agent28.0/40.5Dr. MAS 恢复到 43.8/58.3pass16 提升 17.8 个百分点。方差项比均值项更关键消融中只换方差得 42.9/57.6只换均值得 39.1/53.5全换得 43.8/58.3。可叠加、可异构叠加到 GSPO 上平均分 34.0 → 37.1异构部署延迟降 31.6%、成本降 41.8%而 GPU 占用与非共享完全一致。局限性未穷尽不稳定来源跨 agent、跨轮次的信用分配问题仍然开放逐 agent 归一化只消除了全局基线失配这一主项。评测范围有限只覆盖两条代表性工作流数学求解-验证、三 agent 搜索和两个开源模型族对更广的 agent 架构、任务类型与更大规模模型的泛化性仍待验证。系统开销存在非共享通过后端切换实现权重同步与 cache 清理带来额外训练时间数学 8B 约 37h → 42h。对比并非严格对等与 Stronger-MAS 的比较中对方含 tree search 等额外组件非共享设置下 AIME24 仍落后44.6 对 57.0。常见问题FAQDr. MAS 和 GRPO 的核心区别是什么只差一处基线统计口径。GRPO 用整个分组所有 agent 的所有活跃步的全局均值与标准差做归一化Dr. MAS 改成每个 agent 只用自己的活跃步统计$(\mu_k, \sigma_k)$即 $A^{i,k}_{\mathrm{agent}} (R^i - \mu_k)/\sigma_k$。理论上这把逐 agent 梯度二阶矩的放大因子从 $(\sigma_k^2 (\mu_k - \mu)^2)/\sigma^2$ 钉为 1。为什么全局基线在多智能体系统里会失配因为奖励分布是异构的。各 agent 被调用的频率、上下文与职责不同有的长期高于全局均值、有的长期低于而全局标准差也无法同时匹配所有角色的奖励离散度。失配一旦发生标准化奖励就会被系统性放大表现为梯度范数尖峰。非共享每个 agent 一套参数会不会更费 GPU不会。Dr. MAS 把所有 LLM worker group 共置在统一 GPU 池中每个后端通过resume()/offload()动态进出显存所以非共享与共享占用的卡数相同额外只是后端切换带来的权重同步与 cache 清理时间例如数学 8B 约 37h 变 42h。逐 agent 归一化只对 GRPO 有效吗不是。论文把 Dr. MAS 叠加到 GSPO 上在 Qwen2.5-3B 非共享的多轮搜索中平均分从 34.0 提升到 37.17 个数据集全部提升说明它是一种与具体分组目标正交的稳定机制。这套方法适合什么场景适合角色异构、调用频率不均的合作型多智能体 LLM 系统例如层级式检索问答verifier/search/answer、求解-验证循环solver/verifier以及需要把不同规模模型混在一个系统里的成本敏感部署。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2602.08847项目主页与代码https://github.com/langfengQ/DrMASGRPODeepSeekMathhttps://arxiv.org/abs/2402.03300GiGPOhttps://arxiv.org/abs/2505.10978Search-R1https://arxiv.org/abs/2503.19470veRL / HybridFlowhttps://arxiv.org/abs/2409.19256给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件