ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【强化学习】Hands-on Modern RL项目实践|Agentic RL与多轮强化学习

【强化学习】Hands-on Modern RL项目实践|Agentic RL与多轮强化学习 前言过去两年以 RLHF、DPO、GRPO 为代表的方法把大语言模型从会说话的模型打磨成了会对齐人类偏好的助手——ChatGPT、Claude、DeepSeek 等主流对话系统本质上都建立在单轮强化学习Single-Turn RL的范式之上给模型一个 prompt模型一次性吐出一段完整回答奖励模型给出一个分数策略据此更新。这个范式简单、稳定也确实有效。但当我们把 LLM 放进真实的智能体Agent场景中——让它查一查明天的天气再安排行程、让它读一段报错日志再修复代码、让它反复检索资料再撰写研究报告——单轮范式立刻捉襟见肘。真实任务往往需要观察-决策-行动-再观察的多次循环中间步骤本身没有对错之分只有走到最后才能判断整条路径是否正确。这正是多轮强化学习Multi-Turn RL也常被称为 Agentic RL要解决的问题。本文尝试沿着提出问题 → 建立形式化框架 → 拆解关键组件 → 讨论工程与训练难点这条主线把多轮 RL 讲透。一、为什么单轮范式不够用先把单轮 RL 的假设摆出来。在传统的偏好对齐训练可以称为 PBRFTPreference-Based RL Fine-Tuning中状态只有初始 prompts0s_0s0​不存在后续状态。动作一次性生成的完整回答ay∼πθ(y∣s0)a y \sim \pi_\theta(y \mid s_0)ay∼πθ​(y∣s0​)。转移生成完就结束相当于一个确定性的终止转移P(s′∣s,a)δ(s′−sterminal)P(s \mid s, a) \delta(s - s_{\text{terminal}})P(s′∣s,a)δ(s′−sterminal​)。目标最大化单步期望奖励JPBRFT(θ)Es0, y∼πθ[r(s0,y)] J_{\text{PBRFT}}(\theta) \mathbb{E}_{s_0,\, y \sim \pi_\theta}\big[r(s_0, y)\big]JPBRFT​(θ)Es0​,y∼πθ​​[r(s0​,y)]这套框架能很好地刻画写一首诗“回答一个问题这类一次性生成任务却无法刻画连续调用搜索引擎缩小范围”写代码-跑测试-改代码这种需要与外部环境反复交互、且中间状态会因动作而改变的任务。原因很直接没有中间状态单轮范式假定生成即终止而智能体在完成任务前状态会随着工具返回、环境反馈不断演化。动作空间太窄动作被限定为生成下一个 token而智能体的动作还包括调用搜索引擎“执行一段代码”点击网页上的某个按钮等作用于外部世界的操作。奖励无法在每一步给出中间步骤往往没有明确的对错标准比如这次检索算不算好很难单独打分只有整条决策轨迹走到终点后才能依据最终结果判断成败。这也解释了为什么 ReAct、Toolformer 这类基于提示词或监督微调的方法虽然能让模型学会调用工具却难以让模型学会在什么情境下用什么策略调用工具——它们本质上是在模仿人类演示中的调用模式而不是通过试错找到某个具体上下文下的最优策略。比如搜索查询该怎么构造什么时候该继续挖细节、什么时候该收手总结代码测试没通过是该继续调试还是切换思路这些决策高度依赖上下文很难靠静态的示例覆盖所有情况而这恰恰是强化学习试错学习的强项。二、多轮 RL 的形式化把智能体放进部分可观测的决策过程2.1 从 MDP 到 POMDP多轮 RL 把整个智能体任务重新建模为一个往往是部分可观测的序列决策过程。与单轮范式的静态三元组(prompt,completion,reward)(prompt, completion, reward)(prompt,completion,reward)不同一条多轮轨迹更像一棵带状态的对话树模型自己生成的文本、工具调用参数、工具返回结果、环境状态变化层层嵌套在一起。沿用前面的记号多轮 RL 的核心要素可以逐条对照单轮范式来看动作空间不再只是生成完整回答而是拆分为文本动作与工具动作两类at∈{attext, attool} a_t \in \{a_t^{\text{text}},\ a_t^{\text{tool}}\}at​∈{attext​,attool​}其中attexta_t^{\text{text}}attext​是模型生成的思考过程或最终回答attoola_t^{\text{tool}}attool​是一次工具调用例如查询搜索引擎、运行一段代码、调用计算器。这个拆分很关键它意味着策略网络的输出既要会说话又要会做事。状态转移不再是确定性地直接终止而是依赖动作和环境动态演化st1∼P(st1∣st,at) s_{t1} \sim P(s_{t1} \mid s_t, a_t)st1​∼P(st1​∣st​,at​)举个例子一旦模型调用了搜索工具下一时刻的状态就会把搜索结果纳入进来模型看到的上下文因此发生了实质性变化这也是为什么把这个过程看作部分可观测决策过程POMDP更贴切——模型无法看到环境的全部真实状态只能通过观测工具返回、环境反馈不断更新自己对当前局势的认知。奖励函数可以是稀疏的、稠密的或者两者的混合r(st,at) r(s_t, a_t)r(st​,at​)稀疏奖励只在任务最终完成时给一次分比如最终答案是否正确1/0稠密奖励每一步都给出反馈比如工具调用成功 0.1格式正确 0.05折扣因子γ∈[0,1]\gamma \in [0, 1]γ∈[0,1]用来权衡当前反馈与长期回报的重要性。目标函数则从单步期望奖励升级为对整条轨迹回报的期望JAgentic(θ)Eτ∼πθ[∑t0Tγt r(st,at)] J_{\text{Agentic}}(\theta) \mathbb{E}_{\tau \sim \pi_\theta}\Big[\sum_{t0}^{T} \gamma^{t}\, r(s_t, a_t)\Big]JAgentic​(θ)Eτ∼πθ​​[t0∑T​γtr(st​,at​)]这里τ(s0,a0,s1,a1,…,sT,aT)\tau (s_0, a_0, s_1, a_1, \dots, s_T, a_T)τ(s0​,a0​,s1​,a1​,…,sT​,aT​)是一整条包含若干轮交互的轨迹。策略优化的对象从这一次回答好不好变成了这一整条决策路径走得好不好。2.2 Agent Loop驱动多轮交互的核心循环把上述形式化落到工程实现上驱动它运转的引擎通常被称为Agent Loop智能体循环。它和最基础的强化学习循环在本质上是一致的——观察状态、选择动作、获得反馈、进入下一状态——区别只在于动作空间从离散的几个选项扩展成了文本生成 / 工具调用 / 代码执行这样的混合空间观测(Observation) → 策略生成动作(文本 / 工具调用 / 代码) ↑ ↓ 环境返回结果(搜索结果/执行输出/API响应) ← 环境执行动作这个看似简单的扩展带来的却是训练方法论上的整体升级因为动作可能真实地作用于外部世界读写文件、访问网页、执行代码“如何让智能体安全地探索”“如何验证一整条轨迹的正确性”“如何把功劳/过错分配到具体某一步”这些都是单轮 RL 里不存在、多轮 RL 里绕不开的新问题。三、奖励怎么给ORM 与 PRM 之争在单轮 RL 里奖励模型只需要给整段回答打一个分数即可。但在多步交互中奖励该在哪一步给、给多少变成了一个直接决定训练信号质量的关键设计选择。业界大体分成两条路线ORMOutcome Reward Model结果奖励模型只依据任务最终是否成功来打分中间步骤不单独评价。优点是简单、不容易被讨好中间过程的行为钻空子缺点是奖励非常稀疏轨迹越长某一步动作对最终成败的贡献就越难被准确追溯。PRMProcess Reward Model过程奖励模型对轨迹中的每一步甚至每一个推理片段单独给出评价。优点是反馈更稠密、训练信号更及时缺点是构造高质量的过程级标注本身成本很高而且看起来好的步骤未必真的对最终结果有贡献。这也直接引出了多轮 RL 中最核心、也最棘手的理论难题——信用分配Credit Assignment。四、时序信用分配多轮 RL 最难啃的骨头评价某一步做得好不好远比想象中难一个看起来很成功的步骤比如顺利调用了工具、拿到了返回结果可能最终把整个任务导向失败——因为拿到的信息本身是错的一个看起来很糟糕的步骤比如代码执行报错反而可能非常有价值——它让智能体意识到此路不通从而及时调整策略。如果只用轨迹末端的最终奖励去更新策略对应上面的 ORM 思路模型很难知道七八轮交互中究竟是哪一步做对了或做错了而如果强行给每一步都打分对应 PRM 思路又容易引入标注噪声甚至让模型学会讨好评分器而不是解决真实任务。如何在这两者之间取得平衡是当前多轮 RL / Agentic RL 研究中最活跃的方向之一。五、工程实现中的两个关键细节理论形式化之外多轮 RL 真正跑起来时还有两个容易被忽视、却直接影响训练效果的工程要点。5.1 Loss Mask模型只为自己生成的内容负责一个常见的实现误区是把整条多轮轨迹里的所有 token 都无差别地纳入 loss 计算。但工具返回的结果比如搜索引擎给的网页摘要、代码执行器返回的报错信息根本不是模型生成的模型不应该为这部分内容的好坏负责。对应的解决方案是Loss Mask损失掩码模型自己生成的 token 标记为参与训练mask1工具返回的 token 标记为不参与训练mask0。在检索增强的场景下这个思路也被称为Retrieved Token Masking检索 token 掩码——在计算梯度时只对模型自身生成的 token 更新参数屏蔽外部工具返回的 token。这样设计的合理性在于搜索结果的质量不是模型能控制的变量不应该因为搜索引擎返回了低质量结果就惩罚模型本身。5.2 环境接口解耦把怎么训练和环境长什么样分开多轮 RL 的训练系统还需要面对一个现实问题不同任务对接的环境千差万别搜索引擎、代码执行器、网页、游戏如果环境实现和 rollout/训练逻辑强耦合换一个工具环境就要动一遍训练代码维护成本极高。比较通用的做法是把环境接口收敛成一组最小方法集合例如只暴露reset/step/format_observation三个接口让环境实现与训练逻辑彻底解耦。这个设计原则听起来理所当然但在实际项目里环境与训练代码互相纠缠仍然是一个高频出现的工程债务来源。六、一个具体案例Search-R1 如何让模型学会搜索以检索增强推理为例Search-R1 是较早证明让 LLM 在 RL 训练中自主学会调用搜索引擎这条路线可行的开源工作。它与传统 RAG 最大的区别在于不是靠提示词教模型遇到不确定的问题就去搜索而是让模型通过试错和奖励信号自己摸索出什么时候搜、搜什么、搜几轮才是最优策略。其中体现的正是搜索引导推理Search-guided Reasoning——模型可以先粗略搜一轮根据返回结果发现新线索再针对性地细化查询进行第二轮检索这是一个动态的、依赖上下文的策略性过程而不是固定次数的机械检索。训练完成后模型往往会表现出先搜一次判断信息够不够、不够再补一次搜索这样自发的行为模式这正是多轮 RL 相比监督微调的核心增益策略是被试错验证出来的而不是被示例数据模仿出来的。七、多轮 RL 涉及的能力谱系如果把视角从单一场景拉远一点学界通常从两个维度去梳理多轮 / Agentic RL 的研究版图一条是按核心能力划分——规划Planning、工具使用Tool Use、记忆Memory、推理Reasoning、自我改进Self-Improvement、感知Perception另一条是按任务场景划分——搜索问答、代码修复、网页操作、多智能体协作等。无论从哪个维度切入,最终都会回到本文第二节给出的那套形式化骨架:状态如何演化、动作空间如何扩展、奖励如何设计、信用如何分配。八、小结多轮强化学习Agentic RL相较单轮对齐范式的核心跃迁,可以浓缩成一句话:从这一次回答好不好,变成这一整条决策路径走得好不好。具体体现在四个方面:维度单轮 RLPBRFT多轮 RLAgentic RL状态仅初始 prompt无后续状态随动作和环境反馈持续演化本质是 POMDP动作空间一次性生成完整回答文本生成 工具调用等混合动作空间转移生成即终止依赖当前状态和动作的动态转移奖励单步、整段打分稀疏/稠密混合涉及 ORM vs PRM 的设计取舍目标函数最大化单步期望奖励最大化整条轨迹的折扣累积回报核心难点偏好建模、奖励设计信用分配、长时程规划、工具调用的探索效率多轮 RL 让大模型从对话助手迈向能在真实环境里持续行动、调用工具、根据反馈修正策略的自主智能体这既是当前 RLVR、Agentic AI 浪潮的核心技术支柱也是把强化学习从实验室里的玩具环境真正推向搜索、编程、具身智能等复杂现实任务的关键一步。信用分配、奖励稀疏性、训练系统的工程复杂度仍然是这条路上尚未被完全解决的硬骨头也正是这个方向接下来几年最值得关注的战场。参考与延伸阅读Search-R1Jin et al., “Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning”Zhang et al. 关于 Agentic RL 的综述工作开源课程 Hands-on Modern RLwalkinglabs中关于 Agentic RL 形式化与工程实践的章节。
返回列表