ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Salesforce:精准定位多轮工具调用训练步骤

Salesforce:精准定位多轮工具调用训练步骤 标题Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use来源arXiv, 2609.24985v1️文章简介研究问题在多轮工具使用任务中如果最终结果失败我们如何知道具体是哪一步模型调用出了问题并值得去训练优化而不是被后续的随机性干扰主要贡献提出了一种名为Critical-State RL的方法能在训练前诊断出哪些步骤具有真正的可训练信号并通过局部训练显著提升模型在复杂工具调用任务上的表现。重点思路定义关键状态诊断标准论文认为一个步骤是否值得训练取决于其奖励变化是否由当前动作决定而非后续步骤的随机噪声。为此设定了三个条件动作充分性动作影响结果、提升空间优于参考策略和可训练性动作间存在奖励差异。嵌套采样分离信号与噪声为了区分“动作带来的奖励变化”和“后续延续产生的噪声”作者采用嵌套采样技术。首先固定当前的上下文和前缀采样多个候选动作然后对每个固定的动作多次重新采样其后续的交互过程。通过计算动作间奖励均值的方差剔除后续随机性的干扰从而量化该步骤的真实学习信号。基于诊断的局部强化学习根据诊断结果只对被选中的那个特定模型调用进行策略优化而轨迹中的其他步骤仅提供上下文或奖励信号不接收梯度更新。这种方法避免了全轨迹训练带来的信用分配模糊问题。分析总结诊断准确性验证在BFCL基准测试的四格实验中该方法能准确识别不同任务类型下的关键步骤。对于“缺失函数”任务它选择工具可用后的恢复步骤进行训练对于“缺失参数”任务它选择提供参数前的决策步骤。性能显著提升训练被诊断选中的步骤带来了显著的性能增益。例如在缺失函数任务中准确率提升了约14个百分点而在缺失参数任务中也有明显提升。相反如果训练未被选中的替代步骤性能则持平甚至下降。泛化能力强该方法不仅适用于Gemma模型还成功应用于Nemotron模型的重复调用避免、内存管理等不同场景证明了其诊断框架在不同任务和模型配置下的通用性和有效性。个人观点论文像医生一样先“诊断”再“治疗”利用统计学中的方差分解思想将动作本身的贡献从环境随机性中剥离出来解决了多轮交互中信用分配的难题。
返回列表