ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Salesforce:提升终端智能体泛化能力

Salesforce:提升终端智能体泛化能力 标题Learning Generalizable Behaviors for Terminal Agents来源arXiv, 2608.22631v2️文章简介研究问题如何通过强化学习有效提升终端智能体在合成环境训练后的跨域泛化能力而非仅仅依赖增加环境数量主要贡献论文提出“智能体组合泛化”假说并据此设计了RIVER训练方案通过过滤低质量环境和增强验证器信号显著提升了模型性能与训练效率。重点思路提出智能体组合泛化假说认为预训练和SFT主要赋予模型底层原子技能如具体命令执行而RL主要塑造高层决策行为如规划、验证、路由技能。泛化能力源于RL学会如何组合和调用已有的底层技能。设计RIVER训练流程包含环境过滤和验证器增强两个核心步骤。首先基于规则和大模型作为Oracle过滤掉验证器弱、指令不匹配或存在答案泄露的低质量合成环境其次引入过程级行为正则化对重复循环等无效行为施加惩罚优化奖励信号。实施分层训练策略对于基础较弱的模型先使用覆盖广泛原子技能的SFT数据进行微调确保具备足够的底层能力储备再进行RL训练以学习高层行为模式。分析总结RL主要重塑行为而非新增技能实验显示RL训练前后模型展示的底层技能集合高度相关但任务与技能的组合结构发生显著变化证明RL主要改变了技能的调度方式。行为特征比技能存在更预测成功轨迹层面的高层行为特征如完成前验证对任务成功的预测能力远强于单一技能的存在与否且这种关联性在RL训练后增强。高质量信号优于大规模数据仅使用不到30%经过RIVER筛选的高质量TMax环境在2B至27B不同规模模型上相比全量数据训练RL增益平均提升106%Terminal-Bench-Lite和30%Terminal-Bench-v2.1。行为正则化有效抑制捷径引入针对重复行为的惩罚项能显著减少无效交互循环提升整体性能而单纯奖励验证行为并未带来额外增益说明需关注因果相关的行为模式。个人观点论文跳出了单纯堆砌合成数据规模的常规思路揭示了RL在智能体训练中的本质作用是“行为塑造”而非“技能习得”。
返回列表