ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【ICLR 2025】REGENT:检索增强的通用智能体,不微调,也能在新环境中上下文学习|从通用智能体泛化视角

【ICLR 2025】REGENT:检索增强的通用智能体,不微调,也能在新环境中上下文学习|从通用智能体泛化视角 摘要本文解读 ICLR 2025 Oral 论文《REGENT: A Retrieval-Augmented Generalist Agent That Can Act In-Context in New Environments》。该论文提出检索增强的通用智能体 REGENT通过融合1-最近邻检索RnP、因果 Transformer 策略与距离加权插值让智能体在不做任何微调的情况下直接进入未见环境其特别之处在于把跨环境适应从重新训练变成了检索最近邻动作。实验表明在未见 MetaWorld 与 Atari 环境上归一化回报均值达到 0.602而 JAT 只有 0.019、预训练数据多 5–10 倍的 JAT (All Data) 也只有 0.040REGENT 仅 138.6M 参数、1450 万转移均小于基线为通用智能体的低成本快速适应提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景三条适应新环境的路线方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQREGENT 需要在新环境里做微调吗RnP 和 REGENT 的差别是什么为什么说插值是最关键的设计检索增强和大模型规模路线冲突吗这个方法能直接用在真实机器人上吗参考链接论文基本信息项目内容标题英文REGENT: A Retrieval-Augmented Generalist Agent That Can Act In-Context in New Environments标题中文检索增强的通用智能体不微调也能在新环境中上下文学习作者Kaustubh Sridhar, Souradeep Dutta, Dinesh Jayaraman, Insup Lee机构宾夕法尼亚大学 (UPenn) · 不列颠哥伦比亚大学 (UBC)会议ICLR 2025OralarXivarXiv:2412.04759项目网站kaustubhsridhar.github.io/regent-research背景与动机构建通用智能体的主流路线是把模型和数据做大Gato、JAT、RoboCat、MGDT 以及 RT-1/RT-2/RT-X、Octo、OpenVLA 等基础模型都依靠大规模多任务预训练获得广覆盖的能力。但论文指出真正困难的一步不是在大量训练环境上表现好而是快速适应从未见过的新环境——这恰恰是规模路线最难兑现的承诺。既有工作的局限可以点名说清楚Gato / JAT即使在新环境上做全量微调仍难以泛化到未见 Atari 游戏作者自己把原因归结为画面、操作与策略差异过大。JAT 的参数量为 192.7M预训练数据是本文的 5–10 倍但在未见环境上归一化回报只有 0.019JAT与 0.040JAT All Data。MGDT微调一个留出的 Atari 游戏需要额外100 万转移在真实机器人场景中不现实。MTTICML 2024是此前唯一能在新环境做上下文学习的方法但预训练数据是每个游戏10000个关卡、参数量 310M而且因为把整条轨迹放进上下文注意力开销随上下文平方增长rollout 被迫截断到 200 步。上下文强化学习AD、DPT、Prompt-DT能在同一环境内泛化到新目标或新任务但无法应对观测、动作与控制方式的变化。论文的动机因此非常直接检索本身就是一种强归纳偏置。在数据规模有限时最近邻方法往往能达到数据本身支持的上限而参数化模型反而需要大量调参才能拟合。作者由此先构造了一个零训练的 1-最近邻智能体 RnP再把它变成半参数化智能体 REGENT 的一部分。图 1问题设定JAT 环境——左侧训练环境有充足专家演示用于预训练右侧未见环境只提供少量演示智能体必须在没有微调的情况下直接行动研究主线从问题到结论图 10REGENT 研究主线——从质疑规模路线到检索增强的上下文适应Mermaid 流程图基准/方法设计论文在两套互补的设置里检验快速适应而不是只报一个基准的分数JAT 设置训练集为 45 个 MetaWorld 9 个 MuJoCo 52 个 Atari 39 个 BabyAI 环境预处理后共1450 万转移只有 JAT 全量数据的 1/5–1/10。未见环境为 5 个 MetaWorld、2 个 MuJoCo、5 个 Atari。该设置同时覆盖连续动作MetaWorld/MuJoCo 的本体感知向量与离散动作Atari 的四帧灰度图像 18 个动作以及 BabyAI 的文本目标观测。ProcGen 设置12 个训练环境各生成 20 条 PPO rollout、合计1200 万转移单游戏关卡数从 63 到 1565远少于 MTT 的 10000。留出 5 个未见环境同时额外评测训练环境的未见关卡——这是介于已见与完全未见之间的中间地带。评测协议的关键设计有三点。第一指标是归一化回报$(\text{return} - \text{random})/(\text{expert} - \text{random})$把不同环境的回报尺度拉平避免长时程游戏主导平均。第二未见 Atari 环境加入 $p_{\text{sticky}}0.05$ 的粘滞动作概率、ProcGen 加入 0.2用随机性压力测试是否只是重放演示。第三MetaWorld 每个配置评测 100 次 rollout、Atari 15 次、ProcGen 10 关卡 × 5 次REGENT 报告3 个训练种子的均值与标准差并对每条曲线额外微调出 96 个策略做对照。设置训练环境预训练数据未见环境动作空间基线JAT45 MetaWorld 9 MuJoCo 52 Atari 39 BabyAI14.5M 转移5 MetaWorld 2 MuJoCo 5 Atari连续 离散JAT · JAT (All Data) · JAT RAG · JAT 微调 · PEFT (IA3) · 从零 BC · DRILProcGen12 环境 × 100 万转移12M 转移5 未见环境 训练环境的未见关卡离散MTT论文报告的最好结果图 2ProcGen 问题设定——训练环境与未见环境共享观测与动作空间但视觉外观、动态与控制策略完全不同模型必须迁移决策模式而不是记住画面分类全景三条适应新环境的路线图 11适应新环境的四条路线——扩规模、微调、上下文学习与检索增强各自的天花板Mermaid 分类图方法细节方法只有两步但每一步都经过消融检验。第一步Retrieve and PlayRnP。给定当前查询状态 $s_t$从环境中少量专家演示里检索距离最近的 $n$ 个状态取其中最近的那个 $s$直接播放它对应的动作 $a$即 $\pi_{\text{RnP}}(s_t, c_t) a$。RnP 没有任何可训练参数检索结构本身既是策略也是可解释的决策依据。第二步REGENT。检索到的状态, 前一奖励, 动作三元组按与查询状态的距离升序排进上下文与查询状态、前一奖励一起送入一个因果 TransformerTransformer 的输出与 RnP 的动作按距离加权插值即 $\pi_{\text{REGENT}}^{\theta}(s_t, r_{t-1}, c_t) e^{-\lambda d(s_t, s)}\,\pi_{\text{RnP}}(s_t, c_t) (1 - e^{-\lambda d(s_t, s)})\,\sigma(\pi_\theta(s_t, r_{t-1}, c_t))$其中 $\lambda 10$$\sigma$ 在离散动作下是 softmax、在连续动作下是 MixedReLU 缩放。插值的含义是状态离检索点越近越信任检索动作越远越交给参数化策略。论文特别强调这让 Transformer 只需要学习相对检索动作的残差而不是从零预测动作因此更容易泛化。四个实现要点值得记住软化离散动作把 RnP 的独热输出改造成随距离退化的分布——距离为 0 时全部概率质量在 $a$距离为 1 时退化为均匀分布避免过早锁定单一动作。距离度量与归一化JAT 设置用 $\ell_2$ 距离图像先经冻结的 ResNet18 编码为 512 维嵌入ProcGen 用 SSIM距离统一用演示距离的 95 分位数归一化并裁剪到 $[0,1]$。检索集构造每个训练任务随机划出检索子集向量环境 100 条演示、图像环境 5 条为每个状态检索 $n19$ 个最近邻并排除与查询来自同一条演示的条目杜绝信息泄漏。训练目标对上下文内的 $n$ 个动作与查询动作联合监督主干 12 层、12 头、隐藏维度 768最大位置编码 40。图 3REGENT 架构——查询状态先做检索取得的上下文与查询一起进入因果 Transformer输出与第一个检索动作按距离加权组合底部为训练时的监督信号部署时只用查询动作附录给出的子最优界解释了为什么演示越多越好定义最孤立状态到检索集的距离 $d^{I}$ 后离散动作下的子最优间隙满足 $J(\pi^{}) - J(\pi_{\text{REGENT}}^{\theta}) \le \min{H,\ H^{2}(1 - e^{-\lambda d^{I}})}$——演示覆盖越充分$d^{I}$ 越小间隙越小这与实验观察一致。训练上还有一个反直觉的细节只训练 1 个 epoch 就早停*因为过训练会损害上下文学习能力。实验设计与结果主表给出未见环境上的归一化回报均值。三个数字最值得注意零训练的 RnP 得到 0.473REGENT 得到 0.602微调后进一步到 0.633而参数量更大的 JAT 只有 0.019数据多 5–10 倍的 JAT (All Data) 只有 0.040JAT 加上推理时检索也只有 0.165。方法未见环境均值参数量预训练数据归一化回报 ↑RnP1-最近邻无参数–00.473REGENT138.6M14.5M0.602REGENT微调后138.6M14.5M0.633JAT RAG192.7M14.5M0.165JAT (All Data)192.7M5–10×0.040JAT全量微调 / PEFT IA3192.7M14.5M0.029 / 0.063从零训练的 BC 基线–00.004ProcGen 设置上的结论同样明确。在 20 条演示的条件下REGENT 在 ninja、climber、plunder、jumper 四个未见环境上的未归一化回报分别是 8.07、6.13、14.13、6.40RnP 是 7.60、5.41、10.80、5.50而 MTT 只有 4.10、1.85、2.50、4.65——MTT 拥有 3 倍参数与 10 倍训练数据仍被 REGENT 与 RnP 全面超越。图 4未见 MetaWorld 与 Atari 环境——横轴是可用于检索或微调的演示数量Atari 按状态数量对齐REGENT 与 RnP 均显著高于所有 JAT 变体图 5未见 ProcGen 环境——四个环境上 REGENT 与 RnP 都高于 MTT 报告的最好结果且随演示数量增加继续上升图 6训练环境的未见关卡12 个中的 4 个sticky 概率 0.1——REGENT 最优、RnP 仍是强基线说明模型学到的是可迁移的决策模式而非关卡记忆图 7定性示例未见 Atari-pong——多数状态 REGENT 与 RnP 动作一致但在关键状态预测出更优动作这是插值与上下文学习起作用的直接证据消融实验给出了哪些设计真的在起负载作用的答案上下文长度包含查询状态在内的 20 个状态最优更长会继续提升但很快饱和。上下文顺序按距离升序的 current 顺序最好显著优于随机置换与逆序在 Atari 上差距最大。距离度量$\ell_2$ 优于余弦距离——观测的幅度本身携带信息而余弦距离把它丢掉了。去掉插值REGENT 在未见环境上退化为随机智能体——这是全文最关键的一条消融。图 8上下文顺序消融——检索结果如何排列本身就是设计变量按距离升序在未见 MetaWorld 与 Atari 上都最优实时性方面MetaWorld 上的检索耗时 2–8 ms、Transformer 前向约 8 ms完全满足真实机器人的控制频率这也是检索式方法与把整条轨迹塞进上下文的方法在工程上的关键差别。结果对比总结图 12结果对比总结——参数、数据与延迟三个维度的取舍Mermaid 流程图关键发现规模不是唯一通路完全不用训练、没有参数的 RnP 在未见环境上的均值是 0.473已经超过预训练数据多 5–10 倍的 JAT (All Data) 的 0.040以及其微调版本 0.052。检索增强预训练 推理时检索JAT 加上同样的检索机制JAT RAG只到 0.165远低于 REGENT 的 0.602——关键不在于用了检索而在于围绕检索做预训练。参数与数据双降REGENT 用 138.6M 参数比 JAT 的 192.7M 少约 1.4 倍ProcGen 变体 116M 约为 MTT 310M 的 1/3与 1450 万转移在未见环境上超越全量微调的 JAT0.029与 PEFT IA3 变体0.063。插值是负载组件去掉 RnP 插值后未见环境表现等同于随机智能体上下文顺序、距离度量也都有可测量的影响。适应不必牺牲本职训练环境的聚合回报上REGENT 在 MetaWorld 显著超越 JAT、Atari 超越、MuJoCo 持平、BabyAI 接近微调后未见环境均值还能从 0.602 提升到 0.633。效率可用检索 2–8 ms、前向约 8 msAtari 上约 1 万转移即可完成适应而 MGDT 微调同样任务需要 100 万转移。局限性只在同一套件内泛化未见环境仍属于训练环境所在的套件MetaWorld/MuJoCo/Atari/BabyAI/ProcGen跨套件新机器人、驾驶模拟、生物仿真没有验证。新本体适应困难两个未见 MuJoCo 环境上 REGENT 需要微调才能显著超过 RnP长时程 Atari 环境space-invaders、stargunner性能过低而被排除在图表之外。依赖少量专家演示每个新环境需要数十条演示且假设状态与动作空间已知检索质量直接决定上限。理论覆盖有限子最优界仅针对离散动作且只有上界、缺少匹配下界连续动作的理论分析留待未来工作。图 9未见 MuJoCo 本体——RnP 依然很强但要显著超越它必须微调新本体与长时程环境是作者列出的两个主要方向常见问题FAQREGENT 需要在新环境里做微调吗不需要。REGENT 的设计目标就是不微调直接部署把新环境的少量演示作为检索库每个决策步检索最近邻状态再由 Transformer 预测相对检索动作的修正量。论文中 REGENT 在没有微调的情况下就超过了所有微调基线。RnP 和 REGENT 的差别是什么RnP 是纯检索取最近的那个演示状态直接播放它的动作没有任何参数。REGENT 在 RnP 之上加了一个半参数化策略把检索动作与 Transformer 预测按距离加权插值状态离检索点越远就越依赖 Transformer——因此它同时保留了检索的可靠性与学习带来的泛化能力。为什么说插值是最关键的设计因为去掉它性能直接崩掉论文的消融显示没有 RnP 插值时 REGENT 在未见环境上退化为随机智能体。插值同时提供了两个作用——在检索可靠时保证动作正确在检索不可靠时把预测任务简化为残差学习。检索增强和大模型规模路线冲突吗不冲突是互补。REGENT 在 138.6M 参数、1450 万转移的规模上验证了检索偏置的有效性论文的结论是检索为快速适应提供了一个强大的偏置而不是规模无用。对机器人这类数据昂贵的场景检索是性价比更高的选择。这个方法能直接用在真实机器人上吗工程上是可行的MetaWorld 上检索耗时 2–8 ms、前向约 8 ms都在控制周期之内。但论文也指出两个现实约束需要每个新环境若干条专家演示新本体新的机器人形态泛化仍然困难往往仍需要微调。参考链接论文 arXiv 摘要页arXiv:2412.04759项目网站含代码与数据说明kaustubhsridhar.github.io/regent-researchJAT本文主要基线之一arXiv:2402.09844Gato通用智能体的规模路线代表arXiv:2205.06175MTT此前唯一跨环境上下文学习方法ICML 2024arXiv:2312.03801RAG检索增强生成本文范式来源arXiv:2005.11401给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表