ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【CVPR 2025】CoT-VLA 论文解读:子目标图像即视觉思维链,让 VLA 先用无标注视频学会想象|从机器人数据配方视角

【CVPR 2025】CoT-VLA 论文解读:子目标图像即视觉思维链,让 VLA 先用无标注视频学会想象|从机器人数据配方视角 摘要本文解读 CVPR 2025 论文《CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models》。该论文提出以子目标图像作为视觉思维链的视觉-语言-动作模型VLA框架通过融合自回归图像生成、混合注意力机制与动作块预测让机器人在动手之前先在像素空间里想出未来状态其特别之处在于子目标预测不需要动作标注因而可以把 EPIC-KITCHENS-100、Something-Something V2 等无动作视频纳入预训练。实验表明LIBERO 仿真平均成功率 81.1%、Franka-Tabletop 真机平均 78.8%分别超过 OpenVLA 的 76.5% 与 67.3%相对提升约 17%并让 Long 长时序套件从 53.7% 提升到 69.0%为具身智能的推理式策略与数据配方提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQCoT-VLA 的视觉思维链和语言思维链有什么区别为什么子目标图像预测可以不用动作标注混合注意力解决了什么问题7 倍推理开销可以接受吗这个方法在真机上到底比 OpenVLA 强多少复现需要多少算力参考链接论文基本信息项目内容标题英文CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models标题中文CoT-VLA把「子目标图像」变成 VLA 的视觉思维链作者Qingqing Zhao、Yao Lu、Moo Jin Kim、Zipeng Fu、Zhuoyang Zhang、Yecheng Wu、Zhaoshuo Li、Qianli Ma、Song Han、Chelsea Finn、Ankur Handa、Ming-Yu Liu、Donglai Xiang†、Gordon Wetzstein†、Tsung-Yi Lin†† 为共同指导机构NVIDIA、Stanford University、MIT会议CVPR 2025pp. 1702–1713arXivhttps://arxiv.org/abs/2503.22020项目网站https://cot-vla.github.io/背景与动机视觉-语言-动作模型VLA在过去两年成为机器人学习的默认范式以预训练的视觉语言模型为骨干在机器人演示数据上微调把当前的画面观测与自然语言指令直接映射成机械臂动作。OpenVLA 用 700 万条 Open X-Embodiment 轨迹训练出 7B 的开源策略Octo 证明了通用策略可以在没有视觉语言模型初始化的情况下跨本体工作Diffusion Policy 则把动作生成写成扩散过程。这些方法的共同点是只做输入到输出的直接映射给一张图、一句话立刻回归动作。问题也正出在这里。真实的操作任务是长时序的把玉米放进碗里需要先靠近、再对准、再闭合夹爪每一步都取决于上一步的结果。缺少中间推理步骤策略就没有时序规划能力容易被画面里的视觉线索牵着走。论文在失败案例分析里发现当不同任务的初始画面高度相似时例如 LIBERO-Spatial 套件基线方法会照着画面执行而不是按照语言指令执行——它看到了什么就做什么而不是听懂要求再动手。语言模型早就给出了答案思维链Chain-of-Thought让模型先写出中间推理步骤再给出最终答案。把这个思路搬到机器人上已有工作用的是语言计划、关键点轨迹或目标边框这些表示都需要额外的预处理管线而且抽象程度高、信息有损。CoT-VLA 的选择更直接用未来的图像作为中间推理步骤。子目标图像本身就存在于每一条机器人演示和每一段人类视频里不需要额外标注也不需要额外模型——它只需要模型学会预测未来的自己。更关键的是数据侧的动机。机器人演示数据的规模受限于采集成本而互联网上的第一人称与第三人称操作视频是海量的。子目标图像预测不依赖动作标注因此这类无动作视频可以进入预训练——这正是论文标题里Visual Chain-of-Thought落到工程上的实际价值。研究主线从问题到结论基准/方法设计CoT-VLA 的设计原则可以用一句话概括把中间推理放进像素空间放进同一个 Transformer再把它接上无标注视频。这三件事分别对应它的三个设计决策——子目标图像作为中间变量、混合注意力作为系统级机制、无动作视频作为数据杠杆。具体到生成过程模型先根据当前观测与语言指令预测未来第 $n$ 帧的子目标图像 $\hat{s}_{tn}$再以观测、指令和这张子目标图像为条件生成一段长度为 $m$ 的动作块 ${\hat{a}_t, \dots, \hat{a}_{tm}}$其中动作块长度取 $m10$。执行完这段动作后重新观测进入下一轮——这是一个闭环的视觉伺服过程而不是开环地预测一整条轨迹。四个设计要素可以横向对照设计要素具体做法带来的收益视觉思维链自回归生成未来第 $n$ 帧的子目标图像中间推理可解释且不需要动作标注混合注意力文本/图像 token 走因果注意力动作 token 走全注意力生成保持时序一致动作可并行解码动作表示每个动作维度分 256 桶、动作块长度 10把推理频率与图像生成开销压到可控范围数据配方OpenX 7-DoF 子集 EPIC-KITCHENS-100 Something-Something V2把无动作视频变成可用的预训练信号分类全景方法细节骨干模型。CoT-VLA 建立在 VILA-U 之上——一个统一理解与生成的多模态基础模型。VILA-U 的统一视觉塔把图像编码成离散 token并用残差量化配合深度 Transformer 逐层预测残差 token因此同一个自回归语言模型既能生成图像 token也能生成动作 token。论文在此之上优化三个部分语言模型骨干、投影器和深度 Transformer而视觉塔保持冻结。训练目标。总损失是动作损失与视觉损失之和$\mathcal{L} \mathcal{L}_{action} \mathcal{L}_{visual}$。视觉损失只作用在子目标图像对应的位置上动作损失只使用机器人演示数据。训练序列有两种形式$(l, s_t, s_{tn})$ 用来学习视觉预测$(l, s_t, s_{tn}, a_t, \dots, a_{tm})$ 用来学习动作生成。这意味着模型在同一套参数里同时承担想象未来和生成动作两件事。混合注意力。文本与图像 token 使用因果注意力保证自回归生成的时序一致性动作 token 使用全注意力让 7 个动作维度一次性并行解码。论文用 $[x]$、$[\theta]$、$[g]$ 等特殊 token 标记动作维度两套注意力共存于同一个 Transformer而不是拆成两个模型再拼接。动作表示与数据配方。每个动作维度独立离散化成 256 个桶桶宽由训练数据动作分布的第 1 到第 99 百分位均匀划分并复用词表中最低频的 256 个 token。预训练数据方面机器人演示取自 Open X-Embodiment 的 7 自由度单臂、第三人称子集另外混入两份无动作视频各占 3.45%。预训练在 12 个节点、每个节点 8 张 A100 上共消耗 11000 GPU 小时而下游任务的微调只需要单节点 10 到 24 小时。实验设计与结果评测覆盖三个平台LIBERO 仿真Spatial / Object / Goal / Long 四个套件每套件 10 个任务、每任务 50 条人类遥操作演示每套件 500 次试验 × 3 个随机种子、Bridge-V2 真机6 自由度 WidowX45000 条语言标注轨迹考察视觉、运动、语义、语言四类泛化每类 10 次试验、Franka-Tabletop 真机桌上 Franka Panda6 个任务每任务仅 10 到 150 条演示。基线包括 Diffusion Policy、Octo、OpenVLA 与 SUSIE。方法平均 ↑Spatial ↑Object ↑Goal ↑Long ↑Diffusion Policy72.478.392.568.350.5Octo微调75.178.985.784.651.1OpenVLA微调76.584.788.479.253.7CoT-VLA-7B81.187.591.687.669.0上表为 LIBERO 主结果数值是成功率百分数3 个种子 × 每个套件 500 次试验的均值标准误最大 1.4pp。CoT-VLA 在平均、空间、目标和长时序四个口径上都取得最好成绩其中 Long 套件比 OpenVLA 高出 15.3 个百分点物体套件上 Diffusion Policy 的 92.5% 仍然是最好成绩。真机结果同样清晰。Bridge-V2 上CoT-VLA 在运动泛化高度变化场景拿到 60%、在语义泛化未见物体拿到 50%都是最高视觉泛化杂乱环境65%、语言泛化指令跟随70%仅次于 OpenVLA 的 75%。Franka-Tabletop 上平均 78.8%相对先前最好的 VLA 提升约 17%值得注意的是 Diffusion Policy 在部分单指令任务上很强例如把玉米放进碗里达到 93.3%但在多指令任务上明显退化说明少样本条件下的语言泛化是通用策略真正的分水岭。消融实验给出三条独立结论。第一动作块、混合注意力与视觉思维链每一步都带来提升LIBERO-Spatial 从 67.5% 依次升到 73.3%、81.8%、87.5%LIBERO-Goal 从 54.9% 依次升到 74.9%、79.7%、87.6%说明三个组件各自在起负载作用。第二预训练把 Franka-Tabletop 的成功率从 53.7% 提升到 78.8%相对提升 46.7%而这份预训练数据里包含没有动作标注的视频。第三把模型自己生成的子目标换成人工演示里的真值子目标两个分布外长时序任务的成功率从 20% 和 0% 提高到 60% 和 40%各自提升 40 个百分点——视觉推理的质量直接决定了动作执行的质量。附录还给出了预训练数据的完整配比与超参数可以对照着看这套无动作视频杠杆的实际规模数据权重子目标间隔 $n$Bridge24.14%5–10RT-16.90%5–10TOTO10.34%20–24VIOLA10.34%15–20RoboTurk10.34%1–2Jaco Play / UR5 / Fanuc各 10.34%10–15 / 5–10 / 10–15Something-Something V23.45%5–7EPIC-KITCHENS-1003.45%5–7结果对比总结关键发现推理质量决定执行上限真值子目标让两个分布外任务从 20%/0% 提升到 60%/40%各 40pp这是全文最强的因果证据。三个组件各自独立起负载动作块、混合注意力、视觉思维链在 LIBERO-Spatial 上依次贡献 67.5 → 73.3 → 81.8 → 87.5。无动作视频真的有用预训练把 Franka-Tabletop 从 53.7% 提升到 78.8%相对 46.7%而预训练数据里有 6.9% 来自无动作视频SSv2 3.45% EPIC-KITCHENS 3.45%。语言泛化仍是短板Bridge-V2 语言泛化 70% 低于 OpenVLA 的 75%视觉泛化 65% 低于 75%说明像素级推理并不自动带来更强的指令跟随。代价明确生成 256 个图像 token 带来平均 7 倍推理减速动作块 $m10$ 与并行解码只是部分缓解。规模效率7B 参数、11000 A100 GPU 小时的预训练即可在三平台上取得 SOTA下游微调仅需单节点 10–24 小时。局限性论文自己列出了四条边界。推理开销动作生成之前要先自回归生成 256 个图像 token在动作块长度为 10 时平均造成 7 倍减速图像生成仍是主要瓶颈。图像质量自回归生成的子目标在视觉上不如扩散模型漂亮但论文强调画质高不等于有用——SUSIE 生成的目标图更好看在语言理解和需要新物体组合的任务上反而更差。动作块不连续块与块之间可能出现动作跳变执行过程中缺少高频反馈作者建议用时序平滑或逐步预测来缓解。分布外子目标真值子目标实验说明瓶颈就在没见过的任务上而受算力限制目前还无法靠更大规模的无动作视频解决。未来方向包括快速图像生成与快速推理一致性模型、推测解码、块间时序平滑以及借助视频生成与世界模型提升视觉推理的泛化能力。常见问题FAQCoT-VLA 的视觉思维链和语言思维链有什么区别语言思维链生成的是文本推理步骤CoT-VLA 生成的是未来某一帧的图像。好处有两个中间状态落在像素空间人可以直接检查模型打算去哪而且子目标图像天然存在于原始视频里不需要额外标注或额外的标注模型。为什么子目标图像预测可以不用动作标注因为它的训练目标只是预测未来第 $n$ 帧长什么样输入是当前观测与语言描述与机器人动作无关。EPIC-KITCHENS-100 和 Something-Something V2 这类第一人称或第三人称操作视频因此可以直接参与预训练把数据来源从机器人演示扩展到互联网视频。混合注意力解决了什么问题它让两件性质不同的事在同一个 Transformer 里共存文本和图像 token 需要因果注意力来保证自回归生成的时序一致性动作 token 需要全注意力让 7 个动作维度互相可见、一次性并行解码。如果只用因果注意力动作维度之间无法交互解码也会变慢。7 倍推理开销可以接受吗论文承认这是主要瓶颈生成 256 个图像 token 的开销远大于生成动作 token。缓解手段是长度为 10 的动作块降低重新推理的频率与动作并行解码。作者给出的长期方向是快速图像生成与快速 LLM 推理技术。这个方法在真机上到底比 OpenVLA 强多少在 Franka-Tabletop 的六个任务上平均 78.8% 对 67.3%相对提升约 17%在 LIBERO 仿真上平均 81.1% 对 76.5%长时序套件提升最明显69.0% 对 53.7%。但在 Bridge-V2 的视觉泛化与语言泛化两类上OpenVLA 仍然更好说明优势集中在需要时序与运动泛化的场景。复现需要多少算力预训练在 12 个节点、每节点 8 张 A100 上共 11000 GPU 小时用 1e-4 学习率、余弦衰减、全局批大小 2048、256×256 分辨率跑 10 个 epoch下游微调用 1e-5 恒定学习率跑 150 个 epoch单节点 10 到 24 小时。模型为 7B 参数视觉塔在训练中冻结。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2503.22020项目主页含视频与 rollouthttps://cot-vla.github.io/OpenVLA主要对照基线https://arxiv.org/abs/2406.09246VILA-U本文骨干模型https://arxiv.org/abs/2409.04429Octo通用策略基线https://arxiv.org/abs/2405.12213SuSIE扩散子目标相关工作https://arxiv.org/abs/2311.01455给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表