
世界模型开始选择“该预测什么”EMBODIED INTELLIGENCE · WEEKLY REVIEW本周一句话预测开始为动作选择信息控制开始为延迟设计反馈产业则将泛化演示、安全协作与实际交付逐项对齐。01产业脉动01FigureHelix 2.5 走进 30 个未见家庭2026-09-17模型与真机演示公开Figure 展示Helix 2.5 在旧金山湾区 30 个未见家庭中执行整理房间、叠毛巾和铺床。任务策略基于共同的 Index 预训练基础未使用这些家庭的专门采集或微调在其受控实验中Index 预训练使完整任务成功率从 9% 提高到 56%。这批结果聚焦三类家务及公司报告的测试协议展示的是模型泛化与真机演示能力家庭服务的规模化交付仍需另看运营数据。来源https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization02AgilityDigit 5 将安全协作与维护节奏纳入产品设计2026-09-15新产品公布计划 2027 年交付Agility 公布第五代 Digit标称载荷 22.7 千克、运行 90 分钟后充电 9 分钟并以 AI 人员检测、独立安全控制器和 NVIDIA IGX Thor 相关计算平台支撑协作场景。早期体验计划安排在 2027 年上半年全面供货预计在当年年底。安全设计与仍在发展的行业标准共同演进具体使用仍取决于部署环境和风险评估公司公布的上一代运行积累应与新产品的交付进度分别理解。来源https://www.agilityrobotics.com/content/agility-unveils-digit-5-humanoid-robot-built-for-cooperatively-safe-work-at-scale03极智嘉欧洲创新实验室连接模型展示与客户验证2026-09-16杜塞尔多夫实验室开放极智嘉在德国杜塞尔多夫开设欧洲创新实验室展示 Gravity 具身智能框架、Gino 1、RoboShuttle Hyper 与机器人拣选工作站。实验室面向欧洲客户和合作伙伴开展端到端方案演示、测试与验证。产业价值在于把算法、仓储系统和现场工作流程放在共同的验证空间实验室揭幕本身并不提供这些新方案的量产规模或客户长期运行指标。来源https://www.geekplus.com/resources/news/geekplus-opens-european-innovation-lab-in-d%C3%BCsseldorf-to-accelerate-ai-driven-robotics-across-europe?hs_amptrue04Planted Solar3,180 万美元融资支持机器人建造能源设施2026-09-15B 轮融资公布Sage 计划年内现场推出Planted Solar 宣布完成 3,180 万美元 B 轮融资由 Piva Capital 与 RA Capital 的 Planetary Health 团队共同领投资金用于扩大机器人机队及推进自动化电站部署。公司称一项面向数据中心的 28 兆瓦项目从首次沟通到供电用时 10 个月其中现场建设不足 3 个月Sage 机器人计划在 2026 年底前现场推出。项目进度来自公司披露融资规模、已有项目与新机器人的未来部署时间应分别看待。来源https://www.plantedsolar.com/blog/planted-series-b-funding-autonomous-power-deployment05NSF将物理系统 AI 纳入 X-Labs 新一批方向2026-09-16资助方向与申请机会公开美国国家科学基金会在 X-Labs 计划中新增 AI for Physical Systems 等方向覆盖先进传感、机器人、具身交互与信息物理系统。其组织方式强调跨领域团队、可扩展平台技术和阶段性里程碑为算法与真实物理系统共同验证提供资助入口。这次公告公布的是研究方向与申请机会具体项目的获资助主体、金额和实施结果要以之后的授予记录为准。来源https://www.nsf.gov/tip/updates/nsf-announces-3-additional-topics-part-nsf-x-labs-initiative06MMI1,700 万欧元联合投资支持显微外科机器人2026-09-16联合投资公告公开Angelini Ventures 与欧洲投资银行公布对 Medical Microinstruments 的 1,700 万欧元联合投资支持 Symani 显微外科机器人平台。这是双方此前建立的 1.5 亿欧元合作框架下的第三笔联合投资。该事件反映医疗机器人持续获得产业与公共金融支持公告中的融资用途与商业推进应和临床效果、监管批准及医院实际装机分别核验。来源https://www.angeliniventures.com/insights-and-news/mmi-investment/02研究专题本期阅读涵盖 9 月 14—20 日的 20 篇研究日期采用北京时间的 arXiv 首次提交日期。以下按五条问题线索整理并将每篇论文与对应原文图 1 一一匹配。01世界预测开始选择“该预测什么”从因子化潜变量到选择性未来模态预测表示正被重新约束为任务真正需要的接口。PAPER 01 / 20ARXIV 2609.20800JEPA-Anything: Learning Predictive Models across Different Worlds预测目标世界模型是否必须生成完整未来图像JEPA-Anything 将预测目标分解为正交、互补的潜在因子让同一套预测学习跨越不同世界与动力学结构。关键结果在匹配的 JEPA 对照中它改善了全部 10 项动力学任务规划收益仍随环境而变说明表征质量与闭环价值需要分别检验。— JEPA-Anything: Learning Predictive Models across Different Worlds 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.20800PAPER 02 / 20ARXIV 2609.17524Modality-Autoregressive World-Action Models模态选择ModAR 围绕机器人控制选择未来模态先预测点轨迹、DINO 特征与深度再自回归生成动作而不是默认把未来 RGB 当作唯一目标。关键结果三项双臂任务平均成功率达到 83.3%未来 RGB 在所测条件下没有提供一致增益。— Modality-Autoregressive World-Action Models 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.17524PAPER 03 / 20ARXIV 2609.16074World-Action Models for Robot Learning and Control: A Survey比较坐标WAM Survey 从表示、状态转移、动作接口、架构与训练流程五个维度组织世界动作模型为不同技术路线提供统一比较坐标。关键结果这是一篇综述不以单一成功率为结论评估时应把画面质量、动作信息保留、闭环成功率与计算预算放在同一张表中。— World-Action Models for Robot Learning and Control: A Survey 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.16074PAPER 04 / 20ARXIV 2609.17372XPACE: Joint World and Action Modeling from Heterogeneous Experience联合建模XPACE 让共享视频骨干同时服务世界动作策略和动作条件模拟器并生成偏离—恢复轨迹把预测模型也作为后训练数据来源。关键结果在恢复数据实验中成功率从 61.7% 提高到 86.7%。— XPACE: Joint World and Action Modeling from Heterogeneous Experience 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.17372PAPER 05 / 20ARXIV 2609.15870WLA³: World Latent Action Modeling for Semantics, Dynamics, and Kinematics监督层级WLA³ 以局部潜在动作连接动力学与本体执行同时用片段聚合特征监督语义模型把语义、动力学与运动学装入同一训练流程。关键结果论文在六项真机任务上报告 81.9% 的平均成功率。— WLA³: World Latent Action Modeling for Semantics, Dynamics, and Kinematics 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.1587002慢模型与快反馈如何共存大型策略保留任务先验轻量模块负责及时反应延迟本身开始进入训练目标。PAPER 06 / 20ARXIV 2609.18207Reinforcement Learning for Real-Time Vision-Language-Action Policies实时编辑Real-Time EXPO-FT 让 VLA 异步提出动作块再由编辑策略依据新观测修正并通过强化学习对齐动作内容与执行时序。关键结果四项动态真机任务在最多 10 分钟在线数据下平均表现由约 42% 升至 97%。— Reinforcement Learning for Real-Time Vision-Language-Action Policies 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.18207PAPER 07 / 20ARXIV 2609.18242ForceDelta-VLA: Distilling Force-Conditioned ActionCorrections for Contact-Rich Manipulation力觉修正ForceDelta-VLA 从力条件教师蒸馏局部动作修正让大型策略保留任务先验同时由快速学生策略响应接触变化。关键结果九项任务平均成功率为 82.2%并降低了成功试验中的峰值接触力。— ForceDelta-VLA: Distilling Force-Conditioned ActionCorrections for Contact-Rich Manipulation 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.18242PAPER 08 / 20ARXIV 2609.15570DIDO: Distilling Interaction-Centric Dynamics into One-Step Denoising for World Action Models单步蒸馏DIDO 把交互、物体和夹爪信息纳入单步蒸馏试图从预测模型内部减少多步去噪带来的等待。关键结果在 H100 设置中端到端延迟从四步教师的 562 毫秒降至 384 毫秒压缩为单步的是世界模型部分。— DIDO: Distilling Interaction-Centric Dynamics into One-Step Denoising for World Action Models 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.15570PAPER 09 / 20ARXIV 2609.20761Agile-WAM: An Agile Tactile World Action Model for Contact-Rich Robot Control多时间尺度Agile-WAM 让视觉预测较长未来而触觉只预测紧邻下一帧用不同时间尺度匹配视觉与接触反馈的变化速度。关键结果论文在九项仿真与五项真机任务中检验设计并报告真机总体成功率相对最强对照提升 29.4%。— Agile-WAM: An Agile Tactile World Action Model for Contact-Rich Robot Control 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.2076103全身能力的关键是先验与接口跨本体共享运动语义与保留接触和执行约束并不是互相排斥的选择。PAPER 10 / 20ARXIV 2609.16644WholeBodyWAM: Generalizing Pre-trained World-Action Priors to Humanoid Loco-Manipulation via WBC-Grounded Coordination控制接口这版 WholeBodyWAM 从已有操作 WAM 出发以统一全身控制接口 UWBC 和协调感知注意力 CASA 连接步行与上肢操作。关键结果在 SONIC 仿真配置下达到 91.9% 总体成功率并展示真实 G1 的分布外任务进度。— WholeBodyWAM: Generalizing Pre-trained World-Action Priors to Humanoid Loco-Manipulation via WBC-Grounded Coordination 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.16644PAPER 11 / 20ARXIV 2609.18197WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors运动先验另一版 WholeBodyWAM 先用 UniMotion-4K 的 4,100 多小时运动训练 Motion Expert再联合视频与动作专家学习全身世界动作模型。关键结果天工 3.0 六项任务平均得分为 72.2%。两篇同名工作证据与技术入口不同需要分开阅读。— WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.18197PAPER 12 / 20ARXIV 2609.15213X-WBC: A Cross-Embodiment Foundation Model for Humanoid Whole-Body Control跨本体基础模型X-WBC 把共享命令标记与本体专用编码器、解码器结合让不同人形机器人共享高层运动语义并保留各自的执行映射。关键结果模型在九种仿真机器人上联合训练并展示四种真实人形机器人的 VR 控制。— X-WBC: A Cross-Embodiment Foundation Model for Humanoid Whole-Body Control 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.15213PAPER 13 / 20ARXIV 2609.16683Weave: Learning Whole-Body Dexterous Loco-Manipulation from Human-Object Interactions接触与手指协调Weave 把物体接触、手指协调与全身移动操作放进统一策略并从带物体的人类交互中学习执行先验。关键结果仿真训练交互成功率为 92.5%未见交互序列为 65.0%同时形成约 9,000 条带接触标注的执行轨迹。— Weave: Learning Whole-Body Dexterous Loco-Manipulation from Human-Object Interactions 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.1668304灵巧操作从接触预测走到后训练一端扩充跨域接触知识另一端压缩高自由度动作空间二者共同指向更可控的真实执行。PAPER 14 / 20ARXIV 2609.20649DexTouch-WM: Learning Action-Conditioned Tactile World Models from Human Touch for Dexterous Robot Manipulation触觉世界模型DexTouch-WM 用兼容的人类与机器人全手触觉布局作为数据桥梁以视频专家连接轻量触觉专家探索触觉预测的跨域扩展。关键结果固定五小时机器人数据、增加到 100 小时人类数据后机器人域 Contact-IoU 从 0.415 升至 0.588合成轨迹训练策略仍弱于对应全真实数据配置。— DexTouch-WM: Learning Action-Conditioned Tactile World Models from Human Touch for Dexterous Robot Manipulation 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.20649PAPER 15 / 20ARXIV 2609.19666Towards High-DoF Dexterous Manipulation through VLA Post-Training高自由度后训练Dexterous Post-Training 把每手 20 维动作压缩到 9 维潜在空间再依次接入监督微调、DAgger 与潜在残差强化学习。关键结果双臂平台五项任务在完成相应后训练后各进行 20 次评估均取得成功。— Towards High-DoF Dexterous Manipulation through VLA Post-Training 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.1966605数据、上下文与工程接口共同影响适应能力从现场上下文、针对性采集到表征对齐和工程平台适应能力越来越像一条完整的数据—训练—部署链路。PAPER 16 / 20ARXIV 2609.19138In-Context Robot Learning with VLM Agents现场上下文GPT-Policy 用上下文编译器把示范关键转变、机器人动作工具与执行反馈连接起来在不更新参数时适应新任务。关键结果人类视频能改善部分真实操作但各条件试验量较小抓取与完成状态判断仍有失败。— In-Context Robot Learning with VLM Agents 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.19138PAPER 17 / 20ARXIV 2609.20659HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface针对性采集HIL-UMI 把策略分歧与进度反馈带到手持采集端让补充数据更靠近当前策略真正困难的状态。关键结果它关注的是人机协同后训练的数据效率而不是单纯扩大无差别示范规模。— HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.20659PAPER 18 / 20ARXIV 2609.18232UMI-Bridge: Action-Anchored Latent Alignment across Human and Robot Manipulation Data中间域对齐UMI-Bridge 借助有动作标注的中间域对齐人类与机器人经验使跨本体数据共享由视觉相似转向动作锚定。关键结果论文在三项真机任务上获得 91.7% 的平均成功率。— UMI-Bridge: Action-Anchored Latent Alignment across Human and Robot Manipulation Data 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.18232PAPER 19 / 20ARXIV 2609.18514ActiveScale: Scaling Active Perception for Robots across Model, Data, and Hardware主动视角ActiveScale 把相机位姿与历史视频纳入动作学习并用 1,000 小时人类—机器人中期训练支持遮挡搜索及视野外操作。关键结果工作把主动感知同时扩展到模型、数据和硬件重点检验机器人是否会主动改变视角以补足信息。— ActiveScale: Scaling Active Perception for Robots across Model, Data, and Hardware 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.18514PAPER 20 / 20ARXIV 2609.17210FluxVLA Engine: A One-Stop VLA Engineering Platform for Embodied Intelligence工程平台FluxVLA Engine 统一数据转换、配置、分布式训练、评测与部署接口降低 VLA 方法从研究复现到迭代上线的工程断点。关键结果官方仓库提供代码与运行配置能否复用仍取决于数据时间语义和控制接口的一致性。— FluxVLA Engine: A One-Stop VLA Engineering Platform for Embodied Intelligence 的核心框架来源论文图 1来源https://arxiv.org/abs/2609.1721003值得继续讨论1在相同延迟与算力预算下因子化预测、选择性模态生成和轻量反馈各能贡献多少闭环收益2如何在统一协议中比较全身任务进度、运动跟踪成功与完整操作成功并分清仿真和真机证据3触觉预测、人类数据和针对性纠正能否组成可量化收益的后训练闭环4当产品进入家庭、仓储和医疗场景哪些长期运行、维护与安全指标应与单次演示同时公开END