横跨 8 年的硬核综述:十余所高校提出具身操作数据金字塔,划出了 6 个蓝海赛道! 横跨 8 年时间线具身机器人五大数据源的发展脉络——给数据建个坐标系目录01 五层金字塔以两大核心矛盾划分数据层级核心底层逻辑02 两大时序演化分析看清行业数据发展脉络五层数据集规模演变主流具身模型训练配方变迁03 贡献与局限首创标准化五层分层六维评价体系数据中心化拆解所有主流具身模型系统性梳理六大未解决行业核心挑战04 具身智能的数据底层逻辑来自北大、港科大、南洋理工等十余所高校的30位研究者联合推出《Data Pyramid for Embodied Manipulation》。研究提出了具身数据金字塔分层体系“首次用统一六维指标量化全部机器人训练数据源梳理近三年百款具身基础模型的数据使用演进规律明确触觉、失败轨迹、跨本体对齐六大行业待解难题。▲图| 综述框架总览图01 五层金字塔以两大核心矛盾划分数据层级核心底层逻辑金字塔分层的根本矛盾是可扩展性 vs 机器人对齐度二者天然互斥越贴近真机可直接执行的数据采集成本越高、越难大规模扩充海量低成本通用数据和机器人控制动作完全脱节。在此基础上补充数据质量、多样性、可复用性、物理保真度四个辅助维度六维指标共同判定每一层数据的适用场景、短板。从塔尖到塔底五层依次排列真实机器人数据、UMI手持接口数据、第一/第三人称人类数据、仿真数据、通用视觉语言数据。第一层塔尖·真实机器人数据行业最高保真、唯一原生可执行动作数据通过遥操作、脚本自主采集机器人闭环轨迹自带本体 proprioception、传感器噪声、真实接触动力学。优势动作不用二次转换直接部署对应硬件物理保真度拉满故障、真实交互细节齐全短板硬件、人力、场景重置成本极高单套数据集轨迹上限百万级别跨机器人本体复用难度大。典型数据集Open X-Embodiment、RoboMIND 2.0、AgiBot World。第二层UMI式手持采集数据行业近两年快速普及的折中方案不用实体机器人人手持便携夹爪终端在任意室内外环境采集仅记录末端6自由度相对轨迹无机器人本体关节信号。优势野外无限制采集、采集成本仅真机1/10末端动作可通过逆运动学重定向到各类机械臂短板缺失机器人自身动力学、关节延迟信号遮挡场景下位姿跟踪精度暴跌灵巧手任务适配差。典型数据集FastUMI-100K、DexUMI、RealOmni。▲图| UMI数据与真实机器人数据硬件采集对比图第三层第一/第三人称自我中心人类数据头显、穿戴设备采集人类日常操作视频包含自然人手精细交互、海量生活化场景是低成本扩充任务多样性的核心原料。优势采集无门槛普通人日常行为即可生成海量样本人手灵巧交互信息丰富短板无标准化机器人动作标签人类与机器人形态鸿沟巨大必须做手部重建动作重定向才能用于训练。典型数据集Ego4D、Ego-Exo4D、EgoVerse。▲图| 自我中心数据采集与监督体系图第四层仿真数据各类物理引擎批量生成虚拟交互轨迹能无限制并行采集自动输出接触、物体位姿等特权标签。优势边际采集成本趋近于零可自由扩充极端工况、失败案例支持触觉、流体等难采集交互短板固有的仿真-现实鸿沟摩擦、形变、传感器噪声难以完全复刻仿真生成轨迹重复性高。典型数据集InternData-A1、GR00T-X Sim、ManiSkill3。▲图| 仿真基础设施与数据采集管线图第五层底层通用视觉语言数据全网图片、短视频、图文问答、3D场景等无交互通用素材是模型常识、语义理解的基础原料。优势规模无上限覆盖万物语义、空间常识、抽象推理短板完全不存在机器人动作、接触信号只能做预训练打底无法直接用于策略生成。典型数据集LLaVA、SA-1B、ScanNet。▲图| 通用数据任务分类示意图02 两大时序演化分析看清行业数据发展脉络研究整理了2018-2026年近百份公开数据集、主流具身模型从数据集规模、模型训练配方两个维度梳理行业演进趋势横向对比当下各技术路线差异。五层数据集规模演变▲图| 五类数据集规模演进曲线横轴为时间分别对应仿真、UMI、真机、自我中心、通用数据五大类数据集内嵌曲线展示每类数据总量增长规律仿真数据样本量极大但轨迹空间分布高度集中大量重复操作单纯堆样本收益有限。优势无限并行生成可批量制造极端、故障场景自动输出稠密标注短板仿真现实差距无法根除流体、软体、精细接触仿真精度不足。▲图| 大规模仿真数据集表适用大规模预训练、算法快速验证、稀有工况扩充。在研究中明确指出同等规模下真机数据单条样本有效交互信息远高于仿真/网络视频单纯比拼数据量没有实际落地参考价值。UMI数据2024年后爆发式增长FastUMI-100K等百万级轨迹数据集批量落地优势真机平替低成本扩充居家、野外操作跨机械臂迁移成本低短板无本体动力学高速、高力控任务效果大幅下滑遮挡跟踪失效。▲图| UMI 数据集统计表适用场景通用桌面抓取、居家简易操作预训练作为真机数据低成本补充。真机数据增长缓慢硬件成本约束下很难突破百万轨迹门槛优势唯一可直接部署、完整还原真实物理交互容错、恢复行为只能靠真机采集短板采集周期长、硬件投入巨大多机械臂集群数据采集门槛极高无法快速扩充新场景。▲图| 真实机器人数据集统计表适用场景最终落地微调、高精度工业操作、人形机器人整机策略训练。自我中心视频增速断层领先仅Ego4D单套就拥有3600小时视频优势海量生活化灵巧操作补充机器人稀缺精细手部交互短板人机本体鸿沟大重建、重定向 pipeline 误差会污染训练信号。▲图| 自我中心数据集统计表适用灵巧手、长时序家务任务预训练提升模型常识与手部 affordance 认知。通用图文视频数据优势零成本海量语义、空间常识素材短板无任何机器人动作与接触信息无法支撑控制策略训练。▲图| 通用数据集统计表适用模型底层视觉、语言预训练仅作为基座打底。主流具身模型训练配方变迁▲图| 主流具身模型发展时序图2023年早期VLA模型RT-1、RT-2几乎只依赖真机数据2024-2025年Octo、GR-2开始搭配仿真通用数据2026年最新模型LingbotVLA2.0、π0.7、HumanScale全部采用五层混合配方自我中心、UMI数据成为标配预训练原料。三类模型的数据适配差异清晰区分行业路线具身大脑模型侧重感知、规划以底层通用、自我中心数据为主少量真机做落地微调VLA视觉动作模型核心依赖真机、UMI这类带动作标签数据仿真、通用做辅助预训练世界动作模型WAM大量仿真人类视频做动力学预训练真机数据修正仿真现实偏差。03 贡献与局限首创标准化五层分层六维评价体系这套金字塔给出可量化标尺任何数据集、训练方案都能放到框架里横向对标相当于给具身数据领域建立通用“度量衡”也是本研究最大亮点之一。配套开源Awesome Embodied Data Pyramid仓库整合全部公开数据集降低新人入门门槛。企业可直接套用“通用仿真打底UMI与人类视频扩充少量真机微调”的分层配方大幅削减真机采购与人工采集成本配套开源仓库降低新人入门门槛。客观局限仅做定性分类缺少最优数据配比定量公式与自动化筛选评分标准企业在实际操作中仍需大量试错。数据中心化拆解所有主流具身模型过往综述多聚焦模型架构本文反向从“训练用什么数据”切入分析GR00T、Motus、Lingbot等标杆解释不同数据配比如何影响感知、规划、动作生成、世界预测四大能力回答“不同模型该怎么搭配数据”这个工程核心问题对产业落地指导价值极强。模型立项阶段即可按目标精准规划数据预算高精度工业任务跳过通用预训练、直接聚焦真机微调泛化家务机器人则需提前布局人类视频清洗与重定向管线。客观局限对AIGC仿真生成数据GenSim、Hydra等着墨甚浅且未针对世界模型对物理交互数据的前瞻需求做推演本质是对过去的归纳而非对未来的预判。系统性梳理六大未解决行业核心挑战数据几乎只依赖视觉、全是成功演示、缺乏触觉与失败恢复轨迹、跨本体对齐无成熟方案、异构数据混合配方全靠试错。04 具身智能的数据底层逻辑大语言模型靠全网通用数据实现规模化但具身智能永远无法复制这条路径——机器人需要“感知-物理-动作”三位一体闭环数据单一数据源都存在致命短板。这篇数据金字塔综述证明五层数据的互补关系底层通用数据搭建世界常识中间仿真、人类视频扩充操作多样性上层UMI、真机提供可执行动作监督。正因为单一数据源无法同时满足“世界知识广度”与“物理动作精度”具身智能的数据策略注定不是“二选一”而是“怎么配”。全文搭建的统一分析框架会成为后续所有具身数据、具身基础模型研究的通用参考标尺。Ref论文标题Data Pyramid for Embodied Manipulation