ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

具身智能论文学习15:GR00T N1: An Open Foundation Model for Generalist Humanoid Robots

具身智能论文学习15:GR00T N1: An Open Foundation Model for Generalist Humanoid Robots 第一部分基本收录情况项目内容论文全名GR00T N1: An Open Foundation Model for Generalist Humanoid Robots中文译名《GR00T N1面向通用人形机器人的开放基础模型》方法名称GR00T N1正式会议/期刊目前未检索到正式会议或期刊收录当前公开形式NVIDIA Technical Report / arXiv PreprintarXiv编号arXiv:2503.14734上传版本v22025年3月27日团队NVIDIA模型类型Vision-Language-Action Foundation Model是否严格VLA是公开模型GR00T-N1-2B总参数量2.2BVLM部分1.34BSystem 2Eagle-2 VLMSystem 1Diffusion Transformer动作学习Action Flow MatchingAction Chunk16步推理去噪4步真实机器人Fourier GR-1 Humanoid数据来源Human Video Synthetic Data Real Robot Data是否跨具身是单臂、双臂、人形机器人是否开源论文公开了2B checkpoint、相关训练数据和仿真基准公开的GR00T-N1-2B总参数量为2.2B其中1.34B位于VLM在L40上以bf16采样16步Action Chunk约需63.9 ms。第二部分解决的问题你现在已经走到比较完整的一条路线OpenVLA→LLM自回归离散动作π0​→VLM Action Expert Flow MatchingRDT-1B→1.2B Diffusion Transformer 多机器人预训练现在GR00T N1进一步变成VLM System 2DiT System 1Flow Matching跨具身Human/Synthetic/Robot Data​它和RDT-1B特别像的地方是都认为动作生成应该由专门的Diffusion/Flow Transformer完成。但区别很明显。RDT-1BGR00T N1核心目标双臂Foundation Model通用人形/跨具身Foundation Model视觉语言SigLIP T5Eagle-2 VLM动作模型1.2B DiT独立DiT System 1动作算法DiffusionFlow Matching跨具身接口统一物理动作空间Embodiment-specific encoder/decoderHuman Video不是核心核心数据来源生成视频数据非核心重要创新模型结构单一动作Foundation ModelSystem 2 System 1双系统所以RDT看完之后看GR00T非常顺从“大规模Robot Action Model”→“真正多来源、多具身VLA Foundation Model”​不同 robot embodiment 的 sensor、DoF、action dimension 和 control mode 都不同。因此跨机器人数据不是天然能放在一起训练的Franka≠双臂机器人≠Humanoid名称是什么典型结构Franka一款具体的机械臂平台通常指 Franka Emika Panda单机械臂 gripper双臂机器人 Bimanual Robot一类机器人不是某个具体型号两条机械臂协同工作Humanoid人形机器人通常有躯干 双臂 双手 头/腿或移动机构它们的关节数量不同State 维度不同Action 维度不同摄像头不同控制方式不同。结果不是形成一个统一大数据集而是形成很多互相割裂的 Data Islands​数据孤岛论文就是这样描述 cross-embodiment 数据问题的。所以 GR00T N1 真正要解决的是数据少不同机器人数据难统一​第三部分GR00T N1核心内容1核心的双系统结构Figure 2 展示了 GR00T N1 的整体结构。模型采用System 2 System 1的双系统设计图像和语言指令首先输入System 2 的 Eagle-2 VLM将当前场景和任务编码成视觉语言特征机器人自身的关节、末端位姿等状态则单独编码。随后这些视觉语言特征和 Robot State 一起作为条件送入System 1 的 Diffusion Transformer用于生成机器人的连续动作。因此两部分的分工可以简单理解为System 2看懂“现在是什么情况、要做什么”​ System 1根据这些信息生成“具体怎么动”​其中 System 1 采用Flow Matching Diffusion Transformer从带噪动作开始迭代去噪最终得到连续的 Motor Action而不是像自回归模型那样逐个生成离散动作 Token。图2给出了GR00T N1的整体VLA数据流其核心是System 2 System 1双系统架构。图像观察首先被编码成Image Tokens语言指令被Tokenizer转换为Text Tokens二者共同输入Vision-Language Model即System 2用于理解当前视觉环境和语言任务机器人自身的关节位置、关节速度、基座位置、末端执行器姿态等Robot State则通过独立编码器形成状态表示。System 2输出的视觉语言特征、Robot State表示以及用于去噪的Action表示随后共同进入Diffusion Transformer即System 1。System 1并不是像OpenVLA一样逐个预测离散动作Token而是通过连续动作的迭代去噪生成Motor Action。因此这张图体现了GR00T N1的基本分工VLM负责“看懂任务”Diffusion Transformer负责“生成动作”。2System 2Eagle-2 负责视觉语言理解GR00T N1 的 System 2 使用预训练的Eagle-2 VLM其主体由SigLIP-2 视觉编码器和 SmolLM2 语言模型组成。输入图像会被编码为视觉 Token再与语言指令一起送入 VLM得到对当前场景和任务的视觉语言特征。GR00T N1 并不让 VLM 直接输出机器人动作而是把这些特征作为条件交给后续的 System 1。实现上图像以 224×224 分辨率输入经视觉编码和 Pixel Shuffle 后每帧形成 64 个 Image Tokens。作者没有采用 VLM 最后一层表示而是使用第 12 层中间特征实验发现这样既能提高推理速度也能提升下游策略成功率。System 2把“看到什么、任务要求什么”编码成语义特征​3System 1Diffusion Transformer 负责连续动作生成System 1 使用Diffusion TransformerDiT生成机器人动作。它接收机器人当前状态、带噪的 Action Chunk以及 System 2 输出的视觉语言特征并通过多层 Transformer 逐步预测去噪方向最终恢复出连续 Motor Action。GR00T N1 一次处理一个 Action Chunk论文中设定 H16。DiT 内部交替使用Self-Attention 和 Cross-AttentionSelf-Attention 主要建模机器人状态与动作之间的关系Cross-Attention 则让动作生成过程读取 VLM 提供的视觉语言信息最后经过 embodiment-specific Action Decoder输出当前机器人的连续动作。因此整个双系统可以直接理解为①Eagle-2理解任务​→②DiT生成动作​但二者不是两个互不相关的模块而是在同一个 VLA 框架中通过特征和注意力紧密连接。4如何适配不同机器人具身GR00T N1的完整网络结构和推理流程GR00T N1 需要同时处理单臂、双臂和人形机器人但不同机器人的关节数量、状态维度和动作空间并不一致。它没有像 RDT-1B 那样把所有机器人动作塞进一个固定的统一物理 Action Space而是为不同机器人配置各自的State Encoder、Action Encoder 和 Action Decoder先将不同维度的状态与动作映射到统一的 Transformer 隐藏空间再交给共享的 DiT 主干处理。因此整体结构可以概括为Embodiment-Specific Encoder具身专属编码器→Shared DiT共享DiT主干→Embodiment-Specific Decoder​具身专属解码器也就是身体不同接口不同核心 DiT 共享。例如 7 维、14 维和 30 维动作空间的机器人可以分别使用自己的编码器映射到相同隐藏维度经过共享 DiT 学习通用操作能力后再由各自的 Action Decoder 恢复成对应机器人的真实连续动作。论文正是通过这种“共享核心网络 具身专属接口”的方式支持从单臂机器人到双臂人形机器人的跨具身训练。Figure 3 展示了 GR00T N1 的完整网络执行流程。图像和语言首先经过 Vision Encoder、Text Tokenizer 与 Eagle-2 VLM得到视觉语言特征机器人当前状态​ 则通过具身专属的State Encoder 编码带噪 Action Chunk 通过Action Encoder 编码。随后这些状态与动作表示进入共享的 Diffusion Transformer其中Self-Attention 建模状态和动作内部关系Cross-Attention 则让动作生成过程读取 Eagle-2 提供的视觉语言语义。经过多层 DiT Block 后再由当前机器人对应的 Action Decoder 输出长度为 H16 的连续 Motor Action最终生成的 Action Chunk。整个动作块通过 Flow Matching 进行多轮迭代去噪论文中推理时使用 K4 次迭代。3Action Chunk与Flow MatchingGR00T不是预测单步动作而是论文设置H16​即一次生成未来16步动作。然后使用Flow Matching。真实Action Chunk随机噪声构造中间状态当接近随机噪声当接近真实动作。模型学习向量场论文按照其公式将训练目标写成核心思想还是你在π0​里已经理解的不直接一次猜最终动作而是学习“随机动作应该沿什么方向逐渐变成合理机器人动作”。4推理时到底怎么生成动作推理一开始也就是完全随机的动作Chunk。然后反复调用System 1学习到的向量场论文使用Forward Euler前向欧拉法进行更新。假设你知道一个物体现在的位置是当前速度是往前走一个很小的时间对应的更新就是最终得到的是一个长度为 H16 的连续 Action Chunk最重要的是论文发现次迭代已经能够很好工作。因此它不像传统几十步Diffusion那样需要非常多去噪步骤。公开2.2B模型生成16步Action Chunk63.9 ms​ 在L40 GPU、bf16下完成。5Data Pyramid用不同层级的数据弥补机器人数据稀缺Figure 1 展示了 GR00T N1 的核心数据策略——Data Pyramid数据金字塔。训练数据从下到上依次为Web Data Human Videos、Synthetic Data、Real-World Robot Data。越靠下的数据规模越大、覆盖范围越广但与具体机器人控制的对应关系较弱越靠上数据量越少却更加贴近真实机器人的传感器、动作空间和物理交互。因此整个金字塔呈现出越往上数据量减少具身特异性增强​底层的 Web 数据和人类视频主要提供广泛的视觉、语言和行为先验中层的仿真轨迹与 Neural Trajectories 用较低成本扩大机器人行为数据规模顶层真实机器人数据则负责把这些能力真正ground 到具体机器人的物理控制上。GR00T N1 的关键并不是只依赖昂贵的真实机器人数据而是让三类数据互补共同支撑大规模机器人预训练。Human/Web 数据提供广度Synthetic Data 提供规模Real Robot Data 提供物理真实性6Latent Action让没有动作标签的人类视频也能参与训练这块存在的目的就是让“没有机器人动作标签的人类视频”也能拿来参与 GR00T N1 的预训练。数据来源是“视频”但真正送进 Latent Action 模型的不是整段视频而是从视频里取出的两张图像帧正常机器人数据是图像语言Robot State→真实 Action但人类视频只有“人在做什么”的画面没有机器人关节动作​。所以论文额外学一个 Latent Action从视频前后两帧的变化中提取“发生了什么运动”的抽象表示再把它当作一种替代动作监督。这样人类视频就不只是给 VLM 看图而是也能参与 System 1 的动作学习。Latent Action“这段时间发生了什么运动”的隐藏动作表示​人类视频只有当前画面​ 和未来画面​并没有机器人控制指令​。GR00T N1 因此训练一个VQ-VAE根据前后两帧之间的变化提取 Latent Action其中​ 并不是具体机器人的关节角或末端位姿而是一种更抽象的“这段时间发生了什么运动”的表示。VQ-VAE 的 Decoder 再利用​ 和重建未来帧​如果能够正确重建就说明捕获了从当前状态变化到未来状态所需要的运动信息。训练完成后GR00T N1 将这种连续 Latent Action 当作一种独立的LAPA embodiment的动作监督并使用同样的 Flow Matching 目标参与预训练。Figure 4 表明相似的 Latent Action 可以在人类、单臂机器人以及不同双臂机器人之间对应到相似的运动语义。例如左侧样本都表示“右手/右臂向左移动”右侧都表示“向右移动”即使它们的机器人结构和真实动作空间完全不同。图4直观展示了GR00T N1所谓的Latent Action具有跨具身一致性。左侧所有样本虽然来自不同机器人甚至人类视频但检索到的相似Latent Embedding都对应“将右手或右臂向左移动”右侧则统一对应“向右移动”。这说明Latent Action并不直接等价于某一种机器人具体的关节角或末端位姿而是在更抽象的行为表示空间中编码“发生了什么运动”。因此即使Human Video没有机器人控制指令模型仍然可以从当前帧与未来帧之间的视觉变化中提取Latent Action并将人类动作、单臂机器人动作和双臂机器人动作映射到具有一定共享语义的运动表示空间中这是GR00T N1利用无动作标签视频进行跨具身预训练的重要基础。7Neural Trajectory用视频生成模型扩增机器人示范真实机器人数据太少、采集太贵所以用视频生成模型把少量真实示范“扩增”成更多训练数据。GR00T N1 因此将Image-to-Video 视频生成模型在 88 小时真实遥操作数据上进行微调然后给定已有初始画面和新的语言指令生成新的机器人操作视频。例如只改变“使用左手还是右手”“抓哪个物体”“放到哪个容器”就可以从相同或相近的初始状态生成不同的操作轨迹。通过这种方式论文将约88 小时真实遥操作数据扩展为 827 小时 Neural Trajectories约 10 倍规模。Figure 5 展示的正是这种数据扩增效果红框是初始帧后续画面则由视频模型根据不同 Prompt 生成。因此这里的 Neural Trajectory 本质上可以理解为真实初始状态新的语言指令→视频生成模型→新的机器人运动视频​但这些生成视频仍然没有真实机器人 Action 标签所以还需要利用前面讲过的Latent Action或者使用 IDMInverse Dynamics Model根据前后图像反推出 Action Chunk再把这些动作作为监督信号用于 GR00T N1 训练。图5展示了GR00T N1利用视频生成模型构造Neural Trajectories的具体效果。前几组样本从相同初始画面出发仅修改语言Prompt例如改变使用左手还是右手、目标容器或目标物体视频生成模型即可产生不同的机器人操作轨迹随后还展示了改变待抓取物体、将网杯中的物体倒入容器以及“拿起土豆—放入微波炉—关闭微波炉”等更复杂的行为。红框表示生成视频的初始帧。该机制意味着一条真实采集的初始状态不再只对应一条机器人示范而可以通过语言条件生成大量Counterfactual Trajectories从而显著扩大动作和任务分布。论文据此将约88小时的内部遥操作数据扩展为约827小时的Neural Trajectory数据是GR00T N1降低真实机器人数据采集成本的重要手段。8Simulation Data用仿真批量生成机器人轨迹除了用视频生成模型扩增数据GR00T N1 还利用物理仿真和DexMimicGen自动生成机器人轨迹。具体来说作者先人工遥操作采集少量示范DexMimicGen 再将这些示范拆成与物体相关的动作片段通过改变物体位置并重新组合这些片段自动生成新的成功轨迹。预训练阶段共包含 54 种 source-target 容器组合每种生成 10,000 条示范因此得到54 万条仿真轨迹。如果把预训练和后训练使用的仿真数据合计起来论文共生成约78 万条 Simulation Trajectories相当于约 6500 小时的人类示范但实际只用了约 11 小时完成生成。它与前面的 Neural Trajectory 本质上解决的是同一个问题真实机器人数据昂贵因此尽可能利用合成数据扩大训练规模。区别在于 Neural Trajectory 依赖视频生成模型而 Simulation Trajectory 依赖物理模拟器。表1总结了GR00T N1三种数据扩展技术与不同数据来源之间的适用关系。Latent Action适用范围最广可以从Real-Robot Dataset、Simulated Robot Dataset以及Human Video Dataset中学习因为它只需要视频前后帧不要求原始机器人动作标签Neural Trajectory需要能够利用已有机器人数据训练或适配视频生成模型因此主要应用于真实机器人和仿真机器人数据Simulation Trajectory则依赖物理模拟器和DexMimicGen等自动轨迹生成系统只适用于机器人数据。这个表说明GR00T N1的数据策略不是简单地把各种数据拼在一起而是为不同来源设计不同的“动作补全”或“数据扩增”方式使原本结构完全不同的数据最终都能够参与VLA训练。9真实机器人与 Human Video 数据来源GR00T N1 的真实机器人数据并不只来自 GR-1还混合了内部采集的GR00T N1 Humanoid Dataset、Open X-Embodiment 中的多种机器人数据以及 AgiBot-Alpha 等跨具身数据。内部 GR-1 数据主要通过遥操作采集Figure 6 展示了这一流程利用 Manus Glove、VIVE Tracker、Apple Vision Pro 或 Leap Motion 捕获人的手部和腕部运动再通过Retargeting将人体动作映射成机器人可执行的控制指令最终在真实机器人或仿真环境中执行并记录轨迹。除此之外GR00T N1 还使用 Ego4D、Ego-Exo4D、EPIC-KITCHENS 等多个人类视频数据集。与真实机器人轨迹不同这些视频没有精确的机器人关节 Action因此主要提供丰富的人类操作、物体交互和视觉行为先验再通过 Latent Action 等方法转化为可用于预训练的监督信号。图6展示了GR00T N1真实机器人数据的遥操作采集流程。系统支持Manus Glove VIVE Ultimate Tracker、Apple Vision Pro以及Leap Motion等不同的人体动作捕获设备通过这些设备记录操作者的手部骨架和6-DoF腕部姿态然后利用Retargeting将人体运动转换为机器人可以执行的关节或末端动作最终既可以在真实机器人上执行也可以映射到仿真机器人中。该流程的意义在于把“人如何完成任务”转化为“机器人如何完成任务”的动作监督数据同时允许不同采集设备共享统一的数据处理链条为GR-1人形机器人的高质量真实轨迹采集提供基础。10Pre-training 与 Post-trainingPre-training阶段GR00T N1 将真实机器人、仿真、人类视频和 Neural Trajectory 等异构数据放在一起训练但不同数据提供的动作监督不同Human Video 使用Latent Action真实机器人数据既有真实的Ground-truth Action也可以提取 Latent ActionNeural Trajectory 则使用Latent Action 或 IDM 预测的 Action。这些不同形式的动作最终都作为 Flow Matching 的训练目标使模型先学习跨任务、跨具身的通用机器人能力。Post-training阶段则在某一个具体 Robot Embodiment 的数据上继续微调让预训练模型适配目标机器人的状态空间、动作空间和任务分布。论文中这一阶段保持VL backbone 的 language component 冻结其余模型继续微调如果加入 Neural Trajectory则真实轨迹与生成轨迹按照1:1的比例共同训练。Pre-training用多源数据学习通用能力→Post-training适配具体机器人11训练规模与下游适配成本GR00T N1 采用典型的大规模 Foundation Model 训练路线。论文最高使用1024 张 H100 GPU进行训练其中 GR00T-N1-2B 的预训练约消耗50,000 H100 GPU-hours。不过在下游 Post-training 阶段成本可以明显降低作者测试表明单张A6000也能够完成微调如果只训练 State/Action Encoder、Action Decoder 和 DiT 等动作相关模块batch size 可达到 200。第四部分实验效果1仿真实验设置GR00T N1 在三组仿真 Benchmark 上进行评测RoboCasa、DexMimicGen Cross-Embodiment Suite 和 GR-1 Tabletop。其中 RoboCasa 包含 24 个厨房基础操作任务DexMimicGen 包含 9 个双臂灵巧操作任务并覆盖三种不同的双臂机器人具身GR-1 Tabletop 则包含 24 个面向人形机器人的桌面操作任务其中 18 个为物体重排另外 6 个涉及抽屉、柜子和微波炉等可动结构。Figure 7 只是展示这三类 Benchmark 的代表性任务场景。为了进一步测试模型的数据效率作者对每个任务分别只使用30、100 和 300 条示范进行 Post-training并与从零训练的基线进行比较。因此这组实验的重点不是单纯看“能不能完成某个任务”而是考察预训练后的 GR00T N1 能否在不同机器人具身和有限下游数据下快速学会新技能。图7给出了GR00T N1主要仿真评测任务的代表性场景。最上方为RoboCasa厨房任务包括Pick-and-Place、关闭炉灶、准备杯子、打开水龙头和打开微波炉等基础操作中间为DexMimicGen双臂或灵巧操作任务包括Piece Assembly、Transport、Pouring、Coffee以及Tray Lift最下方则是作者构建的GR-1 Tabletop任务例如Move to Pan、Move to Box、Move to Shelf、Bottle to Cabinet和Cup to Drawer。这三类Benchmark分别覆盖单臂基础操作、双臂灵巧协同以及接近真实人形机器人部署的操作形式因此实验并不是只在单一机器人和单一场景上验证模型而是专门用于测试GR00T N1在不同具身、动作空间和任务复杂度下的迁移能力。2真实机器人评测设置Figure 8 展示了 GR00T N1 在 Fourier GR-1 人形机器人上的真实世界评测任务。上方的Pre-training Evaluation不经过针对这些任务的下游训练直接测试预训练模型的能力包括双手协同的 left-to-right handover以及面对新物体、新容器时的泛化用来观察预训练本身是否已经获得可迁移的操作能力。下方则是Post-training Evaluation模型在目标机器人数据上微调后测试四类真实任务Pick-and-Place、Articulated Object Manipulation、Industrial Manipulation 和 Multi-Agent Coordination。这些任务从基础抓放逐渐扩展到抽屉/柜体操作、工业场景以及机器人之间的协作因此后面的真实机器人成功率并不是单一 Pick-and-Place 的结果而是在多种操作能力上的综合评测。图8展示了GR00T N1在真实Fourier GR-1人形机器人上的完整评测体系。上半部分属于Pre-training Evaluation一个任务要求机器人先用左手抓取物体再完成左手到右手的handover并放置到目标位置另一个任务要求模型处理Novel Object和Novel Container用于测试预训练模型在没有针对性下游训练时的泛化能力。下半部分则属于Post-training Evaluation包括Object-to-Container Pick-and-Place、Articulated Object Manipulation、Industrial Manipulation以及Multi-Agent Coordination四类任务从基础抓取放置进一步扩展到抽屉、柜体、工业部件、双手handover乃至两个机器人之间的协作。因此后续Table 3中的成功率并非来自单一Pick-and-Place任务而是覆盖了多类真实世界机器人能力。3实验结果① 预训练模型本身已经具有一定泛化能力作者首先直接测试Pre-trained GR00T-N1-2B不针对测试任务进行额外 Post-training。在双手协同的 Left-to-Right Handover 任务中成功率达到76.6%面对 Novel Object Unseen Container 时达到73.3%。这说明大规模异构预训练本身已经让模型获得了一定的双手协同、新物体操作和任务泛化能力。② 仿真实验少量示范也能快速适配如表2所示在每个任务仅使用100 条下游示范进行 Post-training 时GR00T-N1-2B 在三个仿真 Benchmark 上的平均成功率达到45.0%高于 Diffusion Policy 的 33.4% 和 BC Transformer 的 26.4%。其中在 GR-1 Benchmark 上GR00T N1 达到50.0%相比 Diffusion Policy 的 32.7% 提高17.3 个百分点。因此这组实验主要说明预训练得到的通用行为先验能够提高小样本下游学习效率。表2比较了在每个任务仅使用100条下游示范进行Post-training时BC Transformer、Diffusion Policy和GR00T-N1-2B在三个仿真Benchmark上的表现。GR00T-N1-2B在RoboCasa、DexMG和GR-1上分别达到32.1%、66.5%和50.0%均高于两个从头训练的Baseline最终平均成功率达到45.0%相比之下Diffusion Policy平均为33.4%BC Transformer仅为26.4%。尤其在与真实人形机器人结构最接近的GR-1任务中GR00T N1达到50.0%比Diffusion Policy的32.7%高17.3个百分点。这说明GR00T N1的大规模异构预训练能够形成可迁移的机器人行为先验使模型在只有少量目标任务示范时仍然具有明显更高的学习效率。③ 真实机器人显著降低真实示范数据需求如表3所示在真实 GR-1 人形机器人上使用完整下游数据时GR00T-N1-2B 的平均成功率达到76.8%而 Diffusion Policy 为 46.4%只使用10% 真实机器人数据时GR00T N1 仍达到42.6%而 Diffusion Policy 只有 10.2%。更值得注意的是GR00T N1 使用 10% 数据得到的 42.6%距离 Diffusion Policy 使用全部数据的 46.4% 仅差3.8 个百分点。因此 Table 3 最核心的结论是基础模型预训练显著降低了学习新机器人任务所需的真实示范数据量。表3进一步验证了1GR00T N1在真实GR-1人形机器人上的数据效率。使用完整下游训练数据时GR00T-N1-2B在Pick-and-Place、Articulated、Industrial和Coordination四类任务中的平均成功率达到76.8%而Diffusion Policy为46.4%绝对提高30.4个百分点更值得注意的是在只使用10%真实机器人数据时GR00T N1仍能达到42.6%而相同数据量下的Diffusion Policy仅为10.2%。甚至GR00T N1使用10%数据得到的42.6%距离Diffusion Policy使用全部数据的46.4%仅相差3.8个百分点。因此该表最核心的结论不是单纯“GR00T比Diffusion Policy成功率更高”而是基础模型预训练显著降低了新机器人任务所需要的真实示范数据量。4Neural Trajectory消融Neural Trajectories 到底有没有用有而且在低数据条件下尤其有用。如 Figure 9 所示在RoboCasa中给 GR00T-N1-2B 的后训练加入视频生成得到的Neural Trajectories后性能会继续提升30 demos17.4% → 21.6% / 21.2%100 demos32.1% → 39.5% / 40.9%300 demos49.6% → 52.9% / 56.4%其中 LAPA 和 IDM 是给生成视频补动作标签的两种方式整体都能带来增益说明这些合成视频并不只是“看起来像机器人在动”而是真的能转化成有用的训练信号。在真实 GR-1 人形机器人上这个结论同样成立。只使用10% 真实示范数据时加入 Neural Trajectories 后Pick Place36.0% → 42.0%Industrial31.0% → 36.67%Overall33.78% → 39.63%因此这个实验真正说明的是视频生成模型不仅能扩充数据量还能切实提升策略性能尤其能缓解真实机器人数据不足的问题。图9通过消融实验直接回答了“视频生成模型制造出来的Neural Trajectories到底有没有实际作用”。左侧RoboCasa实验分别考察每个任务只有30、100和300条真实示范的情况单纯GR00T-N1-2B已经明显优于Diffusion Policy而加入Neural Trajectories后性能进一步提高在30-demo条件下加入LAPA或IDM标签后达到约21%100-demo条件下提高到约40%300-demo条件下最高达到56.4%。论文统计相比仅使用真实轨迹加入Neural Trajectories在30、100和300数据设置下平均分别带来约4.2、8.8和6.8个百分点提升。右侧真实GR-1实验同样表明在仅使用10%真实示范的低数据环境中引入IDM标注的Neural Trajectories后Pick-and-Place由36.0%升至42.0%Industrial由31.0%升至36.67%8个任务整体平均由33.78%提升至39.63%即约5.8个百分点。因此Synthetic Video不仅能生成视觉上合理的机器人轨迹也确实能够作为有效的Post-training数据改善真实机器人Policy。第六部分GR00T N1的创新点、局限性1创新点① 双系统 VLA 架构GR00T N1 将System 2 的 Eagle-2 VLM与System 1 的 Flow-Matching DiT结合在统一模型中VLM 负责理解视觉环境和语言任务DiT 根据视觉语言特征和机器人状态生成高频连续动作。两部分并非独立串联而是在同一 VLA 框架中紧密耦合。② 共享模型支持不同机器人具身面对单臂、双臂、人形机器人不同的状态维度和动作空间GR00T N1 使用Embodiment-Specific Encoder/Decoder Shared DiT不同机器人拥有自己的输入输出接口中间的动作生成主干则可以共享从而实现跨具身学习。③ Data Pyramid把更多非机器人数据变成机器人训练数据GR00T N1 将Web/Human Video、Synthetic Data 和 Real Robot Data组织成 Data Pyramid并进一步通过Latent Action、IDM 和 Neural Trajectory解决数据不足问题没有动作标签的视频可以构造替代动作监督视频生成模型和仿真则可以低成本扩增机器人轨迹。也就是说它的一个核心贡献是扩大了“什么数据可以拿来训练机器人”的范围。2局限性① 目前仍以短时桌面操作为主论文实验主要集中在short-horizon tabletop manipulation“短时间跨度的桌面物体操作”距离长时间行走、导航与操作结合的long-horizon loco-manipulation“长时间跨度的移动-操作协同”还有明显距离作者也将其列为后续重点方向。② 视觉语言理解能力仍有提升空间作者认为更强的 Vision-Language Backbone 仍可能进一步改善机器人的空间推理、语言理解和环境适应能力说明当前 VLM 还不是最终形态。③ Synthetic Data 仍受物理真实性和多样性限制Neural Trajectory 和 Simulation Data 虽然能够显著扩充数据但生成数据仍存在多样性不足、反事实场景覆盖有限以及不完全符合真实物理规律的问题。因此 Synthetic Data 可以补充真实机器人数据但目前还不能完全替代真实轨迹。3从 GR00T N1 到 SmolVLA从能力扩展转向效率GR00T N1 展示了大规模 Robot Foundation Model 的潜力通过 2.2B 参数的双系统架构以及 Human、Synthetic、Real Robot 等大规模异构数据模型获得了较强的跨具身能力和下游适应能力。但这种能力背后也依赖较大的模型规模和训练算力GR00T-N1-2B 的预训练就消耗了约 50,000 H100 GPU-hours。这也自然引出了另一个问题机器人基础模型一定要越来越大吗能否在更有限的算力和硬件条件下仍然训练和部署一个真正可用的 VLASmolVLA 正是沿着这个方向展开——相比继续追求模型规模和能力上限它更关注轻量化、训练效率和实际部署成本。①GR00T N1把 Robot Foundation Model 做强→②SmolVLA把 VLA 做小、做快、做得更容易部署​
返回列表