ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DM0.5连续霸榜各大评测,具身预训练的价值正在显现

DM0.5连续霸榜各大评测,具身预训练的价值正在显现 具身智能的榜单越来越多模型成绩也在不断刷新。相比于看谁拿第一另一个问题更值得关注这些榜单究竟在向机器人提出什么要求同样是抓起一个物体但完成抓取只是第一层。如果指令指定了颜色、大小机器人要先选对目标如果任务要求放到某个物体旁边它要判断空间关系如果相机视角变化、目标被移动或者有人突然打断它还要根据新的观测继续修正动作。问题正在变得更难。一次任务成功背后需要指令理解、空间判断、扰动适应和动作执行同时成立。抓得准只是其中一部分。进入物理世界之前测量模型的那把尺子尤其重要因为它提供了一个有效的参考标准。这两年各类benchmark也随着真实要求越来越丰富。而最新的RoboColiseum正是为观察这些要求提供了一个具体入口。它是目前行业内维度最丰富的评测体系由NVIDIA和抱抱脸等多个机构联合推出。这个仿真评测平台设置了指令跟随、空间理解、扰动适应和通用操作四个子榜。如果结合到一起看就能更清晰的了解当下的具身模型正在接受怎样的检验从空间感知到操作再到鲁棒性测试。近日我们也发现了这个榜单的四个子任务被同一个模型占了榜首来自原力灵机的DM0.5。原文链接DM0.5连续霸榜各大评测具身预训练的价值正在显现被同一个模型霸榜DM0.5 是RoboColiseum 榜单中唯一一个所有评测均排名第一的模型。先看这次榜单的结果。在 RoboColiseum 的四个子榜上原力灵机DM0.5 均排名第一Instruction Following 0.8444、Spatial Reasoning 0.6146、Robustness 0.7344、General Manipulation 0.6370。不过SOTA之外更需要关注的是它的底层能力搭建是怎么样的以及当下这些要求它是怎么满足的。因为这四个子榜对应的其实是机器人完成真实任务前必须连续通过的几道关先听懂指令再判断空间关系过程中扛住扰动最后把理解转成稳定动作。真实机器人任务很少只考单项能力。一句“把红色方块放到杯子左边”背后同时有目标识别、空间定位、动作规划和终止判断过程中一旦目标被挪动模型还要重新理解当前状态而不是沿着原轨迹硬走。上面的综合测试合格才是迈向真实场景的第一步。所以 DM0.5 的分数之外需要看的更接近真实世界的要求开始被满足。为什么 DM0.5 能同时登顶四个子榜单榜冲高和四榜同时靠前是两种难度。RoboColiseum 的四个子榜中任何一个环节偏科都会在另一张榜单上暴露出来。问题由此变成DM0.5 到底做对了什么我们和原力灵机的人聊了聊他们解释说DM0.5 的四榜第一主要要回到预训练能力本身。数据覆盖决定它是否见过足够复杂的任务形态网络结构决定它能否把指令、环境和动作连起来SFT 是最后一步适配把这些能力迁移到 RoboColiseum 的构型和任务设置里。把三类高质量数据进行组合取长补短。DM0.5 的数据优势不单是规模也覆盖了具身任务的关键变量动作、空间和环境。我们了解下来是这样的。DM0.5 的数据覆盖导航、抓取、全身控制三大任务以及六类机器人本体。其中真机数据达到 5 万小时覆盖 100 多种动作并实现秒级精细指令动作对齐Egocentric 数据达到 10 万小时支持毫米级高精度 3D Landmark 生成场景重建数据达到 100 万平用于建模复杂室内环境缩小 Sim2Real Gap。这三类数据对应的是 RoboColiseum 的四类考点真机操作数据支撑指令到动作的对齐第一视角和 3D Landmark 支撑空间推理场景重建数据支撑扰动和环境泛化多任务、多本体覆盖支撑通用操作。四榜同时靠前首先需要模型在训练阶段就见过足够多的任务形态、空间关系和环境变化。DM0.5 的数据融合解决的正是这个覆盖面问题。在上下文信息压缩、思维链、轨迹对齐上来优化结构数据之后更关键的是结构。对机器人来说长程任务最怕三件事只看当前一帧就下判断听懂了指令但不知道任务进展学动作时又被不同示教轨迹里的速度和路径差异带偏。DM0.5 的三项结构设计基本就是围绕这三件事展开。1Context Abstraction Layer。机器人执行任务时当前画面往往不够用。刚才擦到了哪里目标是不是被短暂遮挡上一段动作有没有把物体推偏这些历史信息都会影响下一步决策。Context Abstraction Layer 做的是把上下文压缩进模型可用的状态里让 DM0.5 原生支持最长 60 秒记忆。2Embodiment CoT Tasks。记住还不够模型还要知道自己在做什么、做到哪一步、下一步该不该继续。DM0.5 通过 11 项具身推理任务把目标定位、子任务预测、任务结束判断、未来世界状态描述以及机械臂、夹爪、主动执行器状态生成放进预训练。它训练的是“指令、本体、环境”之间的连续推理能力而不是一句指令直接映射一个动作。3Trajectory Alignment Layer for Action Learning。最后还是要回到动作。真实示教数据天然不整齐。同一个任务有人做得快有人做得慢路径、姿态、停顿位置也会有差异。如果直接逐点监督模型很容易把这些轨迹差异也学进去。Trajectory Alignment Layer 通过约束动态规划计算最优匹配把动作监督从“对齐某个时间点”转向“对齐整段动作意图”。这样模型更容易学到稳定的操作逻辑而不是被每条示教里的细节波动牵着走。这三项设计合在一起解决的是长程机器人任务里最关键的一条链路历史要记住任务要想清动作要对齐。不仅仅是榜首还是模型全科优秀榜单之外下一个问题很自然是这些能力落到真实机器人任务里能否继续成立。这一点可以从原力灵机之前对外展示的任务来看。主要集中在几类微型积木拼装、削黄瓜、灵巧手切黄瓜、物流单件分离以及相机扰动和人类动作干扰。它们对应的不是同一种能力而是同一个模型在精度、力控、跨本体操作和稳定性上的连续表现。先看精度。微型积木任务中最小组件宽度不到 1 厘米机器人需要在 0.1 到 1 毫米尺度内完成抓取和扣合作为参照人手自然抖动约为 0.3 到 1 毫米。这里比较难的是积木存在工艺公差直接下压容易错位卡死。DM0.5 是先对齐再通过轻微震动和下压完成装配出现角度偏差后还能停顿、调整姿态并修正位置。据悉平均每台机器人每 12 秒完成一次拼装。再看力控和本体迁移。削黄瓜任务中DM0.5 通过关节电机电流值实时感知作用力大小进而判断接触力这要求模型同时处理黄瓜表面、刀具角度和机械臂轨迹的变化。灵巧手切黄瓜则把难度推到 58 个自由度的人形机器人上通过 DM0.5 模型加特定后训练完成长程操作涉及视觉理解、抓握稳定、刀具控制和节奏保持。最后是稳定性和抗干扰。相机扰动考视角变化后的继续执行人类动作干扰考任务被打断后的状态理解和动作修正物流中转站单件分离任务则把模型放到持续运行的工业节拍里。我们在WAIC和WRC上看到他们的快递t分拣在包裹尺寸、材质、摆放姿态都不固定的情况下DM0.5 依靠实时视觉识别和决策完成分拣平均 3 秒一单准确率超过 99%。DM0.5在精细定位、柔性接触、高自由度控制、长程执行和抗干扰恢复上都有可观察的能力信号。单卡 9.29 倍加速做到 57 ms之外我们还了解到DM0.5的系统推理效率有很大幅度提升。目前已经做到单卡57.49ms。不过这个只是另一维度的优化57ms 和 RoboColiseum 四榜第一没有必然联系。推理加速的价值在另一层。真实机器人不是离线答题。模型响应太慢前面学到的理解和动作能力就很难及时进入闭环。DM0.5 在推理侧联合优化将模型核心延迟从 534.04 ms 降到 57.49 ms累计加速 9.29 倍延迟降低 89.2%。而且这次优化基本没有牺牲精度。在 2,000 个 LIBERO episodes 上成功率从 98.45% 到 98.40%保持基本稳定。写在最后仿真评测正在成为具身模型进入真实世界前的必测关。真实机器人测试成本太高。每一次真机验证都涉及本体、场地、物料、复位、人工和安全问题。模型如果在仿真里的指令理解、空间判断、扰动适应和通用操作上已经暴露短板直接进入真实场景只会让问题在更昂贵的环节里出现。所以评测维度越多越能提前照出模型的问题。只看一次抓放很难判断模型是否真正理解指令只看固定场景也看不出它能否处理目标移动、视角变化和人为打断。RoboColiseum 的价值就在于把这些能力拆开测再放到同一套体系里比较。从这个角度看原力灵机DM0.5 四榜第一的意义不只是分数领先而是它在更接近真实任务要求的综合测试里没有明显偏科。当然仿真评测只是第一步。模型最后还是要回到真实机器人身上接受真实任务、真实干扰和真实节拍的检验。榜单给出标准化分数真机任务给出物理世界里的能力切面。两者放在一起才更接近具身基础模型真正要面对的竞争。
返回列表