ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

PRISM——用4段真人搬运视频,让机器人学会搬运各种东西:以真实视频为“种子”,生成“换个物体人会怎么搬”的反事实交互视频,再重建并重定向为符合物理规则的轨迹,最后通过师生蒸馏出策略

PRISM——用4段真人搬运视频,让机器人学会搬运各种东西:以真实视频为“种子”,生成“换个物体人会怎么搬”的反事实交互视频,再重建并重定向为符合物理规则的轨迹,最后通过师生蒸馏出策略 前言近期我司除了场景落地开发外(即基于自研的具身垂直大脑做批量交付如上下料、搬运分拣、插拔装配)还不断强化了硬件服务涵盖产品采购针对市面上主流的30家本体都有远低于市面价的渠道代理价且1 费用更低2 能给原厂商因为精力限制 而给不了的科研指导ODM帮30天打造自有品牌/IP的机器人如帮造1.1m/1.4m/1.6m的双足人形涵盖“硬件、软件、外观”三大模块手搓人形比如过去半个月便有两高校让我们手搓1.2人形软硬件全开放的1.2m人形 机器狗双平台把图纸、代码、BOM 全部交给学校构建从仿真训练到真机行走的完整闭环我们也将最快26年10月份之内在深圳建立办公室如果你在深圳之前组装过人形欢迎私我(相当于我司软硬人才都需要硬件人才base深圳居多软件人才还可base长沙)当然除了手搓硬件之外我们更会不断提升“让机器人干活”的水平和能力过程中自然不可避免的关注到一系列让机器人干活的成果比如本文要介绍的PRISM而这个PRISM的作者们也算是大家的老朋友了本博客中也解读过相关作者的不少作品如PRISM原论文所述通过视觉模仿来教会人形机器人行走-操作loco-manipulation技能例如在移动过程中搬运各种各样的物体是通往通用型机器人的一条极具前景的路径然而要采集多样且高质量的人机交互视频——例如那些能够清晰展示一个人的完整身体以及其与物体的不被遮挡的交互构成了扩大这一方法规模的实际障碍对此作者提出PRISM这是一种“真实到仿真再到真实”real-to-sim-to-real的框架通过将少量真实视频扩增为大规模且多样化的训练集从而克服这一限制具体而言PRISM 首先通过从少数示例性真实视频进行视频到视频V2V生成合成数百段多样化的“反事实”人–物体交互视频随后作者基于接触锚定的 real-to-sim 流水线同时重建人体和物体的运动并将这些不完美的视频数据重定向为物理上合理的轨迹这些反事实视频内部类别间的多样性使得能够训练出一个单一策略在每个物体类别内对未见过的对象实现良好的泛化通过在真实机器人上部署该策略、且无需任何真实世界微调来展示这一完整流水线且仅利用机载深度观测人形机器人即可抓取、搬运和放置物体——包括箱子、桶、料箱以及球体——并适应全新实例、不同尺寸以及多种初始配置第一部分 Counterfactual Video Generation EnablesScalable Humanoid Loco-Manipulation1.1 引言与相关工作1.1.1 引言类人机器人如何才能学会与日常生活中遇到的各类多样物体进行交互视觉模仿学习提供了一条很有前景的途径通过人类示范给出协调的全身运动示例使机器人能够接近、举起、搬运和放下不同的物体近期的“现实到仿真再回现实”real-to-sim-to-real流程 [1]已经使类人机器人能够直接从人类视频中习得具备情景上下文的全身运动技能这些进展表明了一条可行道路面向通用型类人机器人使其能够从互联网规模的视频数据中学习到广泛的运动与操作技能库然而获取多样且高质量的人–物体交互视频仍然是扩展视觉模仿学习的一个实际瓶颈互联网上的视频数量极其丰富但其内容与构图往往是由人类的观看偏好所塑造的要从互联网视频中筛选出既能清楚展示人物全身、又能清晰呈现其与物体交互过程的示范视频因此代价高昂且在大规模场景下难以实施不过这类交互数据在现代视频生成模型中却是“隐式”存在的 [2]这些模型对人体运动和交互的先验表征可以被用来合成多样化的训练视频为了解决这一数据瓶颈来自1 Amazon FAR、2 UC Berkeley、3 Carnegie Mellon University 、4 Stanford † FAR Team Co-Leads的研究者提出了PRISM一种 real-to-sim-to-real现实到仿真再到现实的框架其利用视频到视频video-to-videoV2V生成技术将少量真实视频扩展为多样化的人—物体交互作者将这些生成的片段称为“反事实视频”counterfactual videos它们展示的是在源视频中并未发生、但在更换物体后本可以发生的交互情形仅基于 4 段现实世界的人搬运箱子的视频作者就生成了 256 段反事实视频这些视频在相同任务场景下展示了箱子、球、垃圾桶和桶等类别在不同几何形状和不同初始配置下的交互过程然后作者以接触为锚点的 real-to-sim 流水线在统一的世界坐标系中重建人体运动、静态场景以及动态物体的几何与运动然后将这些不完美的重建、并重定向为物理上合理的人形体—物体轨迹基于这些轨迹作者训练出一个单一的、基于深度信息的策略使其能够在真实世界中以零样本方式拾取、搬运和放下这些类别中从未见过的具体实例从而验证了整个流水线的有效性。且该策略还能泛化到在生成视频中从未出现过的类别如图 1 所示进一步而言该工作的核心技术挑战在于在反事实视频生成和单目重建都会引入误差的前提下仍然获得物理上合理的机器人示范作者的关键洞见是将接触信号作为贯穿重建、重定靶与策略学习各阶段的共享约束在第一阶段的重建过程中人–物体接触将两种运动耦合起来人体运动为物体轨迹提供引导而物体接触则有助于纠正重建人体姿态中的误差在重定靶阶段稀疏的接触锚点(如下图所示)用于指定机器人末端执行器应在物体上的接触位置从而在兼容形态差异的同时引导将嘈杂的重建结果优化为物理上合理的机器人–物体轨迹在策略学习阶段这些锚点为“特权教师策略”定义接触奖励该教师策略同时跟踪机器人和物体的运动随后将其蒸馏为一个基于深度信息、带有摇杆控制的策略以实现零样本的从仿真到真实部署1.1.2 相关工作首先对于人形机器人行走-操作一体化人形机器人行走-操作loco-manipulation在计算机图形学领域 [3,4] 和机器人领域 [5,6,7] 中都得到了广泛研究其目标是在全身运动过程中同时协调躯体行走与物体交互一些人形机器人系统 [5] 通过跟踪人类动作参考来学习交互技能但在推理阶段需要密集的人体参考动作或物体轨迹这限制了其对未见物体和新交互配置的泛化能力较新的方法 [8,9,10] 通过从稀疏目标或以交互为中心的表示中学习更加自主的交互策略从而降低了这种依赖性同样地PRISM训练了一个统一的全身人形机器人策略使其能够在无需参考或动作捕捉系统支持的部署条件下仅凭机载深度观测实现零样本的摇杆控制拾取、搬运和放置行为其次对于从人类视频中学习近期工作从人类视频中学习仿人技能 [5,11]包括通过联合的人体–场景重建实现具备地形感知的行走 [1]以及动态物体交互 [5,12]然而在大规模条件下采集或整理多样且高质量的交互视频仍然具有挑战性PRISM 通过视频到视频生成将少量真实视频扩展为多样的人–物体交互从而应对这一互补性的挑战利用这些数据作者训练了一个单一策略在现实世界中即可零样本拾取、搬运和放下多种不同的物体最后对于将视频模型视为 Data近期工作在机器人学习的视频生成方面主要探索了两大范式一类方法在推理阶段将视频模型用作规划器或动作生成器通过合成未来的视觉 rollout 来指导闭环操作控制 [13,14,2]此类方法虽然具备灵活的视觉推理能力但需要在测试时进行高成本的视频生成而且在“看起来合理的视频”与“物理上可执行的机器人动作”之间可能存在可执行性鸿沟另一类方法则在离线阶段使用视频模型在策略学习之前合成机器人示范或扩充机器人数据集 [15,16]PRISM 采用的是离线生成范式但有所不同的是它通过有语义对齐约束的 V2Vvideo-to-video生成产生反事实的人类交互视频而不是直接从文本或图像生成机器人视频通过以真实示范为条件输入V2V 能够保留逼真的运动、光照以及考虑可供性affordance的接触模式同时一个简单统一的提示可以通过多次采样将单个示例扩展到多种物体类别、姿态以及类内变化1.2 真实到仿真数据采集给定一段单目视频其中展示了一名人类在一个静态场景中与一个动态物体交互作者的目标是恢复相机参数一个静态场景网格以及一个具有其度量网格及其逐帧位姿以及 4D SMPL-X [17] 动作全部统一在同一个世界坐标系中坐标系中随后作者将恢复出的数据重定向为人形体–物体轨迹用于策略学习具体而言如下图所示PRISM 将反事实counterfactual的人体–物体视频转换为可部署的人形机器人行走-操作一体化技能它在共享的世界坐标系中重建相机、人类运动、物体几何以及物体的 6D 运动并利用接触点在单目歧义下对物体位姿优化施加约束相同的锚点也用于重定向过程以保持交互阶段一致并将机器人末端执行器与预期的接触点对齐重定向后的示范用于训练具备特权信息的协同跟踪教师模型然后将其蒸馏为基于深度的学生策略该策略以机载深度信息和摇杆指令为条件实现零样本的仿真到现实部署1.2.1 反事实交互视频生成利用在线视频扩展从真实世界到仿真环境real-to-sim的学习仍然充满挑战。尽管互联网上的视频极为丰富但其内容与构图往往受人类观看偏好所驱动。因而要在大规模条件下筛选出既具有多样性、又具备清晰的全身视角、可见的人–物交互以及稳定视角的片段成本高昂且不切实际因此作者采用视频到视频video-to-video, V2V生成将一小部分合适的真实视频扩展为多样化的“反事实”交互视频——即在源视频中实际并未发生、但本可以通过更换不同物体而发生的人–物交互给定一段种子视频和一段类别级文本提示作者要求模型在保留原始背景、光照、摄像机视角和粗粒度任务结构的前提下仅替换被操控的物体这样的视频条件生成既将合成过程锚定在真实场景和真实任务之上又允许物体和人类行为在此基础上产生变化重要的是反事实式的变化不仅局限于物体的几何形状或外观当物体的类别、尺寸、姿态或放置位置发生变化时其可操作性manipulation affordances也会随之改变人类行为也会相应适应生成的人可能会弯得更低、调整手部间距、根据物体的可供性调整接触策略或者以不同方式搬运物体因此每个生成的视频片段都提供了一种基于物体条件的交互策略而不仅仅是将相同的人体动作简单地与一个新物体进行配对。这使得PRISM 能够在交互数据中获得行为层面的多样性而这仅通过几何层面的增强是很难以硬编码的毕竟若要从零开始学习此类适应行为将需要穷尽式、针对具体任务的强化学习奖励设计而 PRISM 则利用视频模型作为一种离线先验来刻画合理的人类适应方式在实践中作者录制了四段真实世界的种子视频并将每一段视频作为 V2V 生成的具身模板。作者通过提示 SeedDance 2.0 [18]在保持原始背景、光照、摄像机视角和时间连续性不变的前提下将被操作的物体替换为盒子、垃圾桶、桶或球见附录 A这种类别级别的提示使模型能够在改变物体几何形状、外观和姿态的同时相应地调整人体行为。对于每个类别生成 16 个样本每个种子视频可产生 64 段反事实视频从而将 4 段真实录制扩展为 256 段视频供 real-to-sim 流水线使用1.2.2 基于接触锚定的Real-to-Sim包含重建、重定向为了从单目视频中模仿人类动作作者必须将其与由相机引起的图像运动解耦并在一致的世界坐标系中进行恢复CRISP [19] 将人体网格恢复HMR网络与视觉 SLAM 集成从单目视频重建在度量尺度上一致的人体–场景–相机表示其中包括相机内参逐帧相机位姿度量尺度的场景点云以及在统一世界坐标系下时间对齐的 4D 人体运动作者将其作为后端并扩展其能力以重建动态物体的几何与运动尽管 CRISP [20] 主要关注人体运动及其周围环境但要模仿人–物体交互还需要进一步将动态物体的运动与相机运动解耦因此作者将其作为后端并在同一世界坐标系下扩展恢复动态物体的几何和运动首先对于物体几何与运动重建在给定来自 SAM 2 [21] 的动态物体掩码作者利用 SAM3D [22] 重建物体几何同时估计相机位姿并获得度量尺度信息即利用SAM 2[21]提供的动态物体掩码作者结合CRISP提供的相机位姿和度量深度通过SAM3D[22]重建物体几何结构从而得到物体网格以及初始世界位姿而不是使用诸如 FoundationPose [23] 这样的视觉 6D 追踪器对物体进行独立追踪该方法在单目视频中对手部和身体遮挡较为敏感见表 3总之作者利用人–物体接触来对两者的运动进行联合正则化人体运动为物体轨迹提供了强先验而物体反过来又对不准确的人体关节估计起到约束作用对于“拾取–搬运–放下”这类交互物体在非接触阶段由场景支撑在稳定接触期间则跟随人体运动进一步而言从人体运动线索中自动检测接触点从而避免了手动标注接触信息5,12。检测得到的接触点还通过用与接触一致的约束替换不准确的关节目标在逆向运动学IK过程中对人体动作起到正则化作用在每个接触阶段 [t1, t2] 内作者将物体锚定到 SMPL-X 手掌上使用手掌相对变换 at并在整个阶段保持该变换不变因此在接触期间人类动作会驱动物体轨迹的传播而物体接触又反过来提供几何约束用于修正重建的人体动作中的误差其次对于基于接触锚点的再定向以往的再定向方法 [6] 会保持人与物体之间的关系但前提是假设输入是干净且物理可行的。单目重建往往违背这一假设如图 2 中的粉色示例导致再定向过程会一并保留这些重建误差因此作者提出基于接触锚点的再定向方法它将重建出的全身人体运动视为运动学参考同时使用物体坐标系中的接触锚点作为可靠的交互接口这些锚点明确指定机器人末端执行器应在物体上的作用位置从而允许再定向求解器将含噪的重建结果纠正为物理上合理的机器人–物体交互运对于每一个接触阶段作者我们从第一阶段重建得到的人体–物体几何中提取接触锚点具体而言作者将连接 SMPL-X 左右手掌中心的线段与物体网格求交遵循保持交互的重定向方法 [6]作者保留受约束的逆运动学IK并在原始目标函数中加入一个接触锚点项在每一帧中求解此处表示来自文献[6]的交互网格匹配是从图2中的人-物重建估计出的目标接触点为末端执行器位置的线性化表达式作者针对每帧更新并用其对下一帧进行预热启动人们可能会将这些伪影归因于重建流水线。作者持不同观点在单目图像的 real-to-sim 阶段不完美的重建是不可避免的因为现有的任何流水线都无法还原物理上合理的人—物体运动作者认为他们的基于接触锚定的 real-to-sim 系统通过将足够接近的重建结果优化为物理上合理的机器人示教从而弥合这一差距1.3 统一视觉-运动交互策略的学习利用重建得到的机器人-物体轨迹细节见附录 C作者的目标是训练一个统一的人形机器人策略使其能够在各类不同物体上执行拾取、搬运和放置等行为该策略接收机载深度观测和手柄摇杆指令并根据感知到的物体几何形状和摆放位置自动执行相应的物体交互行为。类似于以往的视觉-运动系统 [24,25]作者采用两阶段训练框架首先在仿真中利用全状态观测训练一个具有特权信息的联合跟踪教师策略随后结合 DAgger [26] 与强化学习将该教师策略蒸馏为一个统一的、基于深度输入的学生策略从而实现零样本的仿真到真实部署。整体流程如图 2 所示1.3.1 训练协同跟踪的教师策略将仿真人与物体的交互建模为一个协同跟踪问题其中策略需要同时跟踪从单目视频重建得到的仿人动作以及动态物体轨迹。关于的运动跟踪训练细节读者可参考该项目的代码库观测教师端的观测包括参考运动、机器人本体感知、前一时刻的动作以及当前与目标物体状态。物体状态由物体位姿和三维包围盒尺寸来表示从而使策略能够显式感知期望的机器人运动以及物体的状态奖励与终止条件奖励主要由机器人位姿跟踪、物体位姿跟踪、动作频率约束、关节范围限制以及碰撞惩罚组成另外作者利用上文1.2节(对应于原论文第 3.2 节)中定义的接触锚点引入了一个与接触相关的交互奖励。具体而言我们鼓励机器人末端执行器到达期望的接触位置并且其接触力超过一个预先设定的阈值其中表示末端执行器的位置是重建得到的目标接触点而是接触力向量。这个感知接触的奖励在有噪声的单目重建条件下可以稳定抓取和搬运行为并在策略学习过程中显著提升交互质量。作者还按照文献 [6] 采用了提前终止和域随机化策略1.3.2 蒸馏统一的基于深度信息的学生策略特权教师在仿真中学习到稳定的物体交互方式但它依赖于真实硬件上不可获得的信息。因此作者将其蒸馏为一个可部署的、基于深度信息的学生策略该策略仅使用机载感知和摇杆指令而不依赖运动捕捉MOCAP系统或参考动作蒸馏作者使用结合了 DAgger 和 PPO 目标的方式对教师策略进行蒸馏其中表示 DAgger 模仿损失是强化学习RL目标根据文献 [24]作者我们采用一个在训练过程中逐渐增加 λ 的课程策略并在最后 20K 次迭代中保持观测学生接收本体感知、摇杆指令以及机载深度信息在部署阶段作者使用Fast-FoundationStereo [27] 从双目图像在机外估计深度。作者发现这在深度观测上显著缩小了从仿真到真实sim-to-real的差距本体感知包括角速度、关节状态以及上一时刻的动作。摇杆指令由相对机体根部的指令和一个二值投放指令构成其是在训练过程中根据参考轨迹和抓取结束时间推导得到附录 D在仿真中作者使用标称 37° 的相机俯仰角对相机位姿进行随机化并注入深度噪声、丢失、空洞、边缘伪影和偏移且评价器critic在没有历史信息的情况下只使用当前的机器人、物体和参考状态热启动作者从一个使用相同方法在仅包含框标注的数据上训练了 23K 次迭代所得的检查点进行热启动在对所有类别进行训练之前仅恢复 actor 的权重。直接从头训练也可以成功但热启动可以加速收敛因此被用于我们公开发布的检查点训练细节作者分别对 3 层 MLP 的教师策略和学生策略进行训练教师训练 40K 次迭代学生训练 28K 次迭代在 8 块 NVIDIA L40S GPU 上每块 GPU 使用 4096 个环境。知识蒸馏使用教师的 rollout 作为运动参考而不是原始的运动学轨迹。详见附录 D// 待更
返回列表