
导语在制造业的真实场景中机器人能否完成一次完美的精密装配不取决于它“认不认识零件”而取决于它在接触瞬间“有没有感受到那一点点偏差”。在0.1毫米的间隙里视觉上几乎一样的两条轨迹一条能让零件平滑入位另一条则可能造成卡滞甚至损坏。新加坡南洋理工大学PINE Lab研发的Facet-0用“预测接触后果”的思路让精密装配的平均成功率从最强基线的15%冲到了82%。这不是简单的“加了力传感器”而是一次从感知到决策的范式重构。一、当“会做”不再是标准精密装配的终极考验机器人正在变得越来越“通用”。从抓取日常物品到根据语言指令完成多步骤操作视觉-语言-动作VLA模型让机器人摆脱了“一项任务、一套程序”的开发方式。但当机器人真正走向制造现场问题变了会不会做已经不是唯一标准能不能在毫米甚至亚毫米级接触中稳定完成并在出错后自己恢复才决定它能否进入生产环节。精密装配恰恰是这道门槛最集中的地方。现代VLA策略在标准操作任务上表现优异但一旦进入0.1-0.3毫米的间隙成功率就会断崖式下跌。零件可能已经“看起来对齐”却在最后几毫米发生偏斜、卡滞。视觉擅长提供语义和几何信息却看不见被夹具、机械臂遮挡的微小偏差——一个零件位置几乎没有变化但力持续增大这本身就是视觉无法提供的失败信号。传统方法部分有效力感知策略提供了交互信号柔顺控制器稳定了接触真实机器人强化学习从部署经验中改善行为。但问题在于接触通常被当作“已经发生的事”或“底层反馈”而非“未来动作的预期后果”。Facet-0的核心问题由此而生一个通用机器人能否在保持语义广度的同时预判、评估并适应自己动作的物理后果二、核心洞察让模型“预判自己将产生什么样的力”Facet-0的答案是把接触当作动作的预测后果并让这个后果在部署中获得价值。具体来说基于PaliGemma视觉-语言骨干和流匹配动作专家Facet-0将多视角图像、任务指令与运动学状态以及腕部力/力矩的因果历史对齐形成一种语义-接触表征。从这个表征出发策略联合生成两个东西一个笛卡尔动作分块7维末端位姿夹爪开合这是实际执行的一个未来腕部力/力矩预测6维这是模型预期这些动作会引发的接触后果。只有动作被执行力/力矩预测不参与控制——它是一个“预测性后果”用来让模型在动作之前就“知道”这个动作会产生什么样的接触。这种设计的精妙之处在于它改变了模型的学习目标。以前模型只学“怎么动”现在它必须学会“这样动会产生什么样的力”。要把力预测准模型就必须理解接触物理——就像一个人要预测自己拧螺丝的力度就必须理解螺丝的松紧一样。为什么“力矩预测”比“力矩输入”更有价值这是Facet-0最具启发性的设计选择之一。当力矩只作为输入时它提供给策略的是“过去动作已经产生的接触记录”——这个信息来得太晚无法影响导致它的那个动作。在行为克隆损失中也没有任何机制奖励模型去关注那六个力维度。把力矩变成解码目标就彻底改变了学习信号。只有当模型真正表征了它提议动作的接触后果时力矩预测误差才会下降。力矩变量因此成为一种在执行前就可用的预测性变量而非执行后的被动记录。消融实验证实π0.5F把力矩作为额外输入token和TA-VLA力矩感知VLA的成功率都在9-16%区间与π0.5几乎一样。“提供接触反馈”和“利用部署价值区分动作后果”是两件完全不同的事。仅把力矩作为输入并不能让模型学会“什么样的动作会导致什么样的接触”——它只是多了一个观测却没有改变学习的本质。三、ManuFacet-1K1000小时的“力同步”数据基础要让模型学会这种能力首先需要数据本身包含“接触是如何发生的”。ManuFacet-1K包含约1000小时的力同步示范与闭环运行数据覆盖UR7e、xArm、Franka三种机械臂、两类服务器机箱以及GPU、RAM、CPU、Disk四类安装任务。数据集的特色在于围绕精密操作进行统一设计每一帧同步记录多视角图像、语言指令、末端位姿、夹爪状态和六维力/力矩并按照接近、对齐、插入、压合、就位、紧固、撤离等技能阶段进行标注。更关键的是数据并没有只保留“正确答案”。真实部署中的失败、人工接管以及随后发生的恢复过程也被保留下来。这意味着模型学习的不再只是“成功轨迹长什么样”而是一个动作如何产生接触一次正常接触和一次卡滞有什么区别以及错误发生后怎样重新回到可完成任务的状态。四、从“预测接触”到“评估接触”部署经验教会模型什么是有价值的仅仅预测力还不够。可靠部署还需要区分有用的交互和代价高昂的交互。Facet-0引入了一个动作-力矩评论家Action-Wrench Critic在部署回放中学习评估每个“动作预测力矩”组合的价值。核心创新在于这个价值分布能区分几何进度相同但接触结果不同的动作——一条干净的插入和一次同样深度的卡滞在几何上可能无法区分但在力/力矩维度上截然不同。论文中的图4生动地展示了这一点仅基于视觉和状态的价值估计对精细接触不敏感而基于动作-力矩提案的价值估计则能清晰地将干净的GPU插入与一个视觉上难以区分的失败模式分开。接触选择性信用分配让关键帧不再被淹没真正决定装配成败的接触片段在整条轨迹里往往只占很小一部分。如果把所有时刻放在一起排序大量自由空间运动会淹没那些短暂但关键的接触动作。Facet-0的解决方案是分别在接触阶段和自由空间阶段进行信用筛选把学习重点重新拉回对齐、插入、卡滞和恢复这些真正决定结果的瞬间。那些稀缺的接触恢复帧——在演示中很少出现但极其宝贵——就不会被淹没在海量的自由空间帧中。与AWR的对比学习长尾而非平均与AWR优势加权行为克隆的对比很有说服力在相同部署数据上Facet-0将成功率从20%提升到65%人类干预率从47%降到24%失败恢复率从44%提升到81%。价值引导学习从部署分布的长尾中学习而不是从平均轨迹中学习。AWR用标量优势重新加权部署语料而Facet-0的接触选择性信用在交互状态内排序样本——因此能保留高信用的接触恢复帧这些帧在演示中极其稀缺。五、当零件变了有界局部自适应让迁移便宜10倍真实制造中零件规格会变材料会变卡扣特性会变。如果每次换零件都要重新训练整个模型成本无法接受。Facet-0给出了一个轻量解决方案冻结已学到的语义-接触表征只训练一个“有界局部动作器”。这个动作器接收压缩后的FACET令牌、运动学状态、当前力/力矩和冻结策略的参考动作输出一个绝对笛卡尔目标而非残差。关键设计是有界输出通过tanh压缩到任务特定的动作范围内保证任何输出都在安全边界内——这比残差方法更安全因为残差的安全性依赖于“修正幅度小”而小修正恰恰无法修复失败模式。辅助力矩预测头保持非指令性力矩头继续被监督用于预测下一步的接触后果但不进入批评家的动作空间也不是力控指令。它只负责维持“动作-接触耦合”的一致性。只更新6.6%的参数在只给10个演示和3小时训练的情况下面对一个全新的内存模块质量、刚度、卡扣特性都不同Facet-0达到45%成功率而最强基线只有5%。这个设计体现了一个深刻的洞察语言语义、场景理解和粗粒度任务进度可以跨零件复用而局部质量、刚度、卡扣响应和接触几何才决定了哪条修正轨迹能成功。冻结上游表征正是为了防止微小的在线数据集重写那些可复用的知识。六、实验结果82% vs 15%的碾压式差距研究团队在5个亚毫米级计算机组装任务上进行了系统验证RAM安装、CPU安装、磁盘安装、GPU安装以及一个纯接触的LEVER锁扣任务。这些任务包含23个子目标其中14个是接触关键型。主要结果令人印象深刻Facet-0平均成功率82%最强基线π0.5RECAP风格仅15%5.5倍提升放置精度0.5毫米指令延迟50毫秒π0.5为150毫秒峰值离轴力仅为无接触方案的0.2倍接触力控制质量极佳。消融实验揭示了每个组件的贡献语义-接触对齐16%价值引导强化学习38%加上局部自适应达到82%。没有任何一个组件是多余的。在17个报告的子目标中13个接触关键型的未加权平均成功率为87%而端到端均值为82%——差距来自链式完成准则每一个环节都必须成功。这也解释了为什么在一个限制接触状态的局部修正能在装配完成率上产生大得多的增益。七、从“看见并执行”到“接触、判断、修正和积累经验”Facet-0的贡献不止于82%的数字。它重新定义了机器人基础模型在精密操作中的学习对象不只是“做什么”而是“这样做会产生什么物理后果”。在制造业的真实世界里真正难以规模化的从来不是做出一次漂亮的Demo。生产现场更关心的是第100次遇到微小偏差时它是否仍能完成出现一个训练集中没有覆盖的卡滞时它能否自己退回来更换零件、工装乃至机器人平台之后需要付出多少重新调试的成本。Facet-0给出的并不是所有精密制造问题的最终答案而是一条值得关注的技术路径以力同步的高精度数据建立接触基础以多模态模型连接语义与物理交互再通过真实部署中的强化学习把失败从“异常”变成能够被持续利用的训练信号。这背后对应着机器人基础模型从通用操作走向工业落地时的一次能力迁移——从“看见并执行”进一步走向“接触、判断、修正和积累经验”。结语最后一毫米的物理真相对于制造机器人而言视觉和语言模型可以教它“知道”但只有接触预测和价值学习才能教它“做到”。82%的成功率不是一个终点而是一个起点。它证明了一条路是通的让机器人在动作之前预判接触后果在执行之中感受接触状态在失败之后利用接触经验改进自己。这条路比生成逼真的视频难得多也比任何单一模型的胜利都重要得多。因为在精密制造中决定机器人能否真正进入生产线的可能并不是它在理想情况下成功了多少次而是当那一次不可避免的失败到来时它能不能自己把任务继续做下去。论文信息标题Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation作者Haoyuan Deng, Haichao Liu, Wenkai Guo 等机构新加坡南洋理工大学 PINE Lab项目页https://pine-lab-ntu.github.io/facet-0/论文链接https://arxiv.org/abs/2609.01596