ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

012、具身智能产业生态盘点:Figure/Tesla/智元/宇树技术路线对比

012、具身智能产业生态盘点:Figure/Tesla/智元/宇树技术路线对比 012、具身智能产业生态盘点Figure/Tesla/智元/宇树技术路线对比上周在实验室调一台宇树G1做抓取实验机械臂在接近目标时突然开始高频抖动我下意识以为是控制频率不够把PD参数调了半天结果发现是视觉推理模块输出的动作序列和底层执行器之间的坐标系没对齐。这种问题在单机调试时几乎不会暴露但一旦你开始对比不同厂商的机器人平台就会发现每家对“视觉-语言-动作”这条链路的切分方式完全不同而正是这种切分方式决定了你写代码时的思维模式。今天不聊论文不聊理想化的架构图就从一个被各种Demo视频掩盖的事实出发目前市面上能买到的、能跑起来的具身智能机器人其技术路线差异之大堪比当年安卓和iOS的早期分裂。Figure、Tesla、智元、宇树这四家基本代表了四种截然不同的工程哲学。先说Figure它的路线最接近“端到端”的教科书定义。Figure 02的硬件设计非常紧凑全身自由度不算夸张但它的核心卖点在于把VLA模型直接部署在机载算力上而且整个推理链路是单模型从视觉token到动作token的直出。我在调试他们的开源接口时有个很深的感触他们的动作头输出的是关节力矩的增量而不是位置增量。这意味着你没法像控制传统机械臂那样直接给目标角度必须让模型自己学会力矩补偿。这个设计的好处是柔顺性极佳坏处是——如果你没有他们那套预训练好的动力学模型你连让机器人站稳都费劲。我试过在仿真环境里用他们的checkpoint微调发现哪怕只是改变负载重量力矩预测就会崩因为力矩空间对质量参数极其敏感。所以Figure的路线适合有强大仿真数据和真实数据闭环能力的团队不适合小作坊。Tesla的Optimus走的是另一条路它本质上是一个“视觉驱动的轨迹规划器”。Elon在发布会上展示的叠衣服、分拣电池其底层逻辑是先用大语言模型理解任务语义再用一个独立的视觉感知模块输出物体位姿最后用传统的MPC或样条插值生成轨迹。这套架构的优点是每个模块都可以单独测试我在自己的工作站上复现过类似流程用SAM分割物体、用FoundationPose估计位姿、再用Ruckig做轨迹插值整个pipeline跑通只需要一个周末。但缺点也很明显——模块间的信息传递会丢失细节尤其是当物体形变或者光照变化时视觉模块的误差会直接传导到轨迹上导致抓取失败。Tesla的护城河不在算法而在他们海量的真实车辆数据可以迁移到机器人场景这种数据优势是其他家难以复制的。智元则代表了“中间派”的极致他们的远征A2在硬件上做了很多妥协比如把灵巧手从欠驱动改成了全驱动但代价是手指重量增加导致末端惯量变大。在软件层面智元最值得学习的是他们的“技能库”设计——他们把常见操作抓、放、拧、插预训练成原子技能VLA模型只负责技能选择和参数生成而不是直接输出底层动作。我在他们的开发者文档里看到每个技能都附带一个“安全边界”函数比如抓取技能会实时检测接触力超过阈值就自动回退。这种设计非常工程化适合做产品落地但学术创新空间被压缩了——你很难在技能库之外探索新行为因为模型根本没有机会输出库之外的策略。宇树是四家里最“另类”的它的G1和H1原本是四足机器人起家所以它的控制栈天生就是为高动态运动设计的。在G1上跑VLA模型时你会发现它的底层控制频率极高1kHz以上而视觉推理模块通常只能跑到10-20Hz这就迫使你必须设计一个异步架构视觉模块负责低频决策底层控制器负责高频跟踪。我在实际调试中踩过一个坑如果直接把VLA输出的目标位置作为PD控制器的参考点机器人会像喝醉酒一样摇摆因为视觉延迟和运动延迟叠加了。后来我参考宇树官方推荐的方案在中间加了一个“运动意图缓冲器”用卡尔曼滤波预测目标位置在控制周期内的变化才把抖动压下去。宇树的优势在于运动能力劣势在于它的硬件接口对VLA模型并不友好——你需要自己写很多转换层。如果非要给个选择建议我的个人经验是如果你做学术研究想发论文Figure的端到端路线最有故事可讲但你要做好被硬件折磨的心理准备如果你做产品原型智元的技能库架构能让你最快看到Demo跑通如果你做运动控制相关的研究宇树是唯一能让你跑起来的选择而Tesla你大概率接触不到实机但它的模块化思路值得你在自己的代码里借鉴。最后说一个所有平台都通用的坑无论你选哪家一定要在第一天就把“坐标系约定”写进代码注释里。我见过太多人把相机坐标系、基座坐标系、工具坐标系混为一谈最后在联调时花三天时间找bug。我的习惯是在每个变换矩阵的赋值处加一行注释标明“这里是相机到基座的变换别搞反了上次就因为这个把机械臂怼到桌面上”。这种细节比任何模型架构都更能决定你的项目能否按时交付。
返回列表