ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

登顶Science Robotics!仅靠机载视觉,完成自主踢足球全流程,拿下RoboCup双冠

登顶Science Robotics!仅靠机载视觉,完成自主踢足球全流程,拿下RoboCup双冠 感知不再是前置预处理而是策略本身的一部分——端到端的“感知-运动”统一强化学习框架目录01 人形足球领域两大技术路线的固有短板02 整套框架三大核心模块AMP对抗运动先验让机器人学自然人类踢球动作虚拟感知系统仿真复刻真实相机的全部缺陷编码器‑解码器 多Critic架构利用时序记忆对抗感知失效03 实验指标数据、行为涌现与真实赛事表现关键定量指标对比对比规则基准方案非常有意思的涌现行为RoboCup真实赛事落地04 落地启示人形机器人踢足球最大的难关并不只是双足平衡、抬腿射门这些运动能力而是运动过程中视觉感知本身就不可靠。机器人跑动时镜头抖动、光照变化、球体短暂离开视野都会造成检测丢失。过去主流方案采用感知‑规划‑控制模块化流水线感知出错就会一路传导到动作输出造成动作卡顿、反应迟缓。清华大学赵明国团队联合字节跳动Seed发表于Science Robotics的这项工作打造了一套统一强化学习控制器把视觉不确定性直接融入策略训练机器人只使用机载相机仿真训练结束后零样本直接部署真机可以自主完成搜球、追球、多方向射门整套行为。并且这套算法模块直接用于RoboCup 2025成人尺寸人形组助力火神队拿下两项赛事冠军。整套工作的核心思路不是把视觉模块打磨到“百分百看得准”而是让机器人策略学会适应看不清、看不准的现实。传统方案假设感知输出是可靠真值而本工作把噪声、延迟、检测丢失全部放进仿真训练让策略从训练阶段就习惯不完美的观测依靠时序历史信息自己推测球的真实状态做到感知和运动闭环协同。▲图| 系统总览图。真实机器人搭载机载相机完成视觉感知图像检测转换为鸟瞰视角BEV坐标里程计模块输出球门信息策略网络结合本体感知输出50Hz关节指令感知流水线以25Hz运行01 人形足球领域两大技术路线的固有短板人形机器人足球是具身智能非常典型的测试场景需要敏捷双足移动、动态视觉跟踪、时机精准的踢球动作同时生效。目前业内两条主流路线模块化规则基线RoboCup大量队伍使用 把任务拆成感知、规划、步态控制独立模块。视觉输出球位置规划器规划趋近路径步态控制器执行行走最后执行预设踢球脚本。 优点是逻辑清晰调试直观但缺点在于模块串行带来延迟感知噪声会层层向下传递。机器人如果球在身后需要原地大幅度旋转调整站位从启动到完成踢球最多消耗5秒。各模块独立调参工作量巨大动态滚动的足球面前响应能力很差。图| 结果与方法概述本文方案使人形机器人可在多样条件下完成视觉驱动的反应式足球技能过往端到端强化学习人形足球方案部分工作利用强化学习学习踢球行为但大多依赖运动捕捉系统提供的精确全局状态无法脱离实验室环境少数视觉版本需要耗费巨大算力渲染NeRF场景仿真‑真机迁移后反应速度、成功率会出现明显跳水很难直接用于真实比赛。以上两类方案共同的短板是没有把感知不确定性作为策略训练的内生条件感知要么是完美真值要么作为独立前置步骤策略本身不会去理解“现在我可能没看清楚球”这件事。这项登顶Science Robotics的研究正是针对该痛点给出的完整解法。02 整套框架三大核心模块整套框架基于PPO强化学习结合AMP对抗运动先验、虚拟感知系统、编码器‑解码器时序表征、多Critic架构在仿真完成全部训练硬件无需改动直接部署Booster T1人形机器人1.2m、30kg。图| 本文提出的学习框架。上方是仿真训练流程下方是真机部署流程Actor接收部分观测编码器‑解码器从历史数据重建辅助状态信息策略由PPO更新同时结合来自判别器的运动先验奖励硬件仅部署蓝色标注部分的模块AMP对抗运动先验让机器人学自然人类踢球动作对抗运动先验AMP在人形模仿学习领域并不新鲜但大多只用本体自身状态做模仿。本文把AMP迁移到存在感知噪声的视觉驱动场景。研究收集了人体全方位行走、脚弓踢球动作的动捕数据经过重定向适配机器人本体训练判别网络区分机器人运动轨迹和人类参考运动片段。判别器输出风格奖励引导机器人生成贴近人类的流畅步态。这里有一个巧妙设计不是固定复刻参考动作只是提供风格约束。策略会根据足球位置生成参考数据集里不存在的新动作典型例子就是支点钩射球门位于机器人身后机器人以单脚为轴心横向摆腿把球勾向球门不需要原地完整转身大幅缩减动作耗时。虚拟感知系统仿真复刻真实相机的全部缺陷这是实现零样本sim‑to‑real迁移的关键。团队拿真实机器人实地采集1小时数据集记录真实相机的检测成功率、位置噪声分布、更新频率、时间延迟以及视场FOV约束。在仿真训练的时候不再直接喂给策略球的真实坐标而是调用这套虚拟感知系统输出带有噪声、随机丢检测、存在时延的观测完全复刻真机上会遇到的视觉缺陷。简单理解训练的时候就故意给机器人“看不清楚的画面”而不是理想仿真真值。这样策略训练完成面对真机上同样的感知缺陷不会直接失效。 策略拿到的不是原始RGB图像而是抽象结构化信息球相对机器人坐标、球门位置、检测是否有效的布尔标记这样大幅降低计算负担同时过滤掉光照、纹理这类无关干扰提升跨环境泛化能力。图| 感知‑动作协同分析。A不同消融设置训练曲线B不同遮挡时长下踢球与进球成功率C球在相机视场内的角度分布D有无解码器损失情况下感知误差对比E球移出视场之后策略依靠历史隐状态预测球运动引导机器人重新找回目标编码器‑解码器 多Critic架构利用时序记忆对抗感知失效机器人保存过去1秒一共50帧历史观测编码器把时序观测压缩成64维隐表征。训练阶段解码器尝试从隐状态重建真机拿不到的特权信息例如球真实位置、机器人动力学参数。注部署阶段解码器直接丢弃不会参与推理。训练阶段解码器只是作为损失函数倒逼编码器的隐状态把球的真实运动信息编码进去。 实际运行时即便球短暂跑出视野策略也能依靠这一段历史隐状态推断球的大致去向表现出主动转头搜寻、原地旋转扫描等涌现行为。同时研究使用了多Critic设计把进球稀疏奖励、运动风格奖励拆分成两组价值估计器分别估算回报再加权计算优势函数更新策略。解决进球奖励极度稀疏带来梯度噪声大、训练震荡的问题。图 | 多样步态行为可视化。利用UMAP把关节轨迹降维到二维平面可以看到策略自发形成5类清晰步态簇直行、左转、右转、左脚踢球、右脚踢球策略可以在这些行为之间平滑切换完成搜球、追球、射门连贯任务03 实验指标数据、行为涌现与真实赛事表现实验分为仿真测试、真机多场景测试、RoboCup真实比赛三个层级。需要注意论文中大部分指标来自可控测试集真实赛场环境更复杂指标会存在一定衰减。图 | 验证与行为分析。A是仿真8192次测试得到的场地热力成功率图圆圈代表真机10次重复测试结果B‑E展示机器人搜球行为和自适应步态接近足球时步频变快、步幅缩短方便微调落脚点完成射门关键定量指标对比对比规则基准方案球位置估计均方根误差降低46%。射门前最后一秒原始感知误差0.344m策略内部估计下降到0.186m。人形机器人脚弓才0.23m这个量级误差降低对踢球命中至关重要。踢球耗时大幅缩短规则基线机器人背对球门时踢球耗时接近5秒这套学习策略无论初始朝向平均约1.5秒完成踢球动作时间最高缩短64%。真机成功率前场靠近球门位置80‑90%后场难度较高区域60‑70%所有测试没有出现机器人摔倒平衡稳定性表现优秀。视觉遮挡鲁棒性仿真模拟球检测被屏蔽0.3秒以内短暂遮挡依然90%试验可以完成踢球遮挡超过0.6秒机器人识别观测失效自动切换旋转搜球模式。滚动足球测试球速0.5m/s以内踢球成功率大于50%球速进一步提升拦截难度上升成功率逐步下降。机器人会出现侧向碎步拦截、原地快速转身等动态响应步态。图| 滚动足球反应式踢球。A为足球横向滚动机器人敏捷侧向移动拦截B为足球滚向机器人后方机器人两步之内完成大角度转向C为不同球速下踢球、进球成功率与耗时包含仿真与真机结果对比非常有意思的涌现行为这套统一策略并没有人工写这些逻辑全部是强化学习训练中自发产生主动感知行为球跑到视野边缘机器人主动转动头部、躯干把球拉回相机视场中心维持跟踪。分策略搜球逻辑丢失球的时候如果机器人处在场地边缘机器人优先向场地中心移动扩大可视范围到达中心之后原地旋转扫描全场。自适应步态切换离球远的时候步频低、步幅大兼顾移动效率和视觉跟踪靠近足球瞬间自动切换为小步快频步态精细调整落脚点为踢球做准备。特殊钩射动作球门在身后直接单支点侧摆腿勾射省去原地大回转压缩反应时间。RoboCup真实赛事落地该算法作为技能模块集成进了清华火神队完整比赛系统。RoboCup成人尺寸人形联赛规则限制严苛机器人全部自主运行禁止激光雷达、多摄像头这类超越人类感知能力的传感器只允许机载单相机。比赛场地光照、地面条件会变化赛前留给机器人调试时间很短。队伍拿下RoboCup2025成人组、世界人形机器人运动会双冠军总共打进76球丢11球。场上会出现对手冲撞、视觉遮挡算法模块依然稳定输出踢球技能。图| 控制器在各类场景下的表现。A‑C世界人形机器人运动会比赛D‑F RoboCup比赛G‑H机器人对足球的动态响应04 落地启示很多人形机器人任务现实硬件一定会遇到噪声、延迟、目标短暂丢失。传统思路是感知模块尽量修复所有问题而这套工作把传感器缺陷直接放进仿真训练循环策略在优化运动的同时同步学会怎么“看懂不完美的信号”甚至衍生转头搜球、时序推断等主动感知行为。这篇工作给人形具身智能提供一个很有参考价值范式与其一味追求感知模块输出完美无缺的真值不如让控制策略本身去学习处理感知的不确定性。当然这并不代表模块化方案彻底过时。这套算法是踢球底层技能模块完整机器人比赛系统依然需要上层的高层战术、状态管理模块配合。但它证明感知‑运动紧耦合统一策略可以真正走出仿真在严苛真实对抗赛场稳定发挥。Ref论文标题Learning vision‑driven reactive soccer skills for humanoid robots
返回列表