ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

华科、东风联合开源SimWAM:面向量产部署的世界动作模型

华科、东风联合开源SimWAM:面向量产部署的世界动作模型 「训练用视频、推理丢视频」目录01 训练用视频、推理丢视频1.1 双流解耦协同训练视频专家只做训练监督1.2 隔离注意力掩码实现训练/推理架构分割1.3 SDE随机流GRPO强化学习跳出模仿局限02 两大原生拓展优势视频/网络规模自由插拔2.1 视频骨干可无缝替换2.2 动作网络独立缩放03 单相机碾压全品类规划方案3.1 NAVSIM闭回路量化结果3.2 零样本泛化nuScenes04 落地价值当前自动驾驶世界动作模型WAM普遍采用先脑补未来画面、再规划轨迹的推理逻辑实时生成多帧预测视频规划器才能看懂交通动态。但视频生成的算力开销巨大主流方案推理耗时动辄2000ms以上车载硬件很难落地。华中科技大学联合东风研究院推出SimWAM彻底推翻“推理阶段生成未来帧”的固有范式视频模型只在训练阶段充当监督信号向轻量化动作专家灌输交通动力学先验训练完成即被丢弃上车部署的只剩一个直接预测轨迹的轻量网络。凭借训练用视频、推理丢视频的设计SimWAM 以单前视相机在 NAVSIM 基准拿下91.5 PDMS学习方法第一推理延迟骤降至数百毫秒还能零样本迁移至 nuScenes——把 WAM 从云端演示拉进了可上车部署的区间。图 | NAVSIM基准PDMS-延迟对比图01 训练用视频、推理丢视频整套框架分为双流联合训练、隔离注意力掩码、流匹配GRPO强化学习三大部分无复杂冗余模块整体架构清晰。图 | SimWAM整体框架图1.1 双流解耦协同训练视频专家只做训练监督SimWAM包含完全独立、无参数共享的两个专家网络视频专家基于开源Wan2.2-5B视频DiT预训练模型搭配VAE与T5文本编码器负责预测未来多帧画面输出稠密时序动力学监督信号学习车辆、行人、道路的运动规律轻量化动作专家隐藏维度仅1024的小型DiT输入当前相机画面、自车状态、导航指令输出4秒时长、2Hz频率的8个轨迹路点。两者依靠统一注意力接口交互采用联合流匹配损失联合训练公式5公式简化理解总损失轨迹流匹配损失加权视频流匹配损失视频分支仅用来给动作网络灌输交通动力学先验不参与最终推理。λ用于平衡视频、轨迹两个任务的训练权重论文固定λ1无需复杂调参。训练完成后直接删除整套视频DiT、VAE解码器仅保留动作专家用于车端部署推理彻底摆脱视频生成开销。1.2 隔离注意力掩码实现训练/推理架构分割这是全文最关键的创新点也是实现“训练有视频、推理无视频”的核心开关。训练阶段共享注意力层包含三类Token当前观测Token、未来视频Token、轨迹动作Token隔离掩码规则未来视频Token与动作Token互相不可见两者只能读取当前观测特征。训练收益动作网络只能从当前画面提取环境动态知识不会过度依赖未来帧的视觉捷径推理收益动作网络完全不依赖未来视觉输入删掉视频分支不会破坏轨迹预测逻辑传统双向注意力方案无法做到这一点。图 | 注意力掩码消融实验消融数据能证明隔离掩码不仅不损失精度还优化了无碰撞NC、碰撞时间TTC安全指标同时解锁推理轻量化能力是兼顾性能与效率的最优选择。1.3 SDE随机流GRPO强化学习跳出模仿局限仅靠流匹配模仿学习模型轨迹偏保守路口、窄路前进距离短通行效率EP分数低。论文借鉴Flow-GRPO将确定性流ODE转换为随机SDE方程支持多条候选轨迹采样采用组相对策略优化GRPO做强化学习每次场景采样8条候选轨迹基于NAVSIM复合驾驶奖励打分仅微调动作专家LoRA低秩适配器冻结主干网络避免破坏视频训练学到的动力学先验强化训练仅聚焦模仿阶段PDMS低于90的困难场景减少简单样本稀释学习信号。图 | 两种测试场景下 Ours-IL 与 Ours-RL 方案定性对比红色椭圆标注区域体现 Ours-RL 可在合规可行驶区域内行驶更远红色椭圆清晰对比纯模仿模型在路口保守慢行RL优化后的轨迹充分利用可行驶区域前进距离更长同时保持安全距离直接拉高EP、DAC核心得分。表2组件消融直观展示三层模块的叠加增益图 | 模块增量消融结果双流训练带来3.7分巨大提升强化学习再追加1.2分三个模块缺一不可。02 两大原生拓展优势视频/网络规模自由插拔SimWAM双流无参数绑定的架构带来传统WAM不具备的灵活拓展能力适配不同算力硬件、不同视频预训练底座。2.1 视频骨干可无缝替换动作专家完全不绑定特定视频预训练模型更换LTX-Video、Cosmos、Wan系列视频模型无需改动训练、推理流水线。图 | 不同视频骨干对比专为驾驶场景训练的Cosmos模型能输出更强动力学先验分数小幅领先证明行业后续视频大模型迭代红利能直接平移到SimWAM规划器不用重构整套智驾算法。2.2 动作网络独立缩放可根据车载算力自由调整动作专家参数量视频骨干保持不变推理成本可控。图 | 动作DiT缩放实验低端车载硬件选用0.21B轻量化版本高端域控可上1B大模型平衡精度视频训练开销固定迭代成本极低。03 单相机碾压全品类规划方案3.1 NAVSIM闭回路量化结果赛道分为传统端到端、VLA视觉语言规划、世界模型WAM三大类SimWAM以单前视相机输入实现全场最高91.5 PDMS图 | NAVSIM navtest 基准上与主流前沿规划方案的对比对比最强VLA方案SGDrive91.1高出0.4分对比主流WAM DriveWAM90.1、DriveLaW89.1分别高出1.4、2.4分DAC可行驶合规、EP通行效率两项指标在WAM赛道排名第一安全指标NC、TTC保持行业顶尖水平。结合延迟曲线能看清核心差异化其他高分方案推理耗时普遍2000ms以上SimWAM推理仅数百毫秒车端实时性具备碾压级优势。3.2 零样本泛化nuScenes模型仅在NAVSIM数据集训练不做任何微调直接测试nuScenes开环规划平均碰撞率仅0.04%平均L2轨迹误差0.96m优于DriveWAM、Epona等同类WAM证明从仿真学到的通用交通动力学先验可以跨数据集迁移减少实车标注数据依赖。图 | 零样本泛化nuScenes04 落地价值SimWAM 的价值不在于提出新理论而在于解决了一个工程上的致命问题。WAM 路线的核心洞察——用视频生成模型为驾驶规划注入交通动力学先验——本身没有问题。问题出在什么时候用。现有方案把视频生成塞进推理回路相当于让车一边开车一边做梦算力自然爆炸。SimWAM 的回答很简单做梦是训练时的事上路之后只需凭本能反应。这个思路并不复杂但要把训练有视频、推理无视频真正跑通需要隔离注意力掩码、双流解耦训练、流匹配强化学习三件事配合得天衣无缝。华中科技大学和东风研发总院不仅把这套方案跑通了还开源了代码和权重——对主机厂来说这是一个可以直接拿来迭代量产方案的标准化基线。更值得关注的是它的扩展性视频骨干可插拔意味着视觉生成领域的每一次进步都能直接反哺规划器动作网络可缩放意味着同一套框架从低端域控到高配车型都能适配。WAM 路线离量产落地可能就差这一步。Ref论文标题SimWAM: A Simple World Action Model for End-to-End Autonomous Driving论文链接https://arxiv.org/pdf/2608.07468代码链接https://github.com/H-EmbodVis/SimWAM
返回列表