
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09UniJEPA让机器人同时“听懂、预见、动起来”的统一表征学习导读机器人操作模型需要同时解决两类本质不同的问题一类是“把自然语言任务听懂”例如“把橙子从架子上拿下来”另一类是“估计下一刻会发生什么”例如机械臂绕开障碍后目标是否还在可抓取区域。前者适合离散的语言符号后者更像连续的物理过程。把它们混成同一种 token 去学习往往会让模型在语义、预测和控制之间相互牵制。UniJEPA 的答案是把统一放在共享主干与联合训练上而不是强迫所有信息使用同一表示离散分支负责理解与规划连续分支预测未来视觉特征动作分支以 flow matching 生成连续动作块。作者将这条路径概括为understanding → generation → execution理解→生成→执行。在仿真和两类真实机器人上论文报告其对分布外物体、长程任务与跨平台控制有更稳健的泛化表现。论文UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation LearningICML 2026arXiv v3项目页UniJEPA Project关键词具身智能、VLA、世界模型、连续表征、机器人操作、Flow Matching图 1论文总览。UniJEPA 将任务理解、未来视觉预测和机器人执行放进一个共享骨干但保留各自匹配的表示与专家头。图片来源论文 Figure 1。一、先说结论UniJEPA 的创新到底是什么如果只记住一句话UniJEPA 不是“让 VLA 多输出几句推理文本”而是让策略在执行前先在连续特征空间里预测未来再用这个预测去约束动作生成。它有三个相互咬合的设计。离散与连续分工而不割裂。语言问答、子任务规划属于离散输出用交叉熵学习未来观测的演化则在视觉编码器的连续特征空间中用均方误差学习。两者共享主模型却由不同专家处理。把“看见未来”变成策略的中间变量。模型并不直接回归未来 RGB 图像而是预测冻结视觉编码器给出的未来特征。这样既保留了与物体、布局、运动有关的信息也避开像素级预测对纹理细节的过度执着。动作采用生成式而非单点回归。动作专家使用 flow matching从噪声动作块逐步去噪至可执行轨迹。它天然适合连续控制中的多模态解——同一个“拿起杯子”可以有多条合理接近路径。这不是传统意义上“世界模型先滚动很多步、再规划”的完整闭环规划器更准确地说UniJEPA 把未来状态预测作为策略训练与推理中的条件信息借此让动作模型获得面向后果的表示。二、论文要解决的痛点VLA 为什么会在新物体上失灵现有通用机器人策略常从视觉语言模型出发它们很擅长识别“橙子”“抽屉”“右侧”却未必理解“手臂这样移动后遮挡、接触和可达性会怎样变化”。反过来像素级视频生成虽能建模动态却容易把大量算力耗在背景纹理、光照等与控制无关的细节上。因此单一离散 token 空间不够承载连续动力学单一像素空间也不够承载任务语义。UniJEPA 的关键判断是机器人策略需要同时拥有语义坐标系与动态坐标系。三、方法拆解一个骨干三个专长图 2模型结构。共享 UniJEPA 主干之上配置理解、生成、动作三类专家雪花代表冻结模块火焰代表可训练模块。图片来源论文 Figure 2。3.1 输入不是一串 token而是一条有层级的因果序列给定当前观测o t o_tot、语言指令l ll、本体状态s t s_tst模型将图像、文本、未来连续特征、状态与动作组织为带块因果掩码的序列同一模态内部可双向交互模态之间则遵循从观测到预测、再到动作的因果顺序。这样动作不能“偷看”真实未来却可以读取模型自己预测出的未来表征。底座是 PaliGemma 视觉语言模型。作者没有为三项任务完全复制三个大模型而是在共享骨干中加入 Mixture-of-TransformersMoT式的专用 QKV 投影与 FFN理解专家服务文本预测生成专家服务未来特征动作专家服务控制。这种安排比“所有任务共用一套头”更少互相干扰也比三套独立模型更节省主体参数。3.2 连续预测预测“有意义的未来”而非每个像素对于未来时刻的视觉表示c cc生成专家根据当前观测和指令给出预测c p r e d c_{pred}cpred。第一阶段的联合目标可写成$$\mathcal{L}1 \frac{1}{n}\sum_i\lVert c{pred}{(i)}-c{(i)}\rVert_2^2\frac{1}{m}\sum_j\log P_\theta(d_j\mid d_{j},l,o_t).$$前半部分是未来连续特征的 MSE后半部分是文本、问答或规划 token 的交叉熵。论文比较了蒸馏特征、DINOv3 与 SigLIP最终选择 SigLIP因为它与 VLM 原生视觉嵌入的对齐更自然。这里的取舍很重要控制不需要像视频生成那样复原所有像素却需要保留物体位置、接触前后关系等可行动信息。3.3 动作生成用 flow matching 产生一段动作第二阶段将动作块A AA与高斯噪声ϵ \epsilonϵ在时间τ \tauτ上插值A τ ( 1 − τ ) ϵ τ A , L f l o w E ∥ U ( A τ , o t , s t , l , τ ) − ( A − A τ ) ∥ 2 2 . A_\tau(1-\tau)\epsilon\tau A, \qquad \mathcal{L}_{flow}\mathbb{E}\left\lVert U(A_\tau,o_t,s_t,l,\tau)-(A-A_\tau)\right\rVert_2^2.Aτ(1−τ)ϵτA,LflowE∥U(Aτ,ot,st,l,τ)−(A−Aτ)∥22.其中U UU是动作专家学习的速度场。训练时动作专家一边学习从噪声恢复动作一边继续接收未来视觉特征预测损失L 2 1 n ∑ i ∥ c p r e d ( i ) − c ( i ) ∥ 2 2 L f l o w . \mathcal{L}_2\frac{1}{n}\sum_i\lVert c_{pred}^{(i)}-c^{(i)}\rVert_2^2\mathcal{L}_{flow}.L2n1i∑∥cpred(i)−c(i)∥22Lflow.直觉上这相当于要求策略不仅回答“现在手该往哪里走”还要让该动作与“接下来场景应如何变化”的预测一致。论文在真实机器人中使用 10 步动作块这会提升轨迹连贯性但也意味着部署时仍需依赖持续的视觉重观测来纠正误差。四、训练数据与训练流程先学世界变化再把它接到手上第一阶段使用混合数据进行统一预训练约 32 万段带细粒度子任务和完整任务描述的机器人视频、约 87 万段机器人/人类操作视频以及 56 万条通用视觉问答数据。前两类数据构成任务指令到未来表征TI2E与具身问答训练通用 VQA 用于缓解语言视觉能力遗忘。论文摘要将其概括为超过百万规模的互联网操作视频预训练。第二阶段只用具身数据将连续预测表征映射到动作。最终模型共 29 亿参数约 23 亿为 VLM 主体生成与动作专家各约 3 亿。论文强调额外专家增加的是训练参数容量在其设计下不额外增加推理延迟但这仍是一种资源较重的路线并非面向极小端侧模型的方案。图 3评测覆盖两套仿真基准与两类真实本体。图片来源论文 Figure 3。五、实验告诉我们什么不要只看“谁的分数最高”5.1 仿真连续预测带来的收益最清楚在 CALVIN ABC→D 长程任务中UniJEPA 的平均完成子任务数为4.11/5略高于 UP-VLA 的 4.08在 SimplerEnv 的 WidowX 设置中报告平均成功率为71.0%Google Robot 设置为78.4%。不同方法的输入视角、是否重现实验并不完全一致论文也对部分基线标注了复现结果因此这些数字更适合用来观察趋势而不宜简单视为完全公平的排行榜。更有说服力的是消融在 WidowX 上去掉预训练且不做连续预测时平均成功率为49.8%加入连续特征预测后为69.3%再加上统一预训练达到71.0%。这说明未来特征并非可有可无的辅助头而是策略泛化的重要来源。5.2 真实机器人新物体才是重点考题作者在 7 自由度 Franka 机械臂和带灵巧手的 12 自由度 XArm 上测试覆盖抓取、放置、开合抽屉、按键、线缆等操作并区分已见物体、未见物体与误导性物体。论文摘要报告UniJEPA 相比强基线在仿真和真实分布外场景上分别提升约9%与12%。图 4Franka 真实任务的成功率对比。图片来源论文 Figure 4。图 5灵巧手任务及分布外任务结果。图片来源论文 Figure 5。在 XArm 的三项消融任务上完整 UniJEPA 平均成功率为76.7%去掉预训练降至60.8%去掉离散理解预训练为71.7%。它揭示了一个容易被忽视的事实连续预测很关键但离散任务理解仍不能省——机器人面对新物体时先得准确知道“要拿什么、放到哪里”。六、猫先生认为UniJEPA 的价值不在于把模型做得更“大”UniJEPA 最值得借鉴的是它对 VLA 内部矛盾的处理方式语义理解和物理演化不是竞争关系而是需要不同接口的协作关系。文本 token 适合表达可组合的任务意图连续特征适合保留时间变化生成式动作头适合表达多种可行轨迹。共享骨干负责信息流通专用专家负责避免表示互相污染。这也给“世界模型是否一定要生成视频”提供了一个实用答案未必。对控制而言真正需要的是足够预测动作后果、又与策略可对接的表征。UniJEPA 把世界建模压缩为未来视觉特征预测是一条相当务实的折中路线。不过仍有三点需要冷静看待第一29 亿参数与两阶段大规模视频训练的成本不低第二真实实验覆盖两种本体、有限任务与试验次数跨实验室、跨传感器和长时间自治仍待验证第三10 步动作块能带来平滑性也可能在突发接触或观测误差下放大开环偏差。未来更值得关注的方向是让这种连续“预见”与在线重规划、不确定性估计和更轻量的端侧部署结合起来。七、读完论文你应该带走的 5 个要点统一不等于单一表示。离散语言和连续动态可以共享模型但不必共享同一种预测空间。未来特征是控制友好的世界模型接口。它比像素预测更聚焦于任务相关变化也能直接条件化动作。专家化是多任务 VLA 的实用解法。MoT 在共享主体中为理解、生成、执行保留专长。预训练与连续预测缺一不可。实验显示两者分别为真实泛化与仿真控制带来可观增益。评价重点应从“已见物体分数”转向“新物体下是否仍理解任务并预测后果”。这正是通用机器人真正的难题。参考资料UniJEPA 论文arXivUniJEPA 项目页推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列