
摘要本文解读 ICML 2025 论文《General agents need world models》也就是「通用智能体必然包含世界模型」这一结论的来源。该论文提出智能体即世界模型这一必要性定理通过融合有界目标条件智能体的形式化定义、复合目标查询构造与信息论意义上的识别性分析回答「世界模型究竟是灵活目标导向行为的必需品还是仅仅能提升样本效率的一种手段」其特别之处在于把一场长期停留于经验的哲学争论改写成一个可证明的识别性问题——只要能从策略反推出环境转移概率就说明世界模型已经被编码在策略之中。实验表明即使最坏情况 regret 达到 1、定理前提在每一次实验中都不成立恢复误差仍按 $\mathcal O(n^{-1/2})$ 衰减20 状态 5 动作稀疏 cMP 上平均误差从 0.171 降到 0.031这为世界模型研究、机制可解释性与 AI 安全审计提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现论文写作与叙事视角局限性常见问题FAQ这篇论文证明了什么「世界模型」在这篇论文里指什么为什么这项结论对无模型方法是个坏消息实验是在什么规模上做的能外推到真实系统吗有没有反方立场这篇论文为什么值得关注参考链接论文基本信息项目内容标题英文General agents need world models标题中文通用智能体必然包含世界模型目标导向泛化蕴含环境动力学作者Jonathan Richens, Tom Everitt, David Abel机构Google DeepMind会议ICML 2025PMLR 267:51659–51687arXiv2506.01622预印本题为General agents contain world models作者四人项目网站PMLR 正式版页面本文无独立项目主页背景与动机争论的一端是「不要表示」。Brooks 在 1991 年的Intelligence without representation中提出「世界本身就是最好的模型」主张智能体可以完全依靠动作—感知回路不必学习显式的环境表示。这条路线后来在实践上被大量通用策略印证也确实让研究者绕开了建模真实世界这件极难的事。另一端是显式模型。MuZero 用学到的隐空间模型配合 MCTS在围棋、国际象棋、将棋与 Atari 上都达到当时最好水平DreamerV3 用单套超参数覆盖上百个任务证明隐空间动力学加「想象中训练」是可以规模化的。显式模型还带来规划、样本效率、可解释与安全审计上的好处。问题在于双方都没有回答一个更根本的疑问一个能泛化到各种任务的智能体是不是其实早就学到了世界模型只是没有被显式地写出来现有工作各有短板这也是本文想补的位置。逆强化学习Ng 与 Russell 的工作是从策略和世界模型反推奖励而且必须知道智能体在多个环境下的最优策略才能唯一确定奖励机制可解释性Li 等人 2022 年的涌现世界表示、Bricken 等人 2023 年的稀疏自编码器确实在模型内部找到了状态表示但探针与自编码器都是针对特定智能体—环境系统拟合的至少部分是监督式的而且恢复的是「状态空间」而不是转移概率Savage 式表示定理可以为任意策略拟合出一个世界模型连均匀随机策略也不例外因此它无法说明智能体学到了真实动力学1970 年的好调节器定理只证明「最小化环境熵的智能体必须有确定性策略」而这个策略完全可能是把同一个动作分配给所有状态的常函数。作者自己的前作Robust agents learn causal world modelsICLR 2024证明了域泛化需要因果世界模型但任务泛化是否需要世界模型仍然悬而未决——这正是本文要回答的问题。把问题放回历史脉络会更清楚。世界模型这条线并非始于深度学习1990 年前后Sutton 的 Dyna 架构与 Schmidhuber 的可微世界模型就提出「先学模型再在模型里规划与学习」2018 年 Ha 与 Schmidhuber 的World Models把 world model 固定为深度强化学习的术语并确立了 RSSM 这一隐空间动力学血统2019 到 2023 年PlaNet、Dreamer、MuZero 与 TD-MPC2 让「隐空间模型 想象中训练」成为主流DreamerV3 更以单套超参数覆盖上百个任务2024 年之后生成式视频模型与学习型模拟器开始直接进入机器人策略训练与数据合成。本文的意义在于把「世界模型有用」这一工程直觉升级成「没有世界模型就没有一般智能体」的信息论陈述。反方立场同样需要记住在有限时域的表格 MDP 上Zhang、Zhou 与 JiNeurIPS 2020证明无模型算法也能达到统计最优Jin 等人2018也证明了 Q-learning 的样本效率Silver 等人2021的Reward is Enough则从假设层面主张奖励最大化足以催生智能——本文的反驳点因此不在单步最优性而在多步复合目标。研究主线从问题到结论图 5本文的研究主线Mermaid 流程图。问题引出模型与无模型的路线之争动机转化为有界智能体上的可测参数方法用复合目标查询加识别性分析落地实验在 20 状态稀疏 cMP 上验证最终得到无模型路线不存在的结论。基准/方法设计本文的框架只依赖三个对象它们构成一个「已知两个求第三个」的三角关系。对象含义谁来给定环境受控马尔可夫过程 cMP由状态集、动作集与转移函数 $P_{ss}(a)$ 组成假设它有限、通信、平稳且动作数不少于 2目标LTL 表达的复合目标由若干子目标按顺序组成深度 $n$ 即子目标个数策略目标条件策略 $\pi$把历史与目标映射为动作由智能体给出图 1本文补齐了环境—目标—策略三角的第三条边。规划是从世界模型和目标推出策略逆强化学习与逆规划是从策略和世界模型推出目标而本文是从策略和目标反推出世界模型。关键在于本文对「智能体」的定义刻意写得极弱有界目标条件智能体只需要满足一个相对最优策略的 regret 保证即在所有深度不超过 $n$ 的目标 $\psi$ 上达成概率不低于最优策略的 $1-\delta$ 倍。这里 $\delta$ 是失败率$n$ 是它能稳定处理的最大目标深度。全文不假设任何理性公理不要求智能体拥有完整的偏好序也不要求它理性——只要求它在某类任务上「够好」。世界模型则被定义为转移函数的任意近似 $\hat P_{ss}(a)$其误差 $|\hat P_{ss}(a)-P_{ss}(a)|$ 不超过 $\epsilon$。分类全景把本文与它的前作放在一起看可以画出一张「智能体需要多少环境知识」的阶梯图。图 6智能体所需环境知识的阶梯Mermaid 分类图。只优化即时后果的 myopic 智能体边界平凡且紧任务泛化要求预测型世界模型由本文 ICML 2025 证明域泛化要求因果世界模型由前作 ICLR 2024 证明。这里有一个反直觉推论值得单独点出把本文与 ICLR 2024 的前作并列会得到「域泛化要求比任务泛化严格更多的环境知识」。原因是只要求泛化到新目标时智能体可以完全不掌握环境变量之间的因果关系而要求适应新的分布时因果关系就变成了不可回避的知识。作者据此提出这里可能存在一个智能体版本的 Pearl 因果阶梯。方法细节方法的核心思想非常朴素不去假设智能体拥有模型而是构造一类特殊的复合目标去提问让智能体在第一个动作上就把转移概率之间的大小关系暴露出来。图 2智能体把状态 $s_t$ 或历史与目标 $\psi$ 映射为动作 $a_t$图中虚线箭头就是本文的恢复算法它不需要读取智能体的内部结构只依赖这条映射就能重建环境的转移概率。具体做法如下。构造由 $n$ 次独立尝试组成的复合目标每次尝试要么走向目标结果 $s$、要么走向其余状态集合 $\neg s$于是「至少成功 $r$ 次」的概率恰好是二项分布 $\frac{n!}{(n-r)!\,r!}P^r(1-P)^{n-r}$。接着把两个备选动作分别绑在「成功次数不超过阈值」与「成功次数超过阈值」两个分支上随着阈值 $k$ 递增智能体的最优动作会在两个动作之间翻转一次翻转点 $k^$ 就是转移概率的函数于是有 $\hat P_{ss}(a) \leftarrow (k^-1/2)/n$。把 Berry–Esseen 型不等式代进去把二项尾概率换成转移概率的区间再按目标深度与尝试次数的二倍关系代换就得到主定理的闭式界$\left|\hat P_{ss}(a) - P_{ss}(a)\right| \leq \sqrt{\frac{2 P_{ss}(a)(1-P_{ss}(a))}{(n-1)(1-\delta)}}$。当 $\delta$ 远小于 1、$n$ 远大于 1 时误差按 $\mathcal O(\delta/\sqrt n) \mathcal O(1/n)$ 缩放。图 3主定理证明中的复合目标结构。从状态 $s$ 出发执行动作 $a$以概率 $p$ 进入目标结果 $s$、以概率 $1-p$ 进入其余状态的集合 $\neg s$每次尝试结束后都以概率 1 回到 $s$重复 $n$ 次之后「成功次数是否超过阈值」这个二项比较就把 $p$ 的大小暴露了出来。这一构造带来两个必须强调的技术细节。第一证明只要求智能体在一小部分复合目标上满足 regret 保证其数量的量级是 $n|\mathbf{A}||\mathbf{S}|^2$而不是要求它在全部目标上都够好——这正是「世界模型会随训练自然涌现」的机制解释。第二恢复映射存在本身就构成世界模型的可识别性算法不需要激活、不需要监督权重不可见时同样适用对阈值 $k$ 的线性搜索可以换成二分复杂度降到对数级。本文给出两个具体算法。Algorithm 1 对成功次数低于与高于阈值的两种情形各取一次析取能逼近主定理给出的误差界Algorithm 2 只比较两条最简的序列目标再用 $k$ 次重复细分误差界更弱但实现简单得多本文的全部实验都使用 Algorithm 2。下图是论文中恢复算法与策略之间的对应关系。实验设计与结果实验刻意选择最简的非平凡设置用来检验「误差是否按理论预测的阶衰减」。评测协议环境是随机生成的受控马尔可夫过程含20 个状态与 5 个动作转移函数带稀疏约束每个状态动作对至多有5 个非零结果以保证导航到目标状态不是平凡问题。智能体是基于模型的其模型由最大随机策略采样出的轨迹学习能力通过把轨迹长度 $N_\text{samples}$ 从500 提升到 10,000来增强。评测时作者有意把最坏情况 regret 放宽成平均regret用来专门测试定理前提被违反的区间每个经验量训练10 个不同随机种子的智能体每个智能体再查询从10 到 600的目标深度。下表是主结果表内为平均世界模型误差行是可达目标深度 $N_\text{depth}$列是经验轨迹长度 $N_\text{samples}$完整的 11 组经验量矩阵见附录实验表格。平均误差5001000500010,000$N_\text{depth}10$0.1710.1370.0820.066$N_\text{depth}50$0.1570.1080.0480.034$N_\text{depth}100$0.1560.1060.0460.032$N_\text{depth}600$0.1550.1040.0440.031完整实验矩阵10 个智能体重训后的均值标准差均不超过 0.009$N_\text{depth}$ \ $N_\text{samples}$50010003000600010,000100.1710.1370.0970.0780.066200.1600.1180.0730.0540.044500.1570.1080.0630.0440.0341000.1560.1060.0600.0410.0322000.1550.1050.0590.0400.0316000.1550.1040.0580.0400.031图 4左图是恢复出的世界模型平均误差 $\langle\epsilon\rangle$ 随可达目标深度 $N_\text{max}(\langle\delta\rangle0.04)$ 的下降标度为 $\mathcal O(n^{-1/2})$与定理给出的最坏情况界同阶右图是平均误差随深度 50 目标的平均 regret $\langle\delta\rangle$ 上升近似指数增长。误差棒是 10 次不同经验轨迹重训得到的 95% 置信区间。结果对比总结图 7关键结果对比Mermaid 流程图。即使最坏 regret 达到 1、定理前提在实验中失效平均模型误差仍从 0.171 降到 0.031按目标深度的平方根速率衰减与定理给出的界同阶因此世界模型依然可被准确提取。关键发现前提失效结论仍成立在全部 11 组经验量与全部 10 个目标深度上智能体对某些目标的最坏 regret 都达到了 1也就是说 Theorem 1 的假设在任何一次实验中都不成立但平均误差仍按 $\mathcal O(n^{-1/2})$ 衰减。误差双向下降目标深度为 10 时误差从 0.171 降到 0.066深度为 600 时从 0.155 降到 0.031说明越擅长完成长程任务的智能体其策略里的世界模型越精确。两个饱和现象目标深度从 200 增到 600 几乎不再改善误差0.031 对 0.031说明收益主要来自经验量而非更深的查询而经验量从 500 增到 10,000 让误差降低一半以上。对平均 regret 的敏感性误差随平均 regret 近似指数上升拟合形式为 $y 0.01\left(0.32e^{66.8\langle\delta\rangle} 1.12\right)$因此「平均而言够好」是恢复成功的实际条件。相对误差的例外把误差界两边同时除以 $P_{ss}(a)$ 会发现对 $P_{ss}(a) \ll 1$ 的低概率转移相对误差可以非常大——这意味着不完美或有限视界的智能体只需要学习稀疏的世界模型覆盖常见转移即可。必要性的边界对于只优化即时后果的最优 myopic 智能体转移概率的界平凡$\epsilon 1$而且紧说明世界模型的必要性真正来自多子目标与长时程的目标结构而不是来自「做目标导向行为」本身。论文写作与叙事视角除了结论本身这篇论文的写法也值得单独拆解因为它是一篇典型的「把不可回答的问题改造成可解问题」的论文。叙事弧线是三段式。摘要首句直接把辩论立成二选一「Are world models a necessary ingredient for flexible, goal-directed behaviour, or is model-free learning sufficient?」结论则把新定理接进两千年的旧直觉——「It can be traced as far back as Democritus, who claimed that man is a microcosm」并引用 Friston 的「an agent does not have a model of its world---it is a model」而中间用一句「While this relation between agents and environments has long been hypothesised, we have sought to formalise and prove it」明确声明本文做的是形式化而不是提出新直觉。这种「双问开局 → 历史锚定 → 承诺兑现」的结构是这篇论文读起来不像纯理论工作的主要原因。措辞上有两个可复用的动作。一是强断言与克制的新颖性声明并存正文用「must have learned a predictive model」这种前置的强断言但新颖性只声明为「We provide a formal answer to this question」不自称 first二是把模糊概念替换成可测量参数全文用失败率 $\delta$ 与最大目标深度 $n$ 承担了「智能」这个词原本的模糊性。从顶会写作模式的视角看本文同时命中三种创新模式。一是把哲学争论重述为一个可解的识别性问题把「是否需要模型」变成「能否从策略反推转移概率」二是审计并扭转无模型路线的隐含负载假设把「能力」显式写成可测的 $\delta$ 与 $n$ 而不是理性公理三是先刻画 myopic 极限、再证明多步目标下极限被越过。前两种模式的组合在近两千篇 ICLR/ICML/NeurIPS 论文的统计里属于最稳定的「Oral 配方」而执行质量的落点是闭式误差界、极限的紧度证明以及前提失效最坏 regret 达到 1时仍然成立的实测。不过需要说清楚本文实际录用等级是 ICML 2025 Poster命中模式并不等于拿到 Oral实验规模20 状态也是它难以再进一步的原因。读原文时值得留意的几处瑕疵。结论句里把 its 写成了 its引用 Friston 时保留原文的 its world 则是正确做法讨论部分残留了若干 hedge例如「arguably simpler」「perhaps due to risk of death」「There are likely many such choices」源码中既没有致谢节正文也没有独立的 Limitations 小节局限以粗体段落的形式出现在 Discussion 内部。局限性仅覆盖完全可观测环境证明假设环境完全可观测在部分可观测情形下智能体究竟需要学到哪些隐变量才能获得同等的行为灵活性作者明确承认这是开放问题。是存在性不是使用性定理证明的是世界模型被编码在策略中而不是智能体在规划中使用它作者也避免对「智能体知道什么」作更深的认识论断言。环境假设过于理想结论建立在通信、平稳、有限的受控马尔可夫过程之上作者预期在含部分可观测或非马尔可夫动力学的现实环境中约束只会更强。这也意味着 regret-bounded 智能体实际上被限制在「可解」的领域内——那些我们能够学会模型并在其上做长时程规划的领域。证明的构造性局限算法的查询目标是精心构造的复合目标在真实的大规模智能体上如何高效地提出这些查询、以及如何把结果扩展到连续状态空间仍属于未来工作。myopic 盲区深度为 1 的最优智能体完全不需要转移概率因此「世界模型必需」这一论断并不适用于只优化即时后果的智能体类型。作者给出的未来方向是把分析推广到更广的目标类、寻找足以蕴含世界模型的「通用任务集」并发展可扩展的世界模型提取算法用于预测与审计黑盒智能体服务 AI 安全与可解释性。常见问题FAQ这篇论文证明了什么它证明任何满足 regret 保证的多步目标条件智能体其策略本身就唯一确定了环境的转移概率误差满足 $|\hat P_{ss}(a) - P_{ss}(a)| \leq \sqrt{2P(1-P)/((n-1)(1-\delta))}$。因此在信息意义上训练一个通用目标条件策略与学习一个世界模型是等价的。「世界模型」在这篇论文里指什么指对转移函数 $P_{ss}(a)$ 的任意近似误差不超过 $\epsilon$也就是可用于预测与规划的一步预测器。这与机制可解释性里常见的「状态表示」不同后者只刻画当前状态的空间结构并不能预测环境在动作下的演化。为什么这项结论对无模型方法是个坏消息因为它说明无模型路线无法绕过世界模型只要能零样本泛化到长时程任务世界模型就已经被编码在策略里了只是没有显式暴露。模型的保真度反过来界定了智能体泛化能力的上界——想要更强的泛化就必须更准确地建模世界。实验是在什么规模上做的能外推到真实系统吗实验规模很小20 个状态、5 个动作的稀疏受控马尔可夫过程10 个随机种子的智能体目标深度从 10 到 600。作者的目标是验证误差的标度关系而非绝对性能因此外推到真实系统需要额外的工程工作但前提失效最坏 regret 达到 1时结论依然成立这一点说明该现象有一定的鲁棒性。有没有反方立场有。在有限时域的表格 MDP 上Zhang、Zhou 与 Ji 在 NeurIPS 2020 的工作证明无模型算法同样可以达到统计最优Jin 等人 2018 年也证明了 Q-learning 的样本效率。本文的反驳点因此不在单步最优性而在多步复合目标一旦要求零样本完成需要多个子目标、跨越较长视界的任务世界模型就变得不可回避。这篇论文为什么值得关注它把「智能体是否需要世界模型」从一个只能靠经验表态的问题变成一个可以证明、也可以测量的识别性问题并顺带给出了一个只依赖黑盒策略的世界模型恢复算法。这解释了为什么在实践中模型无关的训练方式往往会自发地学到预测性结构——因为不学模型就没有长时程泛化。参考链接General agents need world modelsarXiv 2506.01622ICML 2025 正式版PMLR 267:51659–51687Richens Everitt, Robust agents learn causal world modelsICLR 2024Ha Schmidhuber, World ModelsarXiv 1803.10122Hafner et al., DreamerV3arXiv 2301.04104Schrittwieser et al., MuZeroarXiv 1911.08265Sutton, Dyna: An Integrated Architecture for Learning, Planning, and ReactingACM SIGART Bulletin 2(4), 1991Brooks, Intelligence without representationArtificial Intelligence 47:139–159, 1991Zhang, Zhou Ji, Almost Optimal Model-Free Reinforcement LearningNeurIPS 2020反方立场给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件