
摘要本文解读 NeurIPS 2018 论文《World Models》会议官方题名Recurrent World Models Facilitate Policy Evolution。该论文提出世界模型World Model框架通过融合VAE 空间压缩、MDN-RNN 时序预测与CMA-ES 进化优化让智能体在无监督学习的内部梦境中进化策略其特别之处在于控制器仅867 个参数的线性层即可解决像素级连续控制任务。实验表明完整世界模型以 906±21 分首次解出 CarRacing-v0梦境训练的策略迁移到真实 VizDoom 后得分 1092±556、反超排行榜最佳成绩 820±58为数据高效强化学习与后来的 Dreamer 系世界模型奠定了范式基础。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节组件与数据流参数量分布附录 A迭代训练与好奇心附录 D实验设计与结果任务与评测协议主结果CarRacing-v0100 次试验均值梦境训练与迁移VizDoom Take Cover温度扫描梦境不确定性的双刃剑附录 B结果对比总结关键发现局限性常见问题FAQWorld Models 和 Dreamer 是什么关系为什么控制器只用 867 个参数也能解出赛车任务梦境训练为什么迁移后表现反而更好世界模型被欺骗是怎么回事这篇文章为什么影响力这么大世界模型需要奖励信号吗参考链接论文基本信息项目内容标题英文World Models (Recurrent World Models Facilitate Policy Evolution)标题中文世界模型让智能体在梦境中学会驾驶与躲避作者David Ha, Jürgen Schmidhuber机构Google Brain · NNAISENSE · Swiss AI Lab IDSIA (USI SUPSI)会议NeurIPS 2018arXivarXiv:1803.10122项目网站worldmodels.github.io可交互版本背景与动机为什么传统强化学习难以训练大规模模型答案在于信用分配问题模型无关 RL 方法通常只能训练 $10^3$ 到 $10^6$ 参数的小网络迭代慢、难以覆盖复杂的时空表征。本文提出把智能体拆成大世界模型 小控制器复杂度全部转移到环境模型控制器只保留一个线性层。这项工作并非凭空出现Schmidhuber 早在1990 年的Making the World Differentiable就提出 RNN 世界模型C--M 系统2015 年的Learning to Think进一步给出统一框架。本文是这些理论构想在现代算力下的首次完整实验验证——此前最接近的 PILCO 依赖高斯过程无法扩展到高维像素输入而主流的 DQN/A3C 等深度 RL 基线在 CarRacing-v0 上只能拿到 343–652 分。图 1智能体由三个紧密协作的组件构成——视觉 V、记忆 M、控制器 C世界模型基于真实环境的观测序列无监督训练研究主线从问题到结论图 2研究主线——从信用分配困境出发经 V/M/C 分解、无监督世界模型训练与梦境进化最终在真实环境验证Mermaid 流程图基准/方法设计核心设计是把智能体拆成三个组件让世界模型承载几乎所有复杂度VVAE把 64×64 像素帧压缩为 32 维赛车或 64 维Doom潜向量 $z$只优化重建误差与 KL 散度训练 1 epoch。MMDN-RNN以混合高斯建模 $P(z_{t1} \mid a_t, z_t, h_t)$LSTM 隐单元 256/5125 个高斯混合训练 20 epochs。C线性控制器$a_t W_c [z_t\ h_t] b_c$参数量仅 867赛车/ 1,088Doom用 CMA-ES 进化优化。图 3V 视觉压缩、M 记忆预测、C 决策三个组件协同工作的总体结构分类全景图 4世界模型智能体的组件分类——V 压缩空间、M 预测时间、C 依据两者输出动作Mermaid 流程图方法细节组件与数据流智能体与环境交互的流程是原始观测先经 V 编码为 $z_t$C 把 $z_t$ 与 M 的隐状态 $h_t$ 拼接后输出动作 $a_t$M 依据 $z_t$ 与 $a_t$ 更新隐状态到 $h_{t1}$如此循环。图 5智能体与环境交互的数据流——原始观测经 V 编码C 以 $z_t$ 与 $h_t$ 输出动作M 更新隐状态附录 A 给出了完整的模型细节ConvVAE64×64×3 输入4 层卷积/反卷积stride 2ReLU潜向量 $z \sim N(\mu, \sigma I)$L2 重建 KL 损失。MDN-RNN对角协方差的混合高斯输出Doom 任务额外预测死亡概率超过 50% 判定 $done$。teacher forcing 时按 $\mu,\sigma$ 重采样 $z$ 防过拟合。控制器$\tanh$ 非线性把动作裁剪到合法区间方向盘 -1 到 1、油门与刹车 0 到 1。图 5VAE 流程图——编码器把图像压缩成潜变量 $z$解码器从 $z$ 重建原图图 6MDN-RNN——RNN 输出混合高斯分布的参数从中采样得到下一潜向量预测参数量分布附录 A模型CarRacingVizDoomVAE4,348,5474,446,915MDN-RNN422,3681,678,785控制器8671,088迭代训练与好奇心附录 D复杂环境需要迭代训练随机初始化 → 真实环境 rollout $N$ 次并存储 $(x_t, a_t)$ → 训练 M 建模 $P(x_{t1}, r_{t1}, a_{t1}, d_{t1} \mid x_t, a_t, h_t)$ 并训练 C → 未完成则回到 rollout。好奇心机制把 M 的预测误差取反作为内在奖励鼓励智能体探索陌生区域与神经科学中的海马体重放hippocampal replay记忆巩固现象相呼应。实验设计与结果任务与评测协议两个像素级任务CarRacing-v0连续控制、随机赛道100 次试验平均 ≥900 分解出与VizDoom Take Cover躲避火球生存100 次平均 ≥750 步解出。训练数据均为 10,000 次随机策略 rolloutV/M 全程不接触奖励信号C 用 CMA-ESpopulation 64 × 每个体 16 次种子 rollout进化。主结果CarRacing-v0100 次试验均值方法平均分备注DQN343 ± 18Deep RL 基线A3Ccontinuous591 ± 45Deep RL 基线A3Cdiscrete652 ± 10Deep RL 基线Gym 排行榜最佳838 ± 11ceobillionaireV model only632 ± 251无记忆行驶抖动V model hidden layer788 ± 141仍不解出任务完整世界模型VM906 ± 21首个解出 CarRacing-v0图 7限制控制器只看 $z_t$ 而不看 $h_t$——行驶抖动、急弯冲出赛道得分 632±251图 8同时接入 $z_t$ 与 $h_t$——行驶稳定、敢于进攻急弯得分 906±21图 9CarRacing 100 次试验累计奖励直方图绝大多数试验超过 900 分解出线梦境训练与迁移VizDoom Take CoverM 额外预测死亡事件 $d_t$在潜空间构成完整虚拟 Gym 环境控制器完全在梦境中进化虚拟得分约 900 步随后零成本部署到真实游戏——100 次平均约 1100 步远超 750 步解出线也高于虚拟环境内的表现。因为梦境在 $\tau1.15$ 下比现实更吵在更难的梦境中活下来的策略在干净现实里更强。图 10最终智能体在真实 VizDoom Take Cover 中躲避火球——策略无需任何调整直接部署图 11真实 VizDoom 环境 100 次连续试验存活步数直方图远超 750 步解出线温度扫描梦境不确定性的双刃剑附录 B温度 $\tau$虚拟环境得分真实环境得分0.102086 ± 140193 ± 580.502060 ± 277196 ± 501.001145 ± 690868 ± 5111.15918 ± 5461092 ± 5561.30732 ± 269753 ± 139Gym 排行榜最佳N/A820 ± 58$\tau$ 过低时梦境近似确定性 LSTM模式坍缩使怪物永不射击——策略在虚拟环境拿满分2086±140但真实环境仅 193±58甚至不如随机策略210±108$\tau1.15$ 是防利用与可学习的甜点。这也解释了模型的经典失败模式对抗策略——控制器学会在梦境中魔法熄灭火球利用世界模型的不完美。图 12对抗策略——控制器学会在梦境中魔法熄灭火球证明训练环境必须加入不确定性结果对比总结图 13结果对比总结——世界模型在 CarRacing 与 VizDoom 双双超越 Deep RL 与排行榜基线Mermaid 流程图关键发现复杂度转移有效867 参数线性控制器配合无监督世界模型特征以906±21分首次解出 CarRacing-v0超越 DQN343±18与 A3C591–652。记忆表征是负载关键消融实验显示仅 V 模块得分 632±251加入 M 的隐状态后提升至 906±21均值提升约43%。梦境训练可迁移在 $\tau1.15$ 梦境中进化出的策略真实 VizDoom 得分1092±556反超排行榜最佳 820±58 达33%。温度是防利用旋钮$\tau0.1$ 时梦境可被对抗策略利用虚拟 2086 分 vs 真实 193 分$\tau1.15$ 达到最佳权衡。世界模型全程无监督仅 10,000 次随机 rollout 无奖励训练对应创新模式P7 制造监督信号即足以支撑 SOTA 策略Oral 信号分析附录 C。V/M/C 分解委托求解器创新模式P11反向传播训练 V/M、CMA-ES 进化 C64×16 并行 rollout 即可解出任务。局限性世界模型可被对抗性利用梦境中的魔法熄灭火球策略在现实中失效需调温度在可学与真实之间权衡。无监督表征可能偏任务VAE 复现了 Doom 墙壁砖纹却丢了 CarRacing 路面关键细节——无监督无法预知任务相关性。容量有限LSTM 权重存储受限存在灾难性遗忘难以像人脑一样累积数十年记忆。无分层规划逐时间步模拟没有人类式分层规划/抽象推理作者展望 One Big Net 与 PowerPlay 式行为重放作为未来方向。常见问题FAQWorld Models 和 Dreamer 是什么关系World Models2018是潜空间世界模型的奠基工作DreamerHafner 等ICLR 2020用 RSSM 取代 VAEMDN-RNN把在梦境中训练扩展到 Atari 等更大规模任务二者同属预测未来潜状态 在想象中学习的范式线。为什么控制器只用 867 个参数也能解出赛车任务因为 V 提供了空间表征、M 提供了时间预测$[z_t\ h_t]$ 已包含当前观测与未来分布的全部信息控制器只需做一个线性映射即可参数少也让 CMA-ES 进化搜索变得可行。梦境训练为什么迁移后表现反而更好梦境环境通过温度 $\tau$ 注入了额外不确定性火球轨迹更随机在更难的梦境中生存下来的策略更鲁棒部署到更干净的现实中自然表现更好。世界模型被欺骗是怎么回事控制器能直接访问 M 的全部隐状态相当于看到了游戏引擎内部状态于是找到利用模型缺陷的对抗策略如让火球消失——这类策略在真实环境中必然失效。这篇文章为什么影响力这么大它是无监督世界模型 演化策略 梦境训练三者的首次完整现代验证交互式论文worldmodels.github.io也广为流传直接启发了 Dreamer、PlaNet、IRIS 以及 Sora/Genie 等生成式世界模型。世界模型需要奖励信号吗不需要。V/M 完全无监督训练仅重建与预测损失只有 C 接触奖励这正对应 Oral 信号分析中的 P7 制造监督信号模式NeurIPS 偏好此类工作3.7pp。参考链接arXiv:1803.10122 —— World Models 论文页World Models 可交互版本worldmodels.github.ioNeurIPS 2018 官方 ProceedingsRecurrent World Models Facilitate Policy EvolutionDream to Control: Learning Behaviors by Latent ImaginationDreamer, ICLR 2020Schmidhuber 1990 —— Making the World Differentiable给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件