世界模型与 Dreamer:在想象中训练

04-模型与规划 前沿 约 20 分钟 #世界模型#Dreamer#潜空间#想象训练 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Hafner 系列论文(World Models 2018 / Dreamer v1-v3 2019-2023)复核。

一句话定义

世界模型方法把环境动力学学在潜空间里:VAE 式编码器把高维观测压成潜状态,RNN/Transformer 模型在潜空间预测下一步,策略与价值完全在"模型想象的 rollout"中训练(Dreamer 的Actor-Critic 梯度直接穿过想象轨迹)——真实环境只用来采少量数据修正模型,样本效率因此提升数十倍。

为什么重要

它回答了模型基 RL 的终极形态问题:不在像素空间想象(成本爆炸),而在学出来的紧凑潜空间想象(便宜且可控)。Dreamer v3 展示了"一套超参跨 150+ 任务"的通用性,是把 RL 从"逐任务炼丹"推向"通用智能体"的重要一步,也是当前具身智能与视频生成式模型(Genie 类)的思想源头。

前置知识

kp-020(模型基 RL 与模型误差)、VAE/RNN 基础。

核心概念

  • 三件套(RSSM,Dreamer 的核心):

- 编码器 $z_t = e(o_t)$:观测 → 潜表示; - 序列模型 $h_t = f(h_{t-1}, z_{t-1}, a_{t-1})$:GRN/Transformer 汇总历史; - 解码器/奖励头/继续头:从 $h_t$ 重建观测、预测奖励与终止——自监督地"锚定"潜空间使其携带任务相关信息。

  • 想象训练(Dreamer):从真实轨迹出发,用序列模型在潜空间 rollout H 步 → 在想象轨迹上算 $\lambda$-return(kp-014 的 GAE 同款)→ Actor-Critic 梯度穿过想象模型直接回传。
  • 训练循环(Dyna 的深度化):真实交互采样 → 更新世界模型 → 在世界模型中大量想象训练策略 → 新策略上线再采数据。
  • KL 平衡与 free bits:潜变量的后验/先验 KL 正则要配平(防止后验坍缩、防止忽略观测),是实现细节中的魔鬼。

原理与机制

为什么在潜空间想象:像素空间的下一步预测要建模"整个画面的物理",参数与误差都爆炸;潜空间只保留"对预测奖励/终止有用的因子"——想象误差被压缩到任务相关维度。这是"表示学习为规划服务"的范式:世界模型同时是动力学模型与表示学习器。

梯度穿过想象轨迹的代价与收益:可微模型让策略梯度像监督学习一样直接(无 rollout 方差),但模型误差在长 rollout 上复合——H(想象深度)是核心超参,实践中 H≈15 与"短分支"哲学(kp-020 的 MBPO)一致;imagination 的 KL/熵正则同时承担探索角色。

与 MuZero 的关系:两者都学隐空间动力学,MuZero 在搜索中用模型(显式规划),Dreamer 在梯度中用模型(可微规划)——"用模型的两种方式",选择取决于环境与算力形态。

图示

真实轨迹 o₁a₁r₁o₂…
   └► RSSM: 编码 z_t + 序列模型 h_t + 解码/奖励/终止头  ← 自监督训练
策略训练(全在想象中):
   h₀(真实) ─imagine→ h₁ → h₂ → … → h_H   (潜空间 rollout)
   Â 由 λ-return 计算; actor 梯度穿过想象模型回传
上线: 真实环境少量交互 → 数据回灌 → 循环

直观类比

飞行员在模拟器里练飞行:真实飞行(环境交互)昂贵危险,就先用少量真实飞行学一台足够逼真的模拟器(世界模型),然后大部分训练在模拟器里完成。模拟器不可能完美——所以每次真实飞行都用来校准它,且训练主要练"短时决策"(想象深度有限)。

实例或案例

  • Dreamer v3:一套超参在 Atari、DMC、Crafter 上达到/超越各任务专用调参,Atari 上 2 亿帧的成绩用 0.2 亿帧追平——通用性与样本效率的双证。
  • DayDreamer:Dreamer 直接跑在真机四足机器人上,1 小时内学会翻身行走——模型基方法在真实世界(非仿真)的落地样本。
  • 后裔谱系:World Models(2018,VAE+RNN 在梦中开车)→ Dreamer v1/2/3 → TD-MPC/DIAMOND 等,以及生成式世界模型(Genie/Sora 类)的 RL 化前景。

常见误区

  • 误区一:"世界模型越逼真越好"。任务相关的紧凑性比逼真度重要——解码重建只是锚定手段,潜空间的信息取舍决定想象质量。
  • 误区二:"想象训练可以完全替代真实交互"。模型漂移与分布偏移使"只做梦不落地"的策略上线即崩;Dreamer 的循环必须有真实数据回灌。
  • 误区三:"世界模型只是模型基 RL 的变体工程"。它是表示学习、生成模型与 RL 的交叉范式,思想已外溢到视频生成(可交互世界)与具身智能路线图。

与其他知识点的关系

  • kp-020:Dyna 循环的深度化;短 rollout 哲学一脉相承。
  • kp-014:想象中的 λ-return 与 GAE 同构。
  • kp-021:MuZero(搜索用模型)与 Dreamer(梯度用模型)的对照。
  • kp-019:想象轨迹上跑的是 SAC 式 Actor-Critic。

自测题

  1. RSSM 的三件套是什么?解码器的作用?

答:编码器(观测→潜变量)、序列模型(历史+动作→新隐状态)、解码/奖励/终止头;解码器以重建锚定潜空间,使其保留任务相关的观测信息。

  1. 为什么在潜空间而非像素空间想象?

答:像素级预测要建模全部视觉物理,误差与成本爆炸;潜空间只保留任务相关因子,想象便宜且误差可控。

  1. Dreamer 的策略梯度为什么可以像监督学习一样直传?

答:世界模型可微,想象轨迹上 λ-return 的梯度可穿过模型直接回传到 actor——无需真实 rollout 的高方差采样。

延伸阅读

  • Ha & Schmidhuber, "World Models"(2018)。
  • Hafner 等, "Dream to Control: Learning Behaviors by Latent Imagination"(ICLR 2020,Dreamer v1)。
  • Hafner 等, "Mastering Diverse Domains through World Models"(2023,DreamerV3)。
  • Wu 等, "DayDreamer: World Models for Physical Robot Learning"(2022)。