基于模型的 RL:模型学习、Dyna 与规划

04-模型与规划 进阶 约 20 分钟 #模型基RL#Dyna#规划#样本效率 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Sutton & Barto 第 8 章复核。

一句话定义

基于模型的 RL 先从数据学习环境的动力学模型 $\hat p(s',r|s,a)$(或其代理),再用模型做规划(想象/模拟未来)辅助决策与价值更新——Dyna 框架把"真实经验"与"模型生成的想象经验"混着训练,是"样本效率换模型误差"这一交易的开山框架。

为什么重要

真实世界的交互昂贵且危险(机器人试错一次可能摔一次),无模型方法动辄千万步交互的样本饥饿是死穴。模型基方法是样本效率的主要出路;近年 Dreamer 系(kp-022)在 Atari 上用 20 万帧追平 DQN 的 2 亿帧——模型的价值由数据价格兑现。

前置知识

kp-005(DP=已知模型的规划)、kp-008(无模型 TD)。

核心概念

  • 模型学习(system identification):学 $\hat p(s',r|s,a)$——离散用计数/表格,连续用网络输出下一状态分布(高斯头)或用潜变量模型(kp-022)。
  • 规划(planning):用模型做期望备份(DP 式)或采样 rollout(MCTS 式,kp-021)改进价值/策略。
  • Dyna 架构:真实交互 → 学模型 + 学 Q → 循环中穿插 n 次"从模型采样虚拟转移更新 Q"——真实样本与想象样本同锅煮。
  • 两条路线:① 可微模型+反传(梯度穿过模型直接优化策略,PILCO 系);② 无梯度模型+想象 rollout(MBPO/Dreamer 系)。
  • 模型误差是主要风险:想象经验带着模型偏差参与训练,误差被自举复利放大——"学出来的模型越自信越危险"。

原理与机制

样本效率的交易结构:无模型方法的成本在"环境交互步数";模型基方法把交互转嫁给"模型训练 + 想象 rollout"——模型是廉价的信息蒸馏器。收益兑现的条件是模型足够准;误差处理成为这一支的核心工程:短想象步(MBPO 只敢展开 1–5 步)、模型集成(多模型不一致=不确定性,只在"模型自信"区域用想象数据)、不确定性惩罚(把模型误差折进奖励)。

为什么短 rollout 够用:想象的价值在于"局部多步备份"提升样本复用(一次真实交互衍生成多条训练数据),而不是替代真实动力学——MBPO 的经验:短分支想象数据 + 无模型算法(SAC)的混合,胜过全 rollout。

Dyna 的现代回声:今天的 Dreamer/PPO+model 系全部是 Dyna 思想的深度化——"真实数据学模型,模型数据练策略"这个循环从未变过,变的是模型的表达力(表格→神经网络→潜变量世界模型)。

图示

真实经验 (s,a,r,s')
   ├─► 学/更新模型 p̂(s',r|s,a)
   ├─► 无模型更新 Q/π
   └─► 模型采样想象经验 ─► 补充更新 Q/π   (Dyna 循环)
风险: 想象经验含模型偏差 → 短rollout/集成/不确定性惩罚 押制

直观类比

学下棋:无模型=只能真人对弈涨棋(一盘一经验);模型基=复盘时在脑内推演"如果我走这步他会那么走"(模型),一个真实局面衍生几十条脑内经验。脑内推演可能推错(模型偏差),所以高手只在有把握的几步内推(短 rollout)。

实例或案例

  • PILCO:高斯过程模型 + 可微规划,百级样本学会控制机械臂——"样本效率"路线的古典标杆。
  • MBPO:短想象分支 + SAC,在 MuJoCo 上把交互量压低一个数量级。
  • Dyna-Maze:教材标准演示——真实走几步 + 想象更新几千次,值函数迅速铺满全图。

常见误区

  • 误区一:"模型学得越准越要用长 rollout"。模型误差随步长复合增长;实践甜点是极短的想象分支,长规划交给 MCTS 类搜索(kp-021)。
  • 误区二:"模型基一定比无模型省样本"。模型差(随机性大/部分可观测)时想象数据有毒,总成本反升;模型基的适用面取决于"环境可预测性"。
  • 误区三:"规划和学习二选一"。现代系统全部混合(Dyna 式):无模型组件保底,模型组件提效。

与其他知识点的关系

  • kp-005:规划=已知(学到的)模型上的 DP。
  • kp-021:MCTS=聚焦式采样规划。
  • kp-022:世界模型把"学模型"推到潜空间。
  • kp-008/019:无模型组件(TD/SAC)是混合系统的执行底座。

自测题

  1. 写出 Dyna 的训练循环。

答:真实交互 → (a) 学模型、(b) TD 更新 Q;每步真实经验穿插 n 次从模型采样的虚拟 (s,a,r,s') 做 Q 更新。

  1. 模型误差为什么危险?三种抑制手段?

答:想象经验带模型偏差且被自举复利放大;抑制:短 rollout、模型集成取不确定区域排除、把模型不确定性折算成奖励惩罚。

  1. 模型基方法的适用条件?

答:交互昂贵 + 环境动力学相对可预测;随机性大或严重部分可观测的环境模型收益有限。

延伸阅读

  • Sutton, "Dyna, an Integrated Architecture for Learning, Planning, and Reacting"(1991)。
  • Janner 等, "When to Trust Your Model: Model-Based Policy Optimization"(NeurIPS 2019,MBPO)。
  • Sutton & Barto 教材第 8 章(规划与学习)。