蒙特卡洛方法:用完整回合估计价值

02-无模型价值方法 核心 约 20 分钟 #蒙特卡洛#MC#回合更新#无模型 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Sutton & Barto 教材复核。

一句话定义

蒙特卡洛(MC)方法不需要转移模型:跑完整个回合,用实际观测到的完整回报 $G_t$ 作为价值估计的更新目标——大数定律保证样本均值收敛到真值,代价是必须等回合结束、方差大。

为什么重要

MC 是"无模型 + 不自举"路线的原点:它证明不用转移核也能学价值(采样即可),也第一次暴露了 RL 的方差问题。理解 MC 的" unbiased but high variance",才能理解 TD(kp-008)"biased but lower variance"的取舍,以及策略梯度 REINFORCE(kp-013)本质就是 MC 策略梯度。

前置知识

kp-003/004(回报与价值定义);大数定律直觉。

核心概念

  • MC 价值估计:$V(s_t) \leftarrow V(s_t) + \alpha\,(G_t - V(s_t))$,其中 $G_t$ 是本回合从 t 到终止的实际折扣奖励和。
  • 首次访问 vs 每次访问:同一回合内状态 s 出现多次时,只用第一次出现的 $G_t$(first-visit)还是每次都用(every-visit);两者都收敛,后者方差更大但样本更多。
  • MC 策略评估:多回合采样 → 状态均值 → $v^\pi$。
  • MC 控制(on-policy):评估当前 ε-greedy 策略 → 贪心改进 → 再采样(GPI 骨架,kp-005)。
  • 增量式均值:$V \leftarrow V + \frac{1}{N}(G - V)$ 的通用形式(学习率 1/N 随样本数衰减)。

原理与机制

无偏性的来源:$G_t$ 是 $v^\pi(s_t)$ 的真实样本(真实轨迹的完整未来奖励),期望恰为 $v^\pi(s_t)$——目标无偏,估计在大样本下必收敛。这是 MC 最大的理论美德。

高方差的来源:$G_t$ 聚合了从 t 到终止的所有随机性(后续每步的动作随机+环境随机),单样本抖动巨大;必须靠大量回合平均才能压住方差。回合越长、环境越随机,方差越爆炸。

episodic 依赖:MC 必须等终止才知道 $G_t$(终局奖励要回传到每一步)——长回合/无终止任务不可用(这是 TD 出场的直接理由)。

与策略梯度的血缘:REINFORCE 的更新 $\nabla J = \mathbb{E}[\sum_t \nabla\log\pi(a_t|s_t) \cdot G_t]$ 正是以 MC 回报为权重——"MC 策略梯度"(kp-013),方差问题也被原样继承,解药同样是基线(kp-014)。

图示

回合: s₀ ─a₀─ s₁ ─a₁─ s₂ ──► 终止
实际回报:      G₀=r₁+γr₂+r₃   G₁=r₂+γr₃   G₂=r₃
更新: V(sᵢ) ← V(sᵢ) + α(Gᵢ − V(sᵢ))   ← 目标是"完整真实样本"
性质: 无偏(期望=真值) / 方差大(聚合全程随机) / 须等回合结束

实例或案例

  • Blackjack(21 点)是教材标准例:回合天然短、状态少,MC 表格估计直接可视化出"要牌策略曲面"。
  • 棋类终局评估:胜负是明确终止信号,用整局结果回传训练评估网络(AlphaZero 的价值头本质是 MC 式监督,kp-021)。

常见误区

  • 误区一:"MC 比 TD 落后所以没必要学"。两者是偏差-方差谱系的两端;理论对照价值极高,且 MC 观点在策略梯度里是主角。
  • 误区二:"MC 需要模型"。恰恰不需要——它只要"能与环境交互拿到奖励",转移核完全未知也行。
  • 误区三:"every-visit 不收敛"。两者在表格情形都收敛;实践选型更多考虑样本效率而非理论细节。

与其他知识点的关系

  • kp-008:TD 用自举换掉"等回合+高方差"。
  • kp-013:REINFORCE = MC 策略梯度,同样的方差病灶。
  • kp-014:基线/优势是给 MC 式目标降方差的通用手术。

自测题

  1. MC 更新目标是什么?为什么无偏?

答:实际完整回报 $G_t$;它是 $v^\pi(s_t)$ 的真实样本,期望恰等于真值。

  1. MC 的两大局限?

答:必须等回合结束(不适用持续任务/长回合);目标聚合全程随机性导致方差大、样本效率低。

  1. 首次访问与每次访问的区别?

答:回合内状态重复出现时前者只计第一次的 G,后者每次都计;都收敛,后者样本多但方差略大。

延伸阅读

  • Sutton & Barto 教材第 5 章(MC 全章)。
  • David Silver 课程 Lecture 4。
  • Williams, "Simple Statistical Gradient-Following Algorithms"(REINFORCE,MC 思想的策略梯度化)。