蒙特卡洛方法:用完整回合估计价值
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Sutton & Barto 教材复核。
一句话定义
蒙特卡洛(MC)方法不需要转移模型:跑完整个回合,用实际观测到的完整回报 $G_t$ 作为价值估计的更新目标——大数定律保证样本均值收敛到真值,代价是必须等回合结束、方差大。
为什么重要
MC 是"无模型 + 不自举"路线的原点:它证明不用转移核也能学价值(采样即可),也第一次暴露了 RL 的方差问题。理解 MC 的" unbiased but high variance",才能理解 TD(kp-008)"biased but lower variance"的取舍,以及策略梯度 REINFORCE(kp-013)本质就是 MC 策略梯度。
前置知识
kp-003/004(回报与价值定义);大数定律直觉。
核心概念
- MC 价值估计:$V(s_t) \leftarrow V(s_t) + \alpha\,(G_t - V(s_t))$,其中 $G_t$ 是本回合从 t 到终止的实际折扣奖励和。
- 首次访问 vs 每次访问:同一回合内状态 s 出现多次时,只用第一次出现的 $G_t$(first-visit)还是每次都用(every-visit);两者都收敛,后者方差更大但样本更多。
- MC 策略评估:多回合采样 → 状态均值 → $v^\pi$。
- MC 控制(on-policy):评估当前 ε-greedy 策略 → 贪心改进 → 再采样(GPI 骨架,kp-005)。
- 增量式均值:$V \leftarrow V + \frac{1}{N}(G - V)$ 的通用形式(学习率 1/N 随样本数衰减)。
原理与机制
无偏性的来源:$G_t$ 是 $v^\pi(s_t)$ 的真实样本(真实轨迹的完整未来奖励),期望恰为 $v^\pi(s_t)$——目标无偏,估计在大样本下必收敛。这是 MC 最大的理论美德。
高方差的来源:$G_t$ 聚合了从 t 到终止的所有随机性(后续每步的动作随机+环境随机),单样本抖动巨大;必须靠大量回合平均才能压住方差。回合越长、环境越随机,方差越爆炸。
episodic 依赖:MC 必须等终止才知道 $G_t$(终局奖励要回传到每一步)——长回合/无终止任务不可用(这是 TD 出场的直接理由)。
与策略梯度的血缘:REINFORCE 的更新 $\nabla J = \mathbb{E}[\sum_t \nabla\log\pi(a_t|s_t) \cdot G_t]$ 正是以 MC 回报为权重——"MC 策略梯度"(kp-013),方差问题也被原样继承,解药同样是基线(kp-014)。
图示
回合: s₀ ─a₀─ s₁ ─a₁─ s₂ ──► 终止
实际回报: G₀=r₁+γr₂+r₃ G₁=r₂+γr₃ G₂=r₃
更新: V(sᵢ) ← V(sᵢ) + α(Gᵢ − V(sᵢ)) ← 目标是"完整真实样本"
性质: 无偏(期望=真值) / 方差大(聚合全程随机) / 须等回合结束
实例或案例
- Blackjack(21 点)是教材标准例:回合天然短、状态少,MC 表格估计直接可视化出"要牌策略曲面"。
- 棋类终局评估:胜负是明确终止信号,用整局结果回传训练评估网络(AlphaZero 的价值头本质是 MC 式监督,kp-021)。
常见误区
- 误区一:"MC 比 TD 落后所以没必要学"。两者是偏差-方差谱系的两端;理论对照价值极高,且 MC 观点在策略梯度里是主角。
- 误区二:"MC 需要模型"。恰恰不需要——它只要"能与环境交互拿到奖励",转移核完全未知也行。
- 误区三:"every-visit 不收敛"。两者在表格情形都收敛;实践选型更多考虑样本效率而非理论细节。
与其他知识点的关系
自测题
- MC 更新目标是什么?为什么无偏?
答:实际完整回报 $G_t$;它是 $v^\pi(s_t)$ 的真实样本,期望恰等于真值。
- MC 的两大局限?
答:必须等回合结束(不适用持续任务/长回合);目标聚合全程随机性导致方差大、样本效率低。
- 首次访问与每次访问的区别?
答:回合内状态重复出现时前者只计第一次的 G,后者每次都计;都收敛,后者样本多但方差略大。
延伸阅读
- Sutton & Barto 教材第 5 章(MC 全章)。
- David Silver 课程 Lecture 4。
- Williams, "Simple Statistical Gradient-Following Algorithms"(REINFORCE,MC 思想的策略梯度化)。