时序差分学习:TD(0)、SARSA 与 Q-Learning
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Sutton & Barto 教材复核。
一句话定义
时序差分(TD)学习在每一步就用"即时奖励 + 折后下一状态价值估计"(自举目标)更新价值——不等回合结束、不需要模型,把 MC 的无偏高方差换成有偏低方差;TD(0) 是评估、SARSA 是 on-policy 控制、Q-Learning 是 off-policy 控制三兄弟。
为什么重要
TD 是 RL 的心脏:几乎所有现代算法(DQN、Actor-Critic 的 critic、PPO 的价值头)的损失都是 TD 误差的变体。理解"自举目标 $r + \gamma V(s')$"这一个小算式,就理解了深度 RL 一半的工程问题来源(目标移动、发散、高估,kp-010/012)。
前置知识
kp-004(贝尔曼方程)、kp-006(ε-greedy)、kp-007(MC 对照)。
核心概念
- TD 误差:$\delta_t = R_{t+1} + \gamma V(S_{t+1}) - V(S_t)$。
- TD(0) 更新(评估):$V(S_t) \leftarrow V(S_t) + \alpha\,\delta_t$——目标是自举的 $R + \gamma V(S')$,不是真实 G。
- SARSA(on-policy 控制):$\delta = R + \gamma Q(S', A') - Q(S,A)$,其中 $A'$ 是行为策略实际会选的下一个动作(含探索)——学的是"我这套带探索的策略"的价值。
- Q-Learning(off-policy 控制):$\delta = R + \gamma \max_{a'} Q(S',a') - Q(S,A)$——目标用 max,与行为策略无关,学的是贪心最优 $q^*$。
- 三者的共同骨架:GPI(评估-改进交替,kp-005),只是备份方式从全期望(DP)换成了单样本(TD)。
原理与机制
偏差-方差交换:目标 $R + \gamma V(S')$ 里 $V(S')$ 是估计 → 有偏;但只含一步随机性 → 方差远小于 MC 的完整回报。收敛上:表格情形、足够探索、学习率满足 Robbins-Monro 条件时 TD/SARSA/Q-Learning 均收敛到各自目标(v^π / q^π / q*)。
SARSA vs Q-Learning 的行为学差异(考试重点):Q-Learning 学的是"不存在探索的完美贪手",收敛后若继续 ε-greedy 行动会在悬崖边掉下去(它知道悬崖边 Q 低,但探索可能选中掉下去的动作);SARSA 把探索代价算进价值,学出更保守、离悬崖更远的策略。"cliff walking"是标准演示。
TD 的收敛为什么成立:本质是对贝尔曼算子的随机近似——每步用单样本随机梯度下降解贝尔曼方程;γ<1 的压缩性把噪声"摁住"(表格情形)。一旦加入函数逼近,压缩性失效,收敛不再保证(kp-012 的致命三角)。
n 步与 TD(λ) 视角:MC(∞ 步目标)与 TD(0)(1 步目标)之间可插值——n 步目标 $R_{t+1} + \gamma R_{t+2} + \dots + \gamma^{n-1}R_{t+n} + \gamma^n V(S_{t+n})$;λ 参数做指数加权混合,权衡偏差-方差。实践中的 GAE(kp-014)正是 λ 加权的优势版。
图示
一步后即更新(不用等回合):
V(Sₜ) ← V(Sₜ) + α[ Rₜ₊₁ + γV(Sₜ₊₁) − V(Sₜ) ]
└─自举目标(估计值!)─┘
SARSA: 目标 R + γQ(S',A') A'~行为策略(含探索) → 学 π_行为
Q-Learning: 目标 R + γmax_a' Q(S',a') 与行为无关 → 学 π*贪心
直观类比
通勤时间估计:MC 要"走完一整趟"才知道全程花了多久(准但慢、单趟抖动大);TD 是"刚过第一个路口,就按'这一段实际耗时+预估剩余'来修正全局估计"——快速、灵活,但预估本身可能不准(偏差)。SARSA 记得"我会抄近道闯红灯"(含探索习惯),Q-Learning 假设"我永远走最优路线"。
实例或案例
- Cliff Walking(教材标准例):同样 ε-greedy 行为,Q-Learning 学得快但线上掉悬崖多,SARSA 稳——on/off-policy 的行为学差异。
- 表格 Q-Learning 伪代码:初始化 Q → 循环(ε-greedy 选 A,执行,观察 r/s',Q(S,A) += α[r+γmaxQ(S',·)−Q(S,A)])——百行内可跑通 FrozenLake。
- 现代继承:DQN 损失 = Q-Learning 的 MSE(+目标网络,kp-010);Actor-Critic 的 critic = TD(0)(kp-015)。
常见误区
- 误区一:"TD 有偏所以不如 MC"。有偏但每步更新、方差小、可在线;偏差随迭代被反复冲刷,实践效率通常远高于 MC——无免费午餐,按任务特性选。
- 误区二:"Q-Learning 收敛了所以行为策略也最优"。它收敛到 q*(贪心目标);继续 ε-greedy 行动时表现由"贪心+探索"决定,与 SARSA 的保守策略不同。
- 误区三:"学习率固定没问题"。表格理论要求 α 递减(Robbins-Monro);实践中常量小学习率 + 经验回放近似满足,但理论红线要知道。
与其他知识点的关系
- kp-005:DP 的期望备份 → TD 的样本备份。
- kp-009:off-policy 的数据复用与重要性采样。
- kp-010/012:自举目标在深度网络下的稳定性问题。
- kp-014:n 步/λ 的思想被 GAE 继承。
自测题
- 写出 TD 误差与 TD(0) 更新式。
答:$\delta_t = R_{t+1} + \gamma V(S_{t+1}) - V(S_t)$;$V(S_t) \leftarrow V(S_t) + \alpha\delta_t$。
- SARSA 与 Q-Learning 的目标差一行什么?行为后果差异?
答:$A'\sim\pi$ vs $\max_{a'}$;SARSA 学含探索策略的价值(保守,如远离悬崖),Q-Learning 学纯贪心 q*(激进,探索时暴露于风险)。
- 为什么说 TD 是对贝尔曼算子的随机近似?
答:每步用单样本对 $r+\gamma V(s')$ 做随机梯度更新,均值方向即贝尔曼备份;γ 压缩性(表格情形)保证收敛,函数逼近下失效。
延伸阅读
- Sutton & Barto 教材第 6 章(TD 全章)与第 5.4 节(Cliff Walking)。
- David Silver 课程 Lecture 5。
- Watkins 博士论文(Q-Learning 收敛原始证明)。