策略、回报与折扣因子
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Sutton & Barto 教材复核。
一句话定义
策略 π 是"状态到动作"的行为规则(确定性 $a=\pi(s)$ 或随机 $\pi(a|s)$),学习目标是从某时刻起的折扣回报 $G_t = \sum_{k\ge0} \gamma^k R_{t+k+1}$ 的期望最大化;折扣因子 γ 同时承担数学收敛、时间偏好与有效视野三重角色。
为什么重要
"最大化什么"的定义决定一切算法的走向:回报取的是"从现在开始的未来"而非"过去的累计"——这解释了为什么 RL 的目标可以从任意时刻重启;γ 的取值直接改变最优策略(短期主义 vs 长期主义)与算法的有效视野,是建模决策而非超参细节。
前置知识
kp-002;期望的基本运算(期望的线性性)。
核心概念
- 策略 π:行为规则。随机策略 $\pi(a|s)$ 在探索与理论分析中更一般(最优策略总可用确定性策略表达,但随机化有熵正则等用途,见 kp-019)。
- 轨迹(episode/rollout):$\tau = (s_0, a_0, r_1, s_1, a_1, r_2, \dots)$。
- 回报 $G_t$:从 t 时刻起的累积折扣奖励 $G_t = R_{t+1} + \gamma R_{t+2} + \gamma^2 R_{t+3} + \dots$。
- 目标:$J(\pi) = \mathbb{E}_{\tau \sim \pi}[G_0]$——期望回报,"期望"是因为转移与策略都随机。
- 折扣因子 γ:未来一步奖励折算为当下的 γ 倍。
原理与机制
γ 的三重角色:① 数学收敛——奖励有界时 γ<1 保证无穷级数收敛(值有界,算法可算);② 时间偏好——γ→0 只看眼前,γ→1 远视;③ 有效视野——1/(1−γ) 是折扣和的"特征长度":γ=0.99 ⇒ 有效视野 ~100 步。改变 γ 等于改变问题定义:同一奖励下 γ=0.9 与 γ=0.999 的最优策略可以完全不同(贪食蛇 vs 长线布局)。
为什么用"期望":单条轨迹的回报受环境随机性支配(同一个策略每局得分不同),只有期望回报才是策略的稳定属性。这也是"评估要跑多条 episode 取均值"(kp-030)的数学理由。
回报的递归结构:$G_t = R_{t+1} + \gamma G_{t+1}$——未来回报=下步奖励+折后的更未来。这个一行递归是贝尔曼方程(kp-004)的全部种子:值函数就是把它的期望写成函数。
公式或模型
- 回报递归:$G_t = R_{t+1} + \gamma G_{t+1}$
- 目标:$J(\pi) = \mathbb{E}_{\tau\sim\pi}\left[\sum_{t=0}^{\infty} \gamma^t R_{t+1}\right]$
- 有效视野:n 步后奖励权重 $\gamma^n$;特征视野 $1/(1-\gamma)$。
直观类比
γ 是"未来的钱打几折":γ=0.9 相当于未来的 100 元只值当下 90 元——短期主义者的估值函数;γ=0.999 几乎不贬值——长期主义者。而"期望回报"是说:评价一个打法规律,要看它长期平均能挣多少,不是看运气最好那一把。
实例或案例
- 迷宫 -1/步、γ=1(episodic 可用):最优=最短路;若环境是持续行走、γ=1 则和发散,必须 γ<1 或改平均奖励。
- 金融/医疗决策:γ 过小导致算法"杀鸡取卵"(只顾即时收益),γ 过大导致"永远在等更好的未来"——γ 是业务时间偏好的数学化。
- Atari 常用 γ=0.99(视野 100 帧内),金融长线可能需要 0.999+。
常见误区
- 误区一:"γ 是可以随手调的超参"。它改变最优策略本身;γ 变了,"最优"的含义就变了,新旧实验不可比。
- 误区二:"回报是历史累计奖励"。是未来折扣奖励——这保证评价一个动作/状态时只算它"往后"能带来什么。
- 误区三:"随机策略没有确定性策略好"。最优策略可用确定性表达,但训练中随机性承载探索(kp-006)与熵正则下的鲁棒性(kp-019),随机策略是过程需要。
与其他知识点的关系
自测题
- 写出回报的递归形式并解释其意义。
答:$G_t = R_{t+1} + \gamma G_{t+1}$——未来价值可分解为"下步即时奖励+折后未来",是贝尔曼方程的种子。
- γ=0.95 的有效视野大约多少步?意味着什么?
答:1/(1−0.95)=20 步;算法基本只优化 20 步内的后果,更远的奖励几乎被忽略。
- 为什么目标是期望回报而不是单条轨迹回报?
答:转移与策略都随机,单条轨迹受运气支配;期望才是策略的稳定属性,可比较、可优化。
延伸阅读
- Sutton & Barto 教材 §3.3(回报与任务类型)、§3.6。
- David Silver 课程 Lecture 2。
- Pinna 等 γ 敏感性实证(各种环境下的视野研究,可检索 RL discount factor 视野)。