策略、回报与折扣因子

01-基础与MDP 核心 约 15 分钟 #策略#回报#折扣#目标定义 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Sutton & Barto 教材复核。

一句话定义

策略 π 是"状态到动作"的行为规则(确定性 $a=\pi(s)$ 或随机 $\pi(a|s)$),学习目标是从某时刻起的折扣回报 $G_t = \sum_{k\ge0} \gamma^k R_{t+k+1}$ 的期望最大化;折扣因子 γ 同时承担数学收敛、时间偏好与有效视野三重角色。

为什么重要

"最大化什么"的定义决定一切算法的走向:回报取的是"从现在开始的未来"而非"过去的累计"——这解释了为什么 RL 的目标可以从任意时刻重启;γ 的取值直接改变最优策略(短期主义 vs 长期主义)与算法的有效视野,是建模决策而非超参细节。

前置知识

kp-002;期望的基本运算(期望的线性性)。

核心概念

  • 策略 π:行为规则。随机策略 $\pi(a|s)$ 在探索与理论分析中更一般(最优策略总可用确定性策略表达,但随机化有熵正则等用途,见 kp-019)。
  • 轨迹(episode/rollout):$\tau = (s_0, a_0, r_1, s_1, a_1, r_2, \dots)$。
  • 回报 $G_t$:从 t 时刻起的累积折扣奖励 $G_t = R_{t+1} + \gamma R_{t+2} + \gamma^2 R_{t+3} + \dots$。
  • 目标:$J(\pi) = \mathbb{E}_{\tau \sim \pi}[G_0]$——期望回报,"期望"是因为转移与策略都随机。
  • 折扣因子 γ:未来一步奖励折算为当下的 γ 倍。

原理与机制

γ 的三重角色:① 数学收敛——奖励有界时 γ<1 保证无穷级数收敛(值有界,算法可算);② 时间偏好——γ→0 只看眼前,γ→1 远视;③ 有效视野——1/(1−γ) 是折扣和的"特征长度":γ=0.99 ⇒ 有效视野 ~100 步。改变 γ 等于改变问题定义:同一奖励下 γ=0.9 与 γ=0.999 的最优策略可以完全不同(贪食蛇 vs 长线布局)。

为什么用"期望":单条轨迹的回报受环境随机性支配(同一个策略每局得分不同),只有期望回报才是策略的稳定属性。这也是"评估要跑多条 episode 取均值"(kp-030)的数学理由。

回报的递归结构:$G_t = R_{t+1} + \gamma G_{t+1}$——未来回报=下步奖励+折后的更未来。这个一行递归是贝尔曼方程(kp-004)的全部种子:值函数就是把它的期望写成函数。

公式或模型

  • 回报递归:$G_t = R_{t+1} + \gamma G_{t+1}$
  • 目标:$J(\pi) = \mathbb{E}_{\tau\sim\pi}\left[\sum_{t=0}^{\infty} \gamma^t R_{t+1}\right]$
  • 有效视野:n 步后奖励权重 $\gamma^n$;特征视野 $1/(1-\gamma)$。

直观类比

γ 是"未来的钱打几折":γ=0.9 相当于未来的 100 元只值当下 90 元——短期主义者的估值函数;γ=0.999 几乎不贬值——长期主义者。而"期望回报"是说:评价一个打法规律,要看它长期平均能挣多少,不是看运气最好那一把。

实例或案例

  • 迷宫 -1/步、γ=1(episodic 可用):最优=最短路;若环境是持续行走、γ=1 则和发散,必须 γ<1 或改平均奖励。
  • 金融/医疗决策:γ 过小导致算法"杀鸡取卵"(只顾即时收益),γ 过大导致"永远在等更好的未来"——γ 是业务时间偏好的数学化。
  • Atari 常用 γ=0.99(视野 100 帧内),金融长线可能需要 0.999+。

常见误区

  • 误区一:"γ 是可以随手调的超参"。它改变最优策略本身;γ 变了,"最优"的含义就变了,新旧实验不可比。
  • 误区二:"回报是历史累计奖励"。是未来折扣奖励——这保证评价一个动作/状态时只算它"往后"能带来什么。
  • 误区三:"随机策略没有确定性策略好"。最优策略可用确定性表达,但训练中随机性承载探索(kp-006)与熵正则下的鲁棒性(kp-019),随机策略是过程需要。

与其他知识点的关系

  • kp-004:把回报递归的期望化为贝尔曼方程。
  • kp-006:随机策略与探索的关系。
  • kp-029:γ 与奖励尺度共同决定 TD 误差尺度,影响学习率敏感性。

自测题

  1. 写出回报的递归形式并解释其意义。

答:$G_t = R_{t+1} + \gamma G_{t+1}$——未来价值可分解为"下步即时奖励+折后未来",是贝尔曼方程的种子。

  1. γ=0.95 的有效视野大约多少步?意味着什么?

答:1/(1−0.95)=20 步;算法基本只优化 20 步内的后果,更远的奖励几乎被忽略。

  1. 为什么目标是期望回报而不是单条轨迹回报?

答:转移与策略都随机,单条轨迹受运气支配;期望才是策略的稳定属性,可比较、可优化。

延伸阅读

  • Sutton & Barto 教材 §3.3(回报与任务类型)、§3.6。
  • David Silver 课程 Lecture 2。
  • Pinna 等 γ 敏感性实证(各种环境下的视野研究,可检索 RL discount factor 视野)。