层次化强化学习:选项、目标条件与封建网络

05-前沿主题 进阶 约 20 分钟 #层次化RL#选项框架#目标条件策略#技能复用 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Sutton et al. 1999(选项框架)与 Bacon et al. 2017(Option-Critic)复核。

一句话定义

层次化 RL 在"原始动作"之上引入时间抽象——选项(带内部策略、终止条件的技能单元)或目标条件策略("去厨房""抓起杯子"式的参数化子任务),让高层学习"选什么目标/技能"、低层学习"如何执行",从而把长视野问题分解、把技能跨任务复用。

为什么重要

长视野+稀疏奖励是 RL 的双料噩梦(Montezuma's Revenge 用扁平 ε-greedy 几乎不可解):智能体必须在亿万次随机动作里偶然完成整个链条才能得到一次奖励。层次化把"偶然完成整链"改为"偶然完成一步子目标",并把学到的技能冻结复用——是人类"先学走路再学跑"的结构化先验。

前置知识

kp-002(MDP 与动作空间)、kp-006(探索)、半马尔可夫过程的直觉(本条自带)。

核心概念

  • 选项框架(options):三元组 $(\mathcal{I}, \pi, \beta)$——启动集 I(哪些状态可用)、内部策略 π、终止函数 β(s)。选项是时间上的宏动作;引入后决策过程升级为半马尔可夫决策过程(SMDP)——奖励与时间以"每选项"为节拍。
  • Option-Critic:端到端同时学习选项的内部策略、终止函数与顶层选择,无需人工预设子目标——终止条件由梯度自己学出("这个选项什么时候该交回控制权")。
  • feudal 网络(FuN):Manager 在低时间分辨率上输出隐空间方向目标,Worker 学习"朝该方向移动"——层次通过时间分辨率差自然涌现。
  • 目标条件策略(GCRL):$\pi(a|s, g)$ 以目标为条件; HER(后见之明经验回放)把"没达成的轨迹"重标为"达成了它实际到达的目标",把稀疏奖励的失败样本变成可学习的成功样本。
  • 技能发现:无奖励设定下用互信息目标(Diversity is All You Need)学"状态覆盖最大化的多样技能"。

原理与机制

SMDP 的价值备份怎么变:选项执行 k 步才终止,SMDP Bellman 备份跨过选项内部:$Q(s, o) = \mathbb{E}\left[r_0 + \gamma r_1 + \dots + \gamma^{k-1}r_{k-1} + \gamma^k \max_{o'} Q(s', o')\right]$——折扣在选项内部连续累计、在选项间跳变。理论同构于 MDP,只是时间轴变粗。

层次如何救稀疏探索:高层在"目标/选项空间"探索(维度低、每步跨越大),低层技能提供可靠执行——探索的赌注从"完整任务链"缩小到"选对下一个子目标"。数学上等价于给探索分布一个结构性先验(比 ε-greedy 的无方向随机强太多,kp-006)。

HER 的重标技巧:稀疏奖励下 99% 的轨迹 reward 全零,监督信号近乎为零;HER 把每条轨迹的终点当作"假设这就是目标",轨迹立即变成正例——用换问法把失败样本转化为训练数据。GCRL+HER 是机器人操作(抓取)的标准起步方案。

图示

高层(每 k 步决策):  π_H(g|s) → 目标/选项选择
低层(每步执行):     π_L(a|s,g) → 原始动作
选项 o=(I,π,β):     启动集 | 内部策略 | 终止条件
SMDP 备份: Q(s,o) = Σ_{t<k} γ^t r_t + γ^k max_o' Q(s',o')
HER: 轨迹终点 → 重标为目标 → 失败样本变正例

直观类比

做一桌菜:扁平 RL 是"每次伸手都从洗菜学起"(每个动作原始且链条超长);层次化是先练成"切菜、炒、调味"三个技能(选项),高层只学"什么顺序上什么菜"(SMDP 决策)。换一家餐厅(新任务),刀工不用重学——技能复用。

实例或案例

  • Montezuma's Revenge:层次/内在目标方法(如把"拿到钥匙"设为子目标)是该游戏的公认突破口方向,扁平方法几乎无解。
  • 机器人操作:GCRL+HER 的抓取是工业入门标配;FuN/Option-Critic 在 Atari 长视野游戏展示自动分层。
  • 大模型时代回声:LLM Agent 的"计划-执行"分层(规划器+工具执行器)是层次化思想的语言版。

常见误区

  • 误区一:"层次一定会更好"。层次引入结构偏置:子任务切分错误(选项边界不合理)反而限制策略上限;任务本身浅时是负资产。
  • 误区二:"选项要人工定义"。Option-Critic/FuN 证明可端到端学;但完全自动的层次发现在大任务上仍不成熟,半自动(领域知识定候选+算法精调)是实用折中。
  • 误区三:"HER 万能"。HER 只适用于"目标可重标"的目标条件设定(终点即目标);奖励函数固定的普通任务用不了。

与其他知识点的关系

  • kp-006:层次是探索问题的结构性解法。
  • kp-002:SMDP 是 MDP 的时间抽象推广。
  • kp-022:Dreamer 的想象 rollout 可与层次目标组合(分层想象)。
  • kp-031:长视野稀疏游戏是层次的天然考场。

自测题

  1. 选项三元组的构成?SMDP 备份与 MDP 备份的差异?

答:(启动集 I,内部策略 π,终止函数 β);SMDP 备份跨过选项的 k 步内部累积折扣奖励再接 γ^k 的后续价值——时间节拍从"步"变"选项"。

  1. HER 把失败轨迹变正例的机制?

答:目标条件设定下,把轨迹实际到达的终点重标为目标,则该轨迹成为"达成目标"的正例——稀疏奖励信号密度大增。

  1. 层次化为什么能救稀疏奖励探索?

答:探索赌注从"完整任务链的偶然成功"缩小到"高层选对子目标"——低层技能保证执行,探索在低维目标空间进行。

延伸阅读

  • Sutton, Precup & Singh, "Between MDPs and semi-MDPs: A framework for temporal abstraction"(1999,选项框架)。
  • Bacon 等, "The Option-Critic Architecture"(AAAI 2017)。
  • Vezhnevets 等, "FeUdal Networks for Hierarchical RL"(ICML 2017)。
  • Andrychowicz 等, "Hindsight Experience Replay"(NeurIPS 2017)。