探索与利用:ε-greedy、乐观与 UCB

01-基础与MDP 核心 约 20 分钟 #探索#ε-greedy#UCB#乐观初始化 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Sutton & Barto 教材复核。

一句话定义

探索-利用困境是 RL 特有的两难:利用已知最优动作保住当前收益,还是探索未知动作换取未来更优信息;工程谱系从最简单的 ε-greedy,到乐观初始化、UCB 的置信上界原则,再到熵正则与参数噪声——没有免费午餐,探索策略直接决定能否找到并锁定最优解。

为什么重要

贪心策略会永久锁死在初始运气最好的动作上(次优陷阱);过度探索则永远在交学费。深度 RL 中探索不足是"学不会"的第一大原因(稀疏奖励环境尤其如此),因此每个算法栈都要显式回答"探索从哪来"。

前置知识

kp-001(探索-利用两难的定义)、kp-003(期望回报目标)。

核心概念

  • ε-greedy:以概率 ε 随机动作、1−ε 贪心;ε 可随时间衰减(前期多探、后期多利用)。简单、万金油,但探索是无目的的(连明知很差的动作也试)。
  • 乐观初始化(optimistic initialization):把初始值设得比任何可能回报都高——贪心策略会自动先尝试所有"看起来很好"的选项,直到估值被真实拉低;把探索内建进贪心里。
  • UCB(置信上界):选 $a = \arg\max_a [Q(a) + c\sqrt{\ln t / N(a)}]$——估值高或试得少的动作都优先;不确定性以附加项显式计价。
  • 熵正则(entropy bonus):在策略方法中奖励策略保持随机性(−β·H(π) 进目标,kp-017/019),防止过早坍缩到次优确定性策略。
  • 参数/噪声探索:在参数空间加噪(网络权重扰动)或用随机策略网络(SAC 的温度自适应,kp-019)——对连续控制比动作噪声更有效。
  • 内在奖励(intrinsic motivation):好奇心/新颖性作额外奖励,驱动稀疏奖励探索(前沿方向)。

原理与机制

两难的数学本质:探索的机会成本 vs 信息价值。多臂老虎机的 regret 分析证明:任何策略的累计遗憾至少 Ω(log T)(无法零成本学习),UCB 达到 O(log T) 最优界——"遗憾"把两难变成可优化的量。RL 场景下更难:探索影响的不只是本步收益,还有数据分布(决定能学到什么,kp-009)。

衰减的节奏:ε 固定则长期保留 1/|A| 的随机扰动,渐进性能受损;衰减过快则早期锁死。经验:ε 从 1.0 线性/指数衰减到 0.01–0.1(Atari DQN 在前 100 万帧内衰减)。衰减曲线是调参的重要维度(kp-029)。

为什么"探索不足"在深度 RL 更隐蔽:函数逼近下,未探索区域的价值估计由网络外推(泛化)填充——可能高估也可能低估;智能体不是"没去试",而是"对没去过的区域有错误自信"。诊断信号:熵坍缩过早、Q 值发散(kp-012)。

图示

ε-greedy:  P(a=argmax Q) = 1-ε;  其余均分 ε
UCB:       score(a) = Q(a) + c·√(ln t / N(a))
                     价值高 ─────┘   └────── 试得少(不确定性)
乐观初始化: 初始 Q=+∞ 侧 → 贪心自动遍历全部动作 → 自然衰减收敛

直观类比

点餐:ε-greedy 是"90% 点最爱,10% 闭眼乱点";乐观初始化是"把没吃过的店都想象成五星,直到吃到难吃的为止";UCB 是"这家店好且我了解得少,先去摸底"——不确定性越高越值得一试。

实例或案例

  • 经典十臂老虎机实验:ε=0 贪心锁死次优(遗憾线性增长),ε=0.1 与 UCB 遗憾均为对数增长且 UCB 系数更稳。
  • 稀疏奖励游戏(Montezuma's Revenge):ε-greedy 几乎不可能碰到钥匙,必须内在奖励/分层探索——探索难度与奖励稀疏度直接相关。
  • SAC 的自动温度调节:熵系数 α 随学习动态调整,探索强度自适应目标熵(kp-019)。

常见误区

  • 误区一:"探索只是前期的事"。策略评估与持续改进依赖数据的持续覆盖;ε 完全衰减到 0 后,分布漂移再无纠正能力——线上系统常保底 ε_min。
  • 误区二:"UCB 只适用于老虎机"。其思想(不确定性计价)延伸到 MCTS 的 UCT(kp-021)与贪心探索理论;是跨领域的设计原则。
  • 误区三:"加大熵系数总能提升性能"。熵过强则策略过度随机、收敛不到最优;探索强度是配平项,须与任务难度匹配(kp-029)。

与其他知识点的关系

  • kp-008:Q-Learning 是 off-policy 的,行为策略的 ε-greedy 与目标贪心分离——探索结构天然清晰。
  • kp-010:DQN 的 ε 衰减时间表是复现 Atari 结果的关键配置之一。
  • kp-019:SAC 用最大熵框架把探索内建进目标函数。
  • kp-029:探索参数(ε/熵系数)是调参清单的常客。

自测题

  1. 乐观初始化为什么能让贪心策略自动探索?

答:初始值高于一切真实回报,未试过的动作看起来最优,贪心选择会先遍历它们;随着真实样本拉低估值,探索自动收敛到利用。

  1. 写出 UCB 选择规则并解释两项。

答:$\arg\max_a [Q(a) + c\sqrt{\ln t/N(a)}]$——第一项是利用(估值),第二项是不确定性奖励(试得越少附加分越高),c 控制配比。

  1. 为什么深度 RL 的探索问题更隐蔽?

答:函数逼近对未探索区域外推填充估值,形成"错误自信";表现为熵早坍缩、Q 发散,而非简单的"没试过"。

延伸阅读

  • Sutton & Barto 教材第 2 章(多臂老虎机全章)。
  • Auer 等, "Finite-time Analysis of the Multiarmed Bandit Problem"(UCB 理论)。
  • Pathak 等, "Curiosity-driven Exploration"(2017,内在奖励)。