离线强化学习:从固定数据集学策略

05-前沿主题 前沿 约 25 分钟 #离线RL#批量RL#分布偏移#CQL 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Levine et al. 2020 综述与 CQL/IQL 原论文复核。

一句话定义

离线(批量)RL 在固定的历史数据集上学习策略,训练期间不能与环境交互——分布偏移问题成为核心障碍:策略可能学出"数据里没见过的动作",其价值被函数逼近与自举系统性高估,导致部署时彻底失败;主流解法(BCQ/CQL/IQL)都在"对分布外动作的价值做保守惩罚"上做文章。

为什么重要

这是 RL 走向真实业务的关键一步:医疗(只能用历史病历)、自动驾驶(试错代价不可接受)、推荐(历史日志海量可用但无法在线试错)——这些场景只有离线数据。同时它是 RLHF 的隐含框架(kp-026:从偏好数据学奖励与策略,期间不与环境交互)。

前置知识

kp-009(off-policy 与分布)、kp-012(函数逼近下的高估)。

核心概念

  • 设定:数据集 $\mathcal{D} = \{(s,a,r,s')\}$ 由某固定行为策略(混合策略)采集;目标是学出好策略且不再交互。
  • 分布偏移(extrapolation error):目标策略访问的 $(s,a)$ 不在数据支持集内 → Q 估计完全靠外推 → 错误被自举传播。
  • 保守 Q 学习(CQL):在 Bellman 损失外加正则,压低数据外动作的 Q、抬高数据内动作的 Q:$\min_\phi\ \alpha\,\mathbb{E}_{s}\left[\log\sum_a e^{Q(s,a)} - \mathbb{E}_{a\sim\mathcal{D}}Q(s,a)\right] + L_{Bellman}$。
  • 隐式 Q 学习(IQL):完全避开"查询数据外动作"——用 expectile 回归近似 $\max_a Q$,从不显式评估没见过的动作。
  • 支持约束(BCQ 类):把目标动作限制在行为策略的近邻(生成模型+扰动),从动作空间上规避外推。
  • 策略约束视角:离线 RL ≈ 加权行为克隆 + 值函数引导的改进(数据好则保守学,数据中混有高质量轨迹则超越行为策略)。

原理与机制

为什么离线比在线 off-policy 更难:在线 off-policy(DQN/SAC)的行为策略会随学习演进、持续覆盖新的状态-动作区域,估值错误能被真实反馈纠正;离线场景这个纠错回路被切断——错误估值没有任何机制拉回,只能靠训练时的结构性保守。这是 kp-012 致命三角的"终极形态":离策略程度拉满且永不修正。

CQL 的直觉:既然外推动作的 Q 会虚高,那就显式地压它们——正则项让"数据外动作的软最大值"与"数据内动作的 Q"拉开差距。α 是保守强度旋钮:过小则仍外推、过大则策略过度保守退化为行为克隆。IQL 的直觉:干脆不问"数据外动作值多少",用分位数回归(expectile)从数据内动作中隐式提取"接近最优"的值——彻底绕开外推查询。

评估协议的坑:离线算法的对比高度依赖数据集质量(随机/中等/专家混合)与评测协议(训练中不接触环境,最终在留出的真实环境评估)——文献结论对这两者极度敏感,读论文先看数据配方。

图示

在线 off-policy: μ_t 采数据 → 学 π → μ_{t+1} 覆盖新区域 → 纠错循环 ✓
离线:           固定 D(μ_β) → 学 π → π 想去 D 外(s,a) → Q 外推虚高
                → 无真实反馈可纠 → 部署即崩 ✗
解法: CQL(压外动作Q) | IQL(不查外动作) | BCQ(限制在D支持集)

直观类比

只靠棋谱学棋(不许下棋练习):数据里没出现过的怪招,你的"局面估值"全靠脑补,而且脑补只会越推越自信(自举)。稳妥做法:只评估见过的招(IQL 式)、或对没见过的招一律先打个狠折(CQL 式)。

实例或案例

  • D4RL 基准:MuJoCo/迷宫/Adroit 的标准离线数据集(random/medium/expert 配方),离线算法的公共考场。
  • 医疗 RL:从历史治疗方案学策略(如脓毒症用药),保守性是伦理底线——任何外推都可能是人命。
  • RLHF 中的隐式离线:奖励模型从偏好对离线学习;RLAIF/拒绝采样微调则是"完全离线"的简化路线(DPO 可视为其中一种不需要显式 RL 的解)。

常见误区

  • 误区一:"离线 RL = off-policy RL 不采样"。off-policy 在线算法用于离线数据通常灾难性失败(外推高估);必须加保守机制,这是两个难度等级的问题。
  • 误区二:"数据越多越好,任何数据都行"。数据的行为策略覆盖决定一切;纯专家数据的离线 RL 常退化成行为克隆,混合多样数据反而更利于提取改进信号。
  • 误区三:"保守只有代价"。适当的保守性同时是安全属性(不会部署离谱动作)——离线 RL 与安全 RL(kp-033)在此交汇。

与其他知识点的关系

  • kp-009/012:离线是 off-policy 与三角的极限情形。
  • kp-019:IQL/CQL 常建在 SAC 骨架上。
  • kp-026:RLHF 的奖励学习是离线设定;DPO 等免 RL 路线是离线思想的延伸。
  • kp-033:保守性与安全 RL 的价值约束相通。

自测题

  1. 离线 RL 的核心障碍是什么?与在线 off-policy 的关键差别?

答:分布偏移——目标策略的数据外动作估值靠外推且被自举放大;在线场景行为策略演进提供纠错反馈,离线没有,错误只能训练时结构性压制。

  1. CQL 与 IQL 分别怎么绕开外推?

答:CQL 用正则压低数据外动作的 Q(仍查询但保守);IQL 用 expectile 回归只从数据内动作隐式提取最优性(根本不查询数据外动作)。

  1. 为什么纯专家数据集上离线 RL 容易退化为行为克隆?

答:数据内动作已接近最优,值函数引导的"改进空间"很小;策略约束+保守正则把策略锁在行为附近,等价于加权克隆。

延伸阅读

  • Levine 等, "Offline Reinforcement Learning: Tutorial, Review, and Perspectives"(2020)。
  • Kumar 等, "Conservative Q-Learning for Offline Reinforcement Learning"(NeurIPS 2020,CQL)。
  • Kostrikov 等, "Offline Reinforcement Learning with Implicit Q-Learning"(ICLR 2022,IQL)。
  • D4RL 基准(Gymnasium-Robotics 生态可加载)。