离线强化学习:从固定数据集学策略
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Levine et al. 2020 综述与 CQL/IQL 原论文复核。
一句话定义
离线(批量)RL 在固定的历史数据集上学习策略,训练期间不能与环境交互——分布偏移问题成为核心障碍:策略可能学出"数据里没见过的动作",其价值被函数逼近与自举系统性高估,导致部署时彻底失败;主流解法(BCQ/CQL/IQL)都在"对分布外动作的价值做保守惩罚"上做文章。
为什么重要
这是 RL 走向真实业务的关键一步:医疗(只能用历史病历)、自动驾驶(试错代价不可接受)、推荐(历史日志海量可用但无法在线试错)——这些场景只有离线数据。同时它是 RLHF 的隐含框架(kp-026:从偏好数据学奖励与策略,期间不与环境交互)。
前置知识
kp-009(off-policy 与分布)、kp-012(函数逼近下的高估)。
核心概念
- 设定:数据集 $\mathcal{D} = \{(s,a,r,s')\}$ 由某固定行为策略(混合策略)采集;目标是学出好策略且不再交互。
- 分布偏移(extrapolation error):目标策略访问的 $(s,a)$ 不在数据支持集内 → Q 估计完全靠外推 → 错误被自举传播。
- 保守 Q 学习(CQL):在 Bellman 损失外加正则,压低数据外动作的 Q、抬高数据内动作的 Q:$\min_\phi\ \alpha\,\mathbb{E}_{s}\left[\log\sum_a e^{Q(s,a)} - \mathbb{E}_{a\sim\mathcal{D}}Q(s,a)\right] + L_{Bellman}$。
- 隐式 Q 学习(IQL):完全避开"查询数据外动作"——用 expectile 回归近似 $\max_a Q$,从不显式评估没见过的动作。
- 支持约束(BCQ 类):把目标动作限制在行为策略的近邻(生成模型+扰动),从动作空间上规避外推。
- 策略约束视角:离线 RL ≈ 加权行为克隆 + 值函数引导的改进(数据好则保守学,数据中混有高质量轨迹则超越行为策略)。
原理与机制
为什么离线比在线 off-policy 更难:在线 off-policy(DQN/SAC)的行为策略会随学习演进、持续覆盖新的状态-动作区域,估值错误能被真实反馈纠正;离线场景这个纠错回路被切断——错误估值没有任何机制拉回,只能靠训练时的结构性保守。这是 kp-012 致命三角的"终极形态":离策略程度拉满且永不修正。
CQL 的直觉:既然外推动作的 Q 会虚高,那就显式地压它们——正则项让"数据外动作的软最大值"与"数据内动作的 Q"拉开差距。α 是保守强度旋钮:过小则仍外推、过大则策略过度保守退化为行为克隆。IQL 的直觉:干脆不问"数据外动作值多少",用分位数回归(expectile)从数据内动作中隐式提取"接近最优"的值——彻底绕开外推查询。
评估协议的坑:离线算法的对比高度依赖数据集质量(随机/中等/专家混合)与评测协议(训练中不接触环境,最终在留出的真实环境评估)——文献结论对这两者极度敏感,读论文先看数据配方。
图示
在线 off-policy: μ_t 采数据 → 学 π → μ_{t+1} 覆盖新区域 → 纠错循环 ✓
离线: 固定 D(μ_β) → 学 π → π 想去 D 外(s,a) → Q 外推虚高
→ 无真实反馈可纠 → 部署即崩 ✗
解法: CQL(压外动作Q) | IQL(不查外动作) | BCQ(限制在D支持集)
直观类比
只靠棋谱学棋(不许下棋练习):数据里没出现过的怪招,你的"局面估值"全靠脑补,而且脑补只会越推越自信(自举)。稳妥做法:只评估见过的招(IQL 式)、或对没见过的招一律先打个狠折(CQL 式)。
实例或案例
- D4RL 基准:MuJoCo/迷宫/Adroit 的标准离线数据集(random/medium/expert 配方),离线算法的公共考场。
- 医疗 RL:从历史治疗方案学策略(如脓毒症用药),保守性是伦理底线——任何外推都可能是人命。
- RLHF 中的隐式离线:奖励模型从偏好对离线学习;RLAIF/拒绝采样微调则是"完全离线"的简化路线(DPO 可视为其中一种不需要显式 RL 的解)。
常见误区
- 误区一:"离线 RL = off-policy RL 不采样"。off-policy 在线算法用于离线数据通常灾难性失败(外推高估);必须加保守机制,这是两个难度等级的问题。
- 误区二:"数据越多越好,任何数据都行"。数据的行为策略覆盖决定一切;纯专家数据的离线 RL 常退化成行为克隆,混合多样数据反而更利于提取改进信号。
- 误区三:"保守只有代价"。适当的保守性同时是安全属性(不会部署离谱动作)——离线 RL 与安全 RL(kp-033)在此交汇。
与其他知识点的关系
- kp-009/012:离线是 off-policy 与三角的极限情形。
- kp-019:IQL/CQL 常建在 SAC 骨架上。
- kp-026:RLHF 的奖励学习是离线设定;DPO 等免 RL 路线是离线思想的延伸。
- kp-033:保守性与安全 RL 的价值约束相通。
自测题
- 离线 RL 的核心障碍是什么?与在线 off-policy 的关键差别?
答:分布偏移——目标策略的数据外动作估值靠外推且被自举放大;在线场景行为策略演进提供纠错反馈,离线没有,错误只能训练时结构性压制。
- CQL 与 IQL 分别怎么绕开外推?
答:CQL 用正则压低数据外动作的 Q(仍查询但保守);IQL 用 expectile 回归只从数据内动作隐式提取最优性(根本不查询数据外动作)。
- 为什么纯专家数据集上离线 RL 容易退化为行为克隆?
答:数据内动作已接近最优,值函数引导的"改进空间"很小;策略约束+保守正则把策略锁在行为附近,等价于加权克隆。
延伸阅读
- Levine 等, "Offline Reinforcement Learning: Tutorial, Review, and Perspectives"(2020)。
- Kumar 等, "Conservative Q-Learning for Offline Reinforcement Learning"(NeurIPS 2020,CQL)。
- Kostrikov 等, "Offline Reinforcement Learning with Implicit Q-Learning"(ICLR 2022,IQL)。
- D4RL 基准(Gymnasium-Robotics 生态可加载)。