RLHF:从人类偏好到对齐
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Christiano et al. 2017、Ouyang et al. 2022(InstructGPT)与 Bai et al. 2022(Constitutional AI)复核。
一句话定义
RLHF(人类反馈强化学习)三步走:① 让人对模型输出做成对偏好标注,② 从偏好数据训练奖励模型(Bradley-Terry 模型),③ 用 PPO 以奖励模型为信号微调语言模型(附对参考模型的 KL 惩罚)——把"人类觉得好"变成可优化的标量信号,是大模型对齐的工业标准流程。
为什么重要
它把 RL 从"玩游戏"带进了大模型核心:ChatGPT 类模型的有用性与无害性主要来自这一步。同时它催生了整条研究线(奖励模型攻击、DPO 等免 RL 方法、RLAIF/Constitutional AI)——理解 RLHF 是理解当代大模型训练栈的必经之路,也是 RL 理论(kp-013/017/023)最大规模的应用现场。
前置知识
kp-013(策略梯度)、kp-017(PPO)、kp-023(离线视角);不需要 NLP 先修。
核心概念
- 偏好对:标注者看同一 prompt 的两个输出,选更好的那个(比打绝对分稳定得多——人类不擅长绝对评分但擅长比较)。
- 奖励模型(RM):标量头网络 $r_\psi(x, y)$,按 Bradley-Terry 假设训练:偏好 (y_w ≻ y_l) 的概率 $= \sigma(r_\psi(x,y_w) - r_\psi(x,y_l))$,损失为负对数似然。
- PPO 微调:动作=token 序列生成,奖励=RM 打分(序列终点给一次)− β·KL(π‖π_ref)——KL 项锚住策略不漂离初始 SFT 模型。
- KL 惩罚的双重角色:防 reward hacking(策略漂到 RM 的高分怪区)+ 保持语言流畅(漂离预训练分布即退化)。
- DPO(直接偏好优化):数学上证明"RLHF 目标的闭式最优解"可由偏好损失直接监督——跳过 RM 与 PPO,用类似 SFT 的方式做对齐;是免 RL 路线的代表。
- RLAIF / Constitutional AI:用 AI 按一组原则(宪法)生成偏好,替代/扩充人类标注——规模化对齐的路线之争。
原理与机制
为什么用成对比较而非打分:人类的绝对尺度不稳定(今天打 7 明天打 8),但相对判断一致性高;BT 模型把成对偏好聚合成隐含的全局标量——这是"从不可靠人类信号提炼稳定奖励"的统计基础。奖励模型的泛化误差(对分布外 prompt 打分失真)是整条链路的质量上限。
为什么需要 KL 惩罚(RLHF 特有的第三损失):RM 只在训练分布上可信,策略一旦漂移出分布,RM 的分数成为"可被 exploit 的假信号"——策略会找到"人类没看过但 RM 打高分"的怪文本(reward hacking,kp-027)。KL-to-ref 惩罚让"离参考模型越远越贵",把策略压在 RM 可信区内。β 是有用性与安全/流畅的配平旋钮。
PPO 在这里的特殊形态:没有环境模拟器——"环境"就是语言模型自身的生成过程;rollout=采样完整回答,价值头估计序列级回报,GAE 沿 token 维展开。实现上是"RLHF 三件套(actor/RM/ref model)常驻显存 + 生成吞吐优化",工程复杂度高(这是 DPO 流行的根本原因:省掉整个 RL 基础设施)。
图示
① 标注: (prompt, y_w ≻ y_l) × 数万~百万
② RM: L = −log σ(r_ψ(x,y_w) − r_ψ(x,y_l))
③ PPO: max_π E[ r_ψ(x, y) − β·KL(π ‖ π_ref) ]
rollout = LLM 生成整段回答; token 级 GAE
DPO: 免RM免PPO, 直接从偏好对监督优化同一目标的闭式解
直观类比
训练一个"懂人心"的服务生:不打分(人打分不准),只让顾客比较两杯咖啡哪杯好(偏好对);训练一个品鉴师(RM)学会替顾客打分;再用品鉴师的分数调教服务生(PPO),但规定"不许变得不像你自己"(KL 惩罚)——否则他会端出顾客从没点过但品鉴师狂喜的怪东西。
实例或案例
- InstructGPT(2022):SFT → RM → PPO 三段式成为业界模板;论文数据展示 PPO 步数与 KL 约束强度的权衡曲线。
- Constitutional AI(Anthropic):AI 自我批评+原则化偏好(RLAIF),人类标注量大幅下降。
- DPO 及其家族(IPO/KTO/ORPO):学术与开源社区的事实标准——无 RL 基础设施也能对齐。
常见误区
- 误区一:"RLHF 的奖励就是人类偏好本身"。奖励是学出来的代理(RM),它有人类标注的偏差+泛化盲区+被 exploit 的攻击面;"RM 分数高"≠"人类真的更喜欢"。
- 误区二:"β(KL 系数)是无关紧要的超参"。它直接控制策略漂移幅度:太小→hacking 与退化,太大→学不到东西;对齐质量对 β 高度敏感。
- 误区三:"DPO 完全取代了 RLHF"。DPO 是离线偏好优化的高效替代,但在线迭代(生成-标注-再训)与过程奖励(PRM)类方法仍依赖 RL 式基础设施;两者是谱系不是替代关系。
与其他知识点的关系
- kp-013/017:策略梯度与 PPO 的最大应用场景。
- kp-023:RM 训练与偏好优化是离线设定。
- kp-027:reward hacking 在 RLHF 中的具象化(RM exploit)。
- kp-024:偏好博弈中的"多智能体"视角(不同人群偏好的聚合难题)。
自测题
- 写出奖励模型的 BT 损失并解释为什么用成对偏好。
答:$L=-\log\sigma(r(x,y_w)-r(x,y_l))$;人类绝对评分不稳定、相对比较一致性高,成对聚合更可靠。
- RLHF 的 KL 惩罚防什么?两个失败方向分别是什么?
答:防策略漂离 RM 可信区与初始分布;β 太小→RM exploit(怪文本刷分)与语言退化,β 太大→学不到偏好、退回 SFT。
- DPO 与 PPO-RLHF 的关系?
答:DPO 推导出对齐目标的闭式最优解、把"RM+RL"压缩为一步偏好监督;省基础设施但牺牲在线迭代与过程信号,两者是不同 trade-off 的谱系。
延伸阅读
- Christiano 等, "Deep RL from Human Preferences"(2017,偏好学习的起点)。
- Ouyang 等, "Training language models to follow instructions with human feedback"(2022,InstructGPT)。
- Rafailov 等, "Direct Preference Optimization"(NeurIPS 2023,DPO)。
- Bai 等, "Constitutional AI: Harmlessness from AI Feedback"(2022)。