什么是强化学习:试错、延迟奖励与交互学习

01-基础与MDP 入门 约 15 分钟 #基础#智能体#奖励#试错学习 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Sutton & Barto 教材复核。

一句话定义

强化学习(RL)研究智能体(agent)如何在与环境的持续交互中,通过试错学习一个策略,使长期累积奖励最大化——监督信号不是"正确答案"而是"奖惩标量",且反馈常常是延迟的。

为什么重要

RL 是"学习做决策"的数学框架:监督学习回答"这是什么",无监督学习回答"数据长什么样",RL 回答"接下来该做什么"。游戏(Atari、围棋)、机器人控制、推荐系统、大模型对齐(RLHF)背后都是它。理解 RL 的独特难点(探索、延迟信用分配、非平稳数据),才能理解后续所有算法为什么长成那样。

前置知识

概率论基本概念(期望);不需要任何 RL 先修。

核心概念

  • 智能体-环境循环:智能体在时刻 t 观察状态 $S_t$,执行动作 $A_t$,环境返回奖励 $R_{t+1}$ 与新状态 $S_{t+1}$;循环往复。
  • 奖励假设:一切目标都可表述为"最大化期望累积奖励"——这是整个领域的公理。
  • 试错学习(trial-and-error):策略改进只能来自"尝试 → 看结果 → 调整",没有标签。
  • 探索 vs 利用:为获得高回报要利用已知好动作,为发现更好的动作必须探索未知——监督学习没有这个两难。
  • 延迟奖励与信用分配:一步臭棋可能在几十步后才输棋;把结果归因到该负责的动作,是 RL 的核心难题之一。

原理与机制

RL 与监督学习/无监督学习的本质差异在四点:① 数据由自己的行为产生——策略改变,数据分布随之改变(非平稳),这正是"经验回放"(kp-010)与"on/off-policy"(kp-009)问题的根源;② 评估依赖交互——策略好坏没有静态测试集,必须真跑才知道,评估成本高(kp-030);③ 目标与监督解耦——奖励只告诉你"结果好不好",不告诉你"正确动作是什么";④ 时间 credit 分配——损失不再逐样本独立,而是跨时间步耦合(kp-013 的方差爆炸与此直接相关)。

流派坐标:Sutton/Barto 的表格法传统(DP/MC/TD,本库 01–02 模块)与深度函数逼近传统(DQN 之后,02–03 模块)在 2015 年合流;基于价值(学 Q)与基于策略(直接学 π)两大算法家族的分野贯穿至今(kp-008 vs kp-013)。

图示

        动作 A_t
 智能体 ────────► 环境
   ▲                │
   │  S_{t+1}, R_{t+1}  │
   └────────────────┘
 目标: 学 π(a|s) 使 E[Σ γ^t R_t] 最大

直观类比

教小狗握手:没人给它"正确动作"的标签(那是监督学习),只有饼干(奖励)与没有饼干。它必须自己乱试,试对了给饼干——而且饼干往往在动作完成后一秒才给,它得自己想明白"刚才哪个动作挣来的"(信用分配)。

实例或案例

  • Atari 游戏:从像素直接学,Q-Learning + 神经网络(kp-010)达到人类水平——深度 RL 的成人礼。
  • 围棋:MCTS + 自我对弈(kp-021)超越人类顶尖。
  • ChatGPT 类模型的对齐:RLHF 用人类偏好做奖励做 RL(kp-026)——RL 从"打游戏"走进了大模型核心。

常见误区

  • 误区一:"RL 就是有奖励的监督学习"。没有正确标签、数据非平稳、必须探索——三者中任何一个都让监督学习方法直接失效。
  • 误区二:"奖励就是目标本身"。奖励是设计出来的代理信号,代理与真实目标的偏差正是奖励 hacking 的温床(kp-027)。
  • 误区三:"深度 RL = 神经网络 + Q-Learning 这么简单"。函数逼近引入稳定性难题(kp-012),工程细节决定成败(kp-028/029)。

与其他知识点的关系

  • kp-002/003:把直觉形式化为 MDP 与回报。
  • kp-006:探索-利用的算法化。
  • kp-026:RL 作为对齐工具的现代应用。

自测题

  1. RL 与监督学习的三个本质区别?

答:数据由自身行为产生(非平稳);无正确标签、只有标量奖励;反馈延迟且需探索——监督学习的静态 iid 假设全部不成立。

  1. 什么是奖励假设?它有什么隐含风险?

答:任何目标都可表述为最大化期望累积奖励;风险在奖励是代理信号,与真实目标的偏差会诱发奖励 hacking(kp-027)。

  1. "下棋输在第 37 手,但第 5 手埋下祸根"对应 RL 的什么难题?

答:延迟奖励下的信用分配(credit assignment)——如何把长期结果归因到早期动作。

延伸阅读

  • Sutton & Barto《Reinforcement Learning: An Introduction》第 1 章。
  • David Silver 的 UCL 课程讲义(RL lecture 1)。
  • OpenAI Spinning Up 文档 "Kinds of RL Algorithms"。