知识地图

横轴为模块、纵轴为难度层级,虚线为前置依赖(prerequisites)。悬停节点可看标题,点击进入知识点。

入门核心进阶前沿 ⌀ 虚线 = 前置依赖
入门核心进阶前沿 什么是强化学习:试错、延迟奖励与交互学习(入门) kp-001 马尔可夫决策过程(MDP):RL 的数学骨架(核心) kp-002 策略、回报与折扣因子(核心) kp-003 价值函数与贝尔曼方程:RL 的核心递归(核心) kp-004 动态规划:策略评估、策略迭代与值迭代(核心) kp-005 探索与利用:ε-greedy、乐观与 UCB(核心) kp-006 蒙特卡洛方法:用完整回合估计价值(核心) kp-007 时序差分学习:TD(0)、SARSA 与 Q-Learning(核心) kp-008 On-policy 与 Off-policy:数据属于谁的策略(核心) kp-009 DQN:经验回放与目标网络(核心) kp-010 DQN 改进族:Double、Dueling 与优先回放(进阶) kp-011 致命三角:函数逼近 × 自举 × 离线训练(进阶) kp-012 策略梯度定理与 REINFORCE(核心) kp-013 基线、优势函数与 GAE(核心) kp-014 Actor-Critic 架构:A2C 与 A3C(核心) kp-015 信赖域方法与 TRPO(进阶) kp-016 PPO:裁剪替代目标与实现细节(核心) kp-017 确定性策略梯度与 DDPG(进阶) kp-018 TD3 与 SAC:连续控制的现代基线(进阶) kp-019 基于模型的 RL:模型学习、Dyna 与规划(进阶) kp-020 MCTS 与 AlphaGo:搜索即策略(进阶) kp-021 世界模型与 Dreamer:在想象中训练(前沿) kp-022 离线强化学习:从固定数据集学策略(前沿) kp-023 多智能体强化学习:从单智能体到群体博弈(前沿) kp-024 层次化强化学习:选项、目标条件与封建网络(进阶) kp-025 RLHF:从人类偏好到对齐(前沿) kp-026 奖励塑形与奖励 hacking(核心) kp-027 深度 RL 工程基础:Gymnasium、向量化环境与复现(核心) kp-028 调参炼金术:超参清单与常见坑(核心) kp-029 评估方法学:多种子、性能曲线与统计严谨(核心) kp-030 案例研究:Atari 与 DQN 谱系(进阶) kp-031 案例研究:AlphaZero 与机器人应用(进阶) kp-032 安全 RL 与领域趋势(前沿) kp-033

# 深度强化学习 · 知识库总览

领域边界

核心问题:智能体如何在与环境的持续交互中,通过试错最大化累积奖励——当状态空间大到无法枚举(如游戏画面、机器人控制)时,必须用深度神经网络逼近价值函数或策略,这带来稳定性、样本效率与可复现性的独特挑战。

学完能做到什么:

  1. 用 MDP 语言精确描述一个决策问题(状态/动作/奖励/折扣的设计取舍)。
  2. 看懂主流算法谱系:DP → MC → TD → DQN → REINFORCE → Actor-Critic → TRPO/PPO → DDPG/SAC,并为给定问题选型。
  3. 读懂损失函数与更新规则里的每一项(目标网络、重要性采样、GAE、裁剪目标、熵正则)。
  4. 用 Gymnasium 跑通基线算法,掌握深度 RL 调参与评估的工程纪律(多种子、性能曲线、常见坑)。
  5. 理解前沿方向的问题定义:离线 RL、多智能体、层次化、RLHF、奖励 hacking。

前置知识(不属于本库范围,建议先行掌握):

阶段划分

阶段内容对应模块
入门RL 是什么、MDP 四要素、回报与折扣01
核心贝尔曼方程、DP、探索利用、MC/TD、Q-Learning、DQN、策略梯度、PPO01–03
进阶TRPO/DDPG/SAC、模型基 RL、MCTS、函数逼近三角、奖励塑形03–05
前沿离线 RL、多智能体、层次化、RLHF、安全 RL05、06

最小可用路径:kp-001 → kp-002 → kp-003 → kp-004 → kp-006 → kp-008 → kp-010 → kp-013 → kp-014 → kp-017 → kp-029。走完即可理解从表格法到深度算法的完整主线(TD → DQN → 策略梯度 → PPO)并具备上手实验的工程意识。

01-基础与MDP

02-无模型价值方法

03-策略梯度与ActorCritic

04-模型与规划

05-前沿主题

06-工程实践与案例