知识地图
横轴为模块、纵轴为难度层级,虚线为前置依赖(prerequisites)。悬停节点可看标题,点击进入知识点。
入门核心进阶前沿
⌀ 虚线 = 前置依赖
# 深度强化学习 · 知识库总览
领域边界
核心问题:智能体如何在与环境的持续交互中,通过试错最大化累积奖励——当状态空间大到无法枚举(如游戏画面、机器人控制)时,必须用深度神经网络逼近价值函数或策略,这带来稳定性、样本效率与可复现性的独特挑战。
学完能做到什么:
- 用 MDP 语言精确描述一个决策问题(状态/动作/奖励/折扣的设计取舍)。
- 看懂主流算法谱系:DP → MC → TD → DQN → REINFORCE → Actor-Critic → TRPO/PPO → DDPG/SAC,并为给定问题选型。
- 读懂损失函数与更新规则里的每一项(目标网络、重要性采样、GAE、裁剪目标、熵正则)。
- 用 Gymnasium 跑通基线算法,掌握深度 RL 调参与评估的工程纪律(多种子、性能曲线、常见坑)。
- 理解前沿方向的问题定义:离线 RL、多智能体、层次化、RLHF、奖励 hacking。
前置知识(不属于本库范围,建议先行掌握):
- 概率论基础:期望、条件期望、方差、贝叶斯直觉。
- 深度学习基础:神经网络、反向传播、优化器、过拟合(本库只谈"网络当函数逼近器",不重讲训练原理)。
- 一点动态规划直觉有助于 01 模块(贝尔曼方程部分会自含推导)。
- Python 与 NumPy。
阶段划分
| 阶段 | 内容 | 对应模块 |
|---|
| 入门 | RL 是什么、MDP 四要素、回报与折扣 | 01 |
| 核心 | 贝尔曼方程、DP、探索利用、MC/TD、Q-Learning、DQN、策略梯度、PPO | 01–03 |
| 进阶 | TRPO/DDPG/SAC、模型基 RL、MCTS、函数逼近三角、奖励塑形 | 03–05 |
| 前沿 | 离线 RL、多智能体、层次化、RLHF、安全 RL | 05、06 |
最小可用路径:kp-001 → kp-002 → kp-003 → kp-004 → kp-006 → kp-008 → kp-010 → kp-013 → kp-014 → kp-017 → kp-029。走完即可理解从表格法到深度算法的完整主线(TD → DQN → 策略梯度 → PPO)并具备上手实验的工程意识。