学习路径
# 学习路径
前置知识要求见 00-overview.md:概率论基础、深度学习基础、Python/NumPy。这些不属于本知识库范围。
第一阶段 · 入门(约 1.5 小时)
建立"交互式学习"的世界观:没有监督信号,只有奖励与试错。
第二阶段 · 核心(约 5 小时)
价值方法与策略方法的完整主线。
- [kp-004] 价值函数与贝尔曼方程(25 分钟)
- [kp-005] 动态规划三件套(20 分钟)
- [kp-007] 蒙特卡洛(20 分钟)→ [kp-008] 时序差分:TD/SARSA/Q-Learning(30 分钟)
- [kp-009] on-policy 与 off-policy(20 分钟)
- [kp-010] DQN:经验回放与目标网络(30 分钟)
- [kp-013] 策略梯度定理与 REINFORCE(25 分钟)
- [kp-014] 基线与 GAE(20 分钟)→ [kp-015] Actor-Critic(20 分钟)
- [kp-017] PPO(30 分钟)
- [kp-027] 奖励塑形与奖励 hacking(20 分钟)
第三阶段 · 进阶(约 3 小时)
- [kp-011] DQN 改进族(20 分钟)
- [kp-012] 致命三角:函数逼近为何发散(20 分钟)
- [kp-016] TRPO(25 分钟)
- [kp-018] DDPG(20 分钟)→ [kp-019] TD3 与 SAC(30 分钟)
- [kp-020] 模型基 RL 概览(20 分钟)
- [kp-021] MCTS 与 AlphaGo(25 分钟)
- [kp-025] 层次化 RL(20 分钟)
第四阶段 · 前沿与工程(约 3 小时)
- [kp-022] 世界模型与 Dreamer(20 分钟)
- [kp-023] 离线 RL(25 分钟)
- [kp-024] 多智能体 RL(20 分钟)
- [kp-026] RLHF(25 分钟)
- [kp-028] 工程基础与复现(20 分钟)
- [kp-029] 调参炼金术(25 分钟)→ [kp-030] 评估方法学(20 分钟)
- [kp-031] Atari 案例(15 分钟)→ [kp-032] AlphaZero 与机器人(20 分钟)
- [kp-033] 安全 RL 与趋势(20 分钟)
最小可用路径
kp-001 → kp-002 → kp-003 → kp-004 → kp-006 → kp-008 → kp-010 → kp-013 → kp-014 → kp-017 → kp-029(约 3.5 小时)。这条线是"从 TD 到 PPO"的完整主干:MDP 与贝尔曼 → TD/Q-Learning → DQN 两大工程件 → 策略梯度 → GAE → PPO,最后以调参纪律收尾。时间紧张只走这条线。
学习进度加载中…