深度强化学习 · 从试错到对齐

智能体如何在与环境的交互中通过试错最大化累积奖励?33 个知识点,带你走完 MDP → TD/Q-Learning → DQN → 策略梯度 → PPO → TD3/SAC 的算法主线,延伸到离线 RL、RLHF 与安全 RL 的前沿,并给出调参与评估的工程纪律。

学习进度加载中…

知识模块

01-基础与MDP

6 个知识点

02-无模型价值方法

6 个知识点

03-策略梯度与ActorCritic

7 个知识点

04-模型与规划

3 个知识点

05-前沿主题

5 个知识点

06-工程实践与案例

6 个知识点