深度强化学习 · 从试错到对齐
智能体如何在与环境的交互中通过试错最大化累积奖励?33 个知识点,带你走完 MDP → TD/Q-Learning → DQN → 策略梯度 → PPO → TD3/SAC 的算法主线,延伸到离线 RL、RLHF 与安全 RL 的前沿,并给出调参与评估的工程纪律。
学习进度加载中…
知识模块
01-基础与MDP
6 个知识点
02-无模型价值方法
6 个知识点
03-策略梯度与ActorCritic
7 个知识点
04-模型与规划
3 个知识点
05-前沿主题
5 个知识点
06-工程实践与案例
6 个知识点