- 强化学习(RL)
- 智能体通过与环境交互试错、最大化累积奖励的学习范式。
- 智能体-环境循环
- 状态→动作→奖励→新状态的持续交互闭环。
- 奖励假设
- 一切目标可表述为最大化期望累积奖励的公理。
- MDP
- 马尔可夫决策过程,$(\mathcal{S},\mathcal{A},P,R,\gamma)$ 五元组形式的序贯决策框架。
- 马尔可夫性
- 未来只依赖当前状态与动作、与更早历史无关的性质。
- POMDP
- 部分可观测 MDP——状态不可直接观测,需用历史/记忆近似。
- 策略 π
- 状态到动作的行为规则(确定性或随机分布)。
- 回报 $G_t$
- 从 t 起的折扣奖励和 $R_{t+1}+\gamma R_{t+2}+\dots$。
- 折扣因子 γ
- 未来奖励的折算系数;决定有效视野 1/(1−γ)。
- 状态价值 $v^\pi(s)$
- 从 s 出发按 π 行动的期望回报。
- 动作价值 $q^\pi(s,a)$
- 在 s 执行 a 后按 π 行动的期望回报。
- 优势函数
- $A(s,a)=q(s,a)-v(s)$——动作相对平均水平的改进量。
- 贝尔曼方程
- 价值=即时奖励+折后后继价值的递归定义,RL 一切算法的源头。
- 贝尔曼最优方程
- 内嵌 max 的价值递归,压缩映射保证唯一解。
- 动态规划(DP)
- 转移核已知时在表格上解贝尔曼方程的方法族。
- 策略迭代 / 值迭代
- 评估-改进交替 / max 备份直奔最优的两种 DP 方案。
- 广义策略迭代(GPI)
- 任何"评估与改进互相咬合"的过程统称。
- 策略改进定理
- 贪心于 $v^\pi$ 的新策略逐状态不劣。
- 探索-利用困境
- 利用已知最优与探索未知信息的两难。
- ε-greedy
- 以概率 ε 随机探索、1−ε 贪心利用的基线探索策略。
- UCB
- 置信上界选择——估值高或尝试少的动作优先。
- 乐观初始化
- 把初始价值设得高于真实值以驱动自动探索。
- 熵正则
- 奖励策略保持随机性以防过早坍缩的探索机制。
- 蒙特卡洛(MC)
- 用完整回合的实际回报估计价值——无偏高方差。
- 时序差分(TD)
- 用"即时奖励+折后价值估计"自举更新——有偏低方差。
- TD 误差
- $\delta = r+\gamma V(s')-V(s)$,一步 surprised 信号。
- SARSA
- on-policy TD 控制,目标用行为策略实际会选的下一动作。
- Q-Learning
- off-policy TD 控制,目标取下一状态动作价值 max,学 $q^*$。
- 自举(bootstrapping)
- 用当前估计值作为更新目标的一部分。
- on-policy / off-policy
- 评估"产生数据的策略本身" / 用别的策略数据学目标策略。
- 重要性采样(IS)
- 用似然比 $\pi/\mu$ 校正行为分布与目标分布差异。
- 经验回放
- 历史转移存池随机抽样训练——打散相关性、复用样本。
- 目标网络
- 参数慢速移动的副本,冻结 TD 目标端以稳定训练。
- DQN
- 深度 Q 网络——CNN+Q-Learning+回放+目标网络,Atari 元年算法。
- Double DQN
- 解耦动作选择与价值评估以缓解 max 高估。
- Dueling
- 网络分头输出 V 与优势再合成 Q 的架构。
- 优先经验回放(PER)
- 按 TD 误差分配抽样概率,配 IS 权重修正。
- 致命三角
- 函数逼近×自举×离策略同时出现时价值学习可发散。
- Baird 反例
- 最小化构造的半梯度 TD 发散案例。
- 策略梯度定理
- $\nabla J=\mathbb{E}[\nabla\log\pi(a|s)G_t]$——回报加权的对数似然上升。
- REINFORCE
- 蒙特卡洛策略梯度,无偏高方差。
- log-derivative 技巧
- $\nabla\pi=\pi\nabla\log\pi$,把采样期望的梯度化成可微形式。
- 基线
- 策略梯度权重中减去的只依赖状态的量——不改期望只降方差。
- GAE
- 广义优势估计,TD 误差的 λ 指数加权递归;λ 平衡偏差与方差。
- Actor-Critic
- 策略头(actor)+ 价值头(critic)分工的架构。
- A2C / A3C
- 同步 / 异步多线程的优势 Actor-Critic。
- TRPO
- KL 约束下最大化替代优势目标的信赖域方法。
- 替代目标(surrogate)
- 用旧数据经 IS 校正估计新策略表现的目标。
- 自然梯度
- 以 Fisher 度量(分布距离)而非参数欧氏距离的最速下降。
- PPO
- 把信赖域换成一阶 clip 的替代目标——工业标准策略优化。
- clip
- 把概率比率夹在 1±ε 区间,对有利越界不奖励的软步长约束。
- DPG / DDPG
- 确定性策略梯度及其深度实现——连续控制四件套。
- TD3
- DDPG 三针——双 Q 取 min、目标策略平滑、延迟 actor 更新。
- SAC
- 最大熵 off-policy Actor-Critic——soft 回报、随机策略、自动温度。
- 最大熵 RL
- 在回报之外最大化策略熵的目标设定。
- 重参数化技巧
- 把随机性移出参数(a=μ+σ⊙ε)使采样可微。
- 软更新
- $\theta'\leftarrow\tau\theta+(1-\tau)\theta'$ 的目标网络平滑同步。
- 基于模型的 RL
- 学习环境动力学并用其规划/生成想象经验的方法族。
- Dyna
- 真实经验与模型想象经验混合训练的经典框架。
- MCTS
- 蒙特卡洛树搜索——选择/扩展/评估/回传四步构建决策树。
- UCT / PUCT
- 树上 UCB 探索公式 / AlphaGo 版(带策略先验 P)。
- AlphaGo / AlphaZero / MuZero
- 人类棋谱+MCTS / 纯自博弈+搜索 / 学习模型的通用搜索方案。
- 自我对弈
- 智能体与自身副本对弈生成训练数据的机制。
- 世界模型 / Dreamer
- 潜空间学动力学、在想象轨迹上以可微梯度训练策略的范式。
- RSSM
- 编码器+序列模型+解码头的潜空间世界模型架构。
- 离线(批量)RL
- 仅用固定历史数据集学策略,不与环境交互。
- 分布偏移 / 外推误差
- 目标策略访问数据外动作导致估值虚高的核心障碍。
- CQL / IQL
- 保守 Q 学习(压数据外动作 Q)/ 隐式 Q 学习(expectile 不查数据外动作)。
- D4RL
- 离线 RL 标准基准集。
- 马尔可夫博弈
- 多智能体下转移与奖励取决于联合动作的 MDP 推广。
- 非平稳性(MARL)
- 其他智能体在学导致单智能体视角动力学漂移。
- CTDE
- 集中训练(中央 critic 全局信息)分散执行(局部观测独立决策)范式。
- QMIX
- 联合 Q 分解为各智能体 Q 的单调混合的值方法。
- 选项框架
- 选项=(启动集, 内部策略, 终止函数) 的时间抽象;决策过程升级为 SMDP。
- SMDP
- 半马尔可夫决策过程——以选项为节拍、时间可变的决策模型。
- 目标条件策略 / HER
- π(a|s,g) 以目标为条件 / 把轨迹终点重标为目标的经验回放。
- 奖励塑形
- 给奖励叠加辅助信号引导学习;势函数形式保证不改最优策略。
- 势函数塑形定理
- $F=\gamma\Phi(s')-\Phi(s)$ 型塑形下所有策略排序不变。
- 奖励 hacking
- 智能体拿高分但偏离设计本意;Goodhart 定律的 RL 版。
- RLHF
- 偏好标注→奖励模型→PPO 微调三步的大模型对齐流程。
- Bradley-Terry 模型
- 由成对偏好概率聚合隐含标量分数的统计模型。
- DPO
- 由偏好对直接监督优化对齐目标的闭式解,免 RM 与 PPO。
- KL 惩罚(RLHF)
- 策略与参考模型的 KL 代价,防漂移与 reward hacking。
- RLAIF / Constitutional AI
- 以 AI 按原则生成偏好替代人类标注的规模化路线。
- 约束 MDP(CMDP)
- 在奖励外定义成本函数与预算约束的安全 RL 形式化。
- 拉格朗日方法
- 约束违反的动态罚因子法(PPO-Lagrangian)。
- CPO
- 保证成本不增的约束版信赖域方法。
- 安全层(shield)
- 拦截/替换危险动作的模型无关过滤器。
- 探索安全 / 策略安全
- 训练过程每步安全 / 仅最终策略满足约束的两类安全。
- Gymnasium
- 标准 RL 环境接口(reset/step,terminated/truncated 分离)。
- 向量化环境
- 批量并行推进多个环境以喂饱 GPU 的工程手段。
- terminated / truncated
- 环境真终止 / 超时截断;目标的 bootstrap 处理不同。
- 域随机化
- 训练时随机化物理参数换取 sim-to-real 鲁棒迁移。
- 多种子评估 / IQM
- ≥5 种子重复 + 四分位间均值聚合的统计严谨评估协议。
- rliable
- 性能曲线+分层 bootstrap CI 的 RL 评估标准框架。