术语表 (95 条)

强化学习(RL)
智能体通过与环境交互试错、最大化累积奖励的学习范式。
智能体-环境循环
状态→动作→奖励→新状态的持续交互闭环。
奖励假设
一切目标可表述为最大化期望累积奖励的公理。
MDP
马尔可夫决策过程,$(\mathcal{S},\mathcal{A},P,R,\gamma)$ 五元组形式的序贯决策框架。
马尔可夫性
未来只依赖当前状态与动作、与更早历史无关的性质。
POMDP
部分可观测 MDP——状态不可直接观测,需用历史/记忆近似。
策略 π
状态到动作的行为规则(确定性或随机分布)。
回报 $G_t$
从 t 起的折扣奖励和 $R_{t+1}+\gamma R_{t+2}+\dots$。
折扣因子 γ
未来奖励的折算系数;决定有效视野 1/(1−γ)。
状态价值 $v^\pi(s)$
从 s 出发按 π 行动的期望回报。
动作价值 $q^\pi(s,a)$
在 s 执行 a 后按 π 行动的期望回报。
优势函数
$A(s,a)=q(s,a)-v(s)$——动作相对平均水平的改进量。
贝尔曼方程
价值=即时奖励+折后后继价值的递归定义,RL 一切算法的源头。
贝尔曼最优方程
内嵌 max 的价值递归,压缩映射保证唯一解。
动态规划(DP)
转移核已知时在表格上解贝尔曼方程的方法族。
策略迭代 / 值迭代
评估-改进交替 / max 备份直奔最优的两种 DP 方案。
广义策略迭代(GPI)
任何"评估与改进互相咬合"的过程统称。
策略改进定理
贪心于 $v^\pi$ 的新策略逐状态不劣。
探索-利用困境
利用已知最优与探索未知信息的两难。
ε-greedy
以概率 ε 随机探索、1−ε 贪心利用的基线探索策略。
UCB
置信上界选择——估值高或尝试少的动作优先。
乐观初始化
把初始价值设得高于真实值以驱动自动探索。
熵正则
奖励策略保持随机性以防过早坍缩的探索机制。
蒙特卡洛(MC)
用完整回合的实际回报估计价值——无偏高方差。
时序差分(TD)
用"即时奖励+折后价值估计"自举更新——有偏低方差。
TD 误差
$\delta = r+\gamma V(s')-V(s)$,一步 surprised 信号。
SARSA
on-policy TD 控制,目标用行为策略实际会选的下一动作。
Q-Learning
off-policy TD 控制,目标取下一状态动作价值 max,学 $q^*$。
自举(bootstrapping)
用当前估计值作为更新目标的一部分。
on-policy / off-policy
评估"产生数据的策略本身" / 用别的策略数据学目标策略。
重要性采样(IS)
用似然比 $\pi/\mu$ 校正行为分布与目标分布差异。
经验回放
历史转移存池随机抽样训练——打散相关性、复用样本。
目标网络
参数慢速移动的副本,冻结 TD 目标端以稳定训练。
DQN
深度 Q 网络——CNN+Q-Learning+回放+目标网络,Atari 元年算法。
Double DQN
解耦动作选择与价值评估以缓解 max 高估。
Dueling
网络分头输出 V 与优势再合成 Q 的架构。
优先经验回放(PER)
按 TD 误差分配抽样概率,配 IS 权重修正。
致命三角
函数逼近×自举×离策略同时出现时价值学习可发散。
Baird 反例
最小化构造的半梯度 TD 发散案例。
策略梯度定理
$\nabla J=\mathbb{E}[\nabla\log\pi(a|s)G_t]$——回报加权的对数似然上升。
REINFORCE
蒙特卡洛策略梯度,无偏高方差。
log-derivative 技巧
$\nabla\pi=\pi\nabla\log\pi$,把采样期望的梯度化成可微形式。
基线
策略梯度权重中减去的只依赖状态的量——不改期望只降方差。
GAE
广义优势估计,TD 误差的 λ 指数加权递归;λ 平衡偏差与方差。
Actor-Critic
策略头(actor)+ 价值头(critic)分工的架构。
A2C / A3C
同步 / 异步多线程的优势 Actor-Critic。
TRPO
KL 约束下最大化替代优势目标的信赖域方法。
替代目标(surrogate)
用旧数据经 IS 校正估计新策略表现的目标。
自然梯度
以 Fisher 度量(分布距离)而非参数欧氏距离的最速下降。
PPO
把信赖域换成一阶 clip 的替代目标——工业标准策略优化。
clip
把概率比率夹在 1±ε 区间,对有利越界不奖励的软步长约束。
DPG / DDPG
确定性策略梯度及其深度实现——连续控制四件套。
TD3
DDPG 三针——双 Q 取 min、目标策略平滑、延迟 actor 更新。
SAC
最大熵 off-policy Actor-Critic——soft 回报、随机策略、自动温度。
最大熵 RL
在回报之外最大化策略熵的目标设定。
重参数化技巧
把随机性移出参数(a=μ+σ⊙ε)使采样可微。
软更新
$\theta'\leftarrow\tau\theta+(1-\tau)\theta'$ 的目标网络平滑同步。
基于模型的 RL
学习环境动力学并用其规划/生成想象经验的方法族。
Dyna
真实经验与模型想象经验混合训练的经典框架。
MCTS
蒙特卡洛树搜索——选择/扩展/评估/回传四步构建决策树。
UCT / PUCT
树上 UCB 探索公式 / AlphaGo 版(带策略先验 P)。
AlphaGo / AlphaZero / MuZero
人类棋谱+MCTS / 纯自博弈+搜索 / 学习模型的通用搜索方案。
自我对弈
智能体与自身副本对弈生成训练数据的机制。
世界模型 / Dreamer
潜空间学动力学、在想象轨迹上以可微梯度训练策略的范式。
RSSM
编码器+序列模型+解码头的潜空间世界模型架构。
离线(批量)RL
仅用固定历史数据集学策略,不与环境交互。
分布偏移 / 外推误差
目标策略访问数据外动作导致估值虚高的核心障碍。
CQL / IQL
保守 Q 学习(压数据外动作 Q)/ 隐式 Q 学习(expectile 不查数据外动作)。
D4RL
离线 RL 标准基准集。
马尔可夫博弈
多智能体下转移与奖励取决于联合动作的 MDP 推广。
非平稳性(MARL)
其他智能体在学导致单智能体视角动力学漂移。
CTDE
集中训练(中央 critic 全局信息)分散执行(局部观测独立决策)范式。
QMIX
联合 Q 分解为各智能体 Q 的单调混合的值方法。
选项框架
选项=(启动集, 内部策略, 终止函数) 的时间抽象;决策过程升级为 SMDP。
SMDP
半马尔可夫决策过程——以选项为节拍、时间可变的决策模型。
目标条件策略 / HER
π(a|s,g) 以目标为条件 / 把轨迹终点重标为目标的经验回放。
奖励塑形
给奖励叠加辅助信号引导学习;势函数形式保证不改最优策略。
势函数塑形定理
$F=\gamma\Phi(s')-\Phi(s)$ 型塑形下所有策略排序不变。
奖励 hacking
智能体拿高分但偏离设计本意;Goodhart 定律的 RL 版。
RLHF
偏好标注→奖励模型→PPO 微调三步的大模型对齐流程。
Bradley-Terry 模型
由成对偏好概率聚合隐含标量分数的统计模型。
DPO
由偏好对直接监督优化对齐目标的闭式解,免 RM 与 PPO。
KL 惩罚(RLHF)
策略与参考模型的 KL 代价,防漂移与 reward hacking。
RLAIF / Constitutional AI
以 AI 按原则生成偏好替代人类标注的规模化路线。
约束 MDP(CMDP)
在奖励外定义成本函数与预算约束的安全 RL 形式化。
拉格朗日方法
约束违反的动态罚因子法(PPO-Lagrangian)。
CPO
保证成本不增的约束版信赖域方法。
安全层(shield)
拦截/替换危险动作的模型无关过滤器。
探索安全 / 策略安全
训练过程每步安全 / 仅最终策略满足约束的两类安全。
Gymnasium
标准 RL 环境接口(reset/step,terminated/truncated 分离)。
向量化环境
批量并行推进多个环境以喂饱 GPU 的工程手段。
terminated / truncated
环境真终止 / 超时截断;目标的 bootstrap 处理不同。
域随机化
训练时随机化物理参数换取 sim-to-real 鲁棒迁移。
多种子评估 / IQM
≥5 种子重复 + 四分位间均值聚合的统计严谨评估协议。
rliable
性能曲线+分层 bootstrap CI 的 RL 评估标准框架。