评估方法学:多种子、性能曲线与统计严谨
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Agarwal et al. 2021(rliable)与 Henderson et al. 2018 复核。
一句话定义
深度 RL 的训练轨迹方差极大(同一配置不同种子可差出数倍),单种子结论一半是运气:严肃评估需要多种子重复(≥5–10 个)、正确的聚合统计(中位数/IQM 而非均值——对离群种子鲁棒)、性能曲线+分层 bootstrap 置信区间、以及固定的评估协议(独立评估环境、贪心策略、固定步数预算)。
为什么重要
RL 论文的可复现性危机有据可查:不同实现的"同一算法"性能差异可以超过算法间差异(Henderson 2018)。不掌握评估方法学,就无法判断"我的改进是真的还是抽签抽的"——这也是读任何 RL 论文实验部分的第一道过滤器。
前置知识
kp-028(评估环境与训练隔离)、基本统计(分位数、bootstrap)。
核心概念
- 训练种子 vs 评估种子:训练种子控制"学出哪条轨迹",评估种子控制"在哪些环境实例上考";两者独立变化才公平。
- 性能曲线(sample efficiency curve):x=环境交互步数,y=评估回报;RL 的核心对比维度是"学到同等水平要多少交互"——只报最终性能不看曲线会掩盖学习速度差异。
- 聚合统计的选择:跨种子聚合用中位数或 IQM(四分位间均值,interquartile mean)——均值被"崩掉的种子"或"神种子"支配;rliable 框架(Agarwal 2021)把这些标准化为性能分层图(performance profile)、IQM 曲线与概率改进图。
- 分层 bootstrap 置信区间:对"种子×任务"双层结构重采样,给出聚合量的 CI;两算法的 CI 不重叠才算有证据的差异。
- 评估协议要素:评估频率(固定步数间隔)、策略形态(贪心/确定性与训练探索分离,kp-028)、episode 数(≥10–100 抑制环境随机)、固定交互预算(公平比较样本效率)。
原理与机制
为什么 RL 方差如此大:三重放大——环境随机性 × 策略自指(数据分布随策略变)× 致命三角的训练混沌(kp-012 的临界动力学:有的种子滑向发散、有的被拉回)。这使"训练轨迹"本身就是重尾分布:均值统计对离群种子极不稳健。
为什么中位数/IQM 优于均值:假设 10 个种子里 7 个正常、2 个崩、1 个特别好——均值被两侧离群拉扯;中位数只看中间趋势,IQM(丢掉前后 25% 后的均值)兼顾稳健与信息量。rliable 的实证:均值 CI 在 10 种子以下几乎不可用,IQM 需 ~5–10 种子达到可用精度。
人类基准与归一化:跨任务比较需要把各任务分数归一(如以随机策略=0、人类专家=100%),再做跨任务聚合(rliable 的标准流程)——直接比较原始分数会在不同任务量纲间瞎算。
图示
实验: 每配置 ≥5 训练种子 → 每隔固定步数 → 独立评估环境 ×贪心策略 ×N ep
聚合: 跨种子取 IQM/中位数 → 分层 bootstrap CI → 性能曲线
结论: 两法 CI 不重叠 → 才可声称差异; 否则 = 未分胜负
直观类比
评价两位学生的真实水平:只让他们各考一次(单种子)→ 分数差可能只是状态好坏;正确做法是各考十次(多种子),取中位数并报告波动范围(CI),且考题难度要固定(固定预算与协议)。RL 的"考试"方差比人类考试大得多——一次定输赢纯属抽奖。
实例或案例
- Henderson 2018 的著名结果:不同实现的 DDPG/TRPO/PPO/A2C 之间,"同一算法不同实现"的差异 ≥"不同算法"的差异——评估不严谨时算法比较无意义。
- rliable 的使用:论文级 RL 实验的默认图组(aggregate with IQM + performance profiles + sample efficiency curves),已被 NeurIPS/ICML 社区广泛采纳。
常见误区
- 误区一:"3 个种子够了"。3 种子的 IQM CI 宽到覆盖大多数算法差异;严肃对比建议 5–10 个,且报告 CI 而非只报均值。
- 误区二:"选最好种子展示曲线"。这是选择性报告(cherry-picking);应展示全部种子(含失败的)或至少报告中位数带状图。
- 误区三:"训练曲线上取样点当评估值"。训练回报含探索噪声且非独立采样;必须用独立的评估环境与贪心策略。
与其他知识点的关系
自测题
- 为什么跨种子聚合用 IQM/中位数而不是均值?
答:RL 种子结果重尾(崩溃种子与神种子并存),均值被离群支配;IQM(去头尾 25% 后均值)与中位数对离群稳健,小样本下 CI 可用。
- 一份合格的 RL 实验报告应包含哪些要素?
答:≥5 种子、性能曲线(x=交互步数)、IQM/中位数 + 分层 bootstrap CI、固定评估协议(独立环境、贪心、固定预算)、跨任务归一化。
- "两算法均值差 5% 但 CI 重叠"能下什么结论?
答:在当前实验量下无法区分——应视为未分胜负,增加种子或任务再判;声称改进是统计不严谨。
延伸阅读
- Agarwal 等, "Deep Reinforcement Learning at the Edge of the Statistical Precipice"(NeurIPS 2021,rliable)。
- Henderson 等, "Deep Reinforcement Learning that Matters"(AAAI 2018)。
- rliable 开源库文档(一小时内即可上手)。