多智能体强化学习:从单智能体到群体博弈
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Zhang et al. 2021 MARL 综述与各算法原论文复核。
一句话定义
多智能体 RL(MARL)研究多个学习智能体共存于同一环境的问题:从单个智能体视角看,其他智能体是"会学习的环境"——环境动力学非平稳,传统 MDP 框架失效;主流解法按"集中训练分散执行(CTDE)"组织,博弈论(纳什均衡、零和与一般和)提供理论坐标。
为什么重要
真实世界几乎全是多智能体问题:交通、机器人协作、经济与推荐系统、游戏对战(OpenAI Five 的 5 个英雄、星际的多单位控制)。MARL 引入的新困难(非平稳、信用分配到个体、对手建模)与 RLHF 里的对齐博弈(模型与人、模型与模型)共享同一套数学。
前置知识
kp-002(MDP)、kp-013(策略梯度);博弈论零基础也能读,纳什均衡概念本条自带。
核心概念
- 马尔可夫博弈(随机博弈):MDP 的多智能体推广——转移与奖励取决于联合动作 $(a_1,\dots,a_n)$;每个智能体有自己的奖励(合作/竞争/混合)。
- 非平稳性:其他智能体在变 → 单智能体视角的 $P(s'|s,a)$ 在变 → TD 目标失准、收敛理论全部失效(这比 kp-012 的三角更根本)。
- CTDE(集中训练分散执行):训练时可用全局信息(中央 critic 输入联合状态/动作),执行时每个智能体只用自己的局部观测与策略——破解"观测不全+通信昂贵"的现实约束,是现代 MARL 的事实范式。
- 信用分配到个体:团队共享一个奖励时,"谁的功劳"比单智能体的延迟信用分配更难(COMA 用反事实基线:把某智能体动作换成默认动作看差值)。
- 理论坐标:合作(团队奖励)、零和(围棋,纳什=极小极大)、一般和(社会困境,如囚徒困境)——各自对应不同算法族(QMIX 值分解/MADDPG 中央 critic/自博弈与联盟训练)。
原理与机制
为什么非平稳会破坏训练:Q-Learning/策略梯度都假设数据来自固定分布;对手学习使分布漂移,估值与策略互相追赶——可能出现"追逐循环"而非收敛。工程对策:① 慢速更新/对手池(对固定的历史对手池学习,制造伪平稳);② 自博弈+联赛(AlphaZero 式,kp-021);③ 显式对手建模。
CTDE 为什么是甜点:完全独立学习(每个体当环境静止)在合作任务上信用分配失败;完全集中(联合策略)的动作空间指数爆炸且执行时需全局通信。CTDE 用"训练时作弊(上帝视角)+ 执行时独立"取折中:中央 critic $Q(s, a_1,\dots,a_n)$ 把团队信用分摊到个体,参数共享进一步压缩策略空间。
值分解(QMIX)的直觉:合作任务中把联合 $Q_{tot}$ 分解为各智能体 $Q_i$ 的单调混合(超网络生成权重,保证 argmax 一致性——"个体最优=整体最优"可执行);单调性是表达力与可分解性的折衷。
图示
CTDE:
训练: 中央Critic Q(全局s, a₁…aₙ) → 信用分配给各 actor
执行: 每个 agent 只用局部观测 oᵢ → πᵢ(aᵢ|oᵢ) 独立行动
非平稳: 对手在学 → P(s'|s,a) 漂移 → 单体 TD 目标失准
实例或案例
- OpenAI Five:5 个英雄各自策略 + 团队意识(共享奖励与超参),大规模 PPO 自博弈击败冠军队(kp-017/032)。
- 星际争霸 II(AlphaStar):多单位=多智能体,联赛训练处理策略多样性。
- 自动驾驶汇流/无信号路口:MARL 协调类典型试验场。
常见误区
- 误区一:"把每个智能体独立跑单智能体算法就行"。合作场景下"别人的适应"成为环境噪声,信用分配失真;至少要 CTDE 级别的结构。
- 误区二:"MARL 一定收敛到纳什均衡"。一般和博弈的梯度动力学可循环不收敛;均衡只是渐近理想,工程上更关心"不崩且持续改进"。
- 误区三:"参数共享就是多智能体"。共享参数只是实现技巧,核心难点(非平稳、信用分配、对手建模)一个都没少。
与其他知识点的关系
- kp-002:马尔可夫博弈是 MDP 的联合动作推广。
- kp-017:OpenAI Five/AlphaStar 的大规模策略梯度底座。
- kp-021:自博弈与联赛是 MARL 对手多样性的主解法。
- kp-033:多智能体安全性(对手可能恶意)是安全 RL 的延伸。
自测题
- 为什么单智能体视角下多智能体环境"非平稳"?后果?
答:其他智能体持续学习改变联合动力学,$P(s'|s,a)$ 漂移;TD 目标与收敛理论失效,需对手池/慢更新/自博弈联赛制造伪平稳。
- CTDE 是什么、解决什么矛盾?
答:集中训练(中央 critic 用全局信息做信用分配)+ 分散执行(局部观测独立决策);破解"信用分配需要全局信息 vs 执行无法全局通信"的矛盾。
- QMIX 的单调混合约束保证了什么?
答:联合 Q 对各智能体 Q 的单调性 ⇒ argmax 可分解——"每个体选自己的贪心动作即联合贪心",执行端无需联合推理。
延伸阅读
- Zhang 等, "Multi-Agent Reinforcement Learning: A Selective Overview of Theories and Algorithms"(2021)。
- Rashid 等, "QMIX: Monotonic Value Function Factorisation"(ICML 2018)。
- Lowe 等, "Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments"(NeurIPS 2017,MADDPG)。