多智能体强化学习
多智能体强化学习(Multi-Agent Reinforcement Learning, MARL)研究多个智能体在同一环境中交互学习的场景——从棋牌对弈到自动驾驶车队协调,是 RL 走向复杂现实世界的必经之路。如果说单智能体 RL 解决的是”一个大脑对抗固定环境”,那么 MARL 要解决的是”多个大脑在彼此都在变化的环境中共同进化”——这正是迈向通用人工智能、多智能体社会模拟、以及大规模 LLM Agent 协作的关键技术。本页梳理合作/竞争/混合设定、Nash 均衡、IQL、VDN/QMIX 值分解、MADDPG、MAPPO、平均场方法到自对弈的完整脉络,并覆盖 2024–2026 年 MARLL 在大模型协作中的最新进展。前置阅读:强化学习概览、里程碑。
把多智能体 RL 想象成一场即兴爵士合奏,每个乐手(智能体)有自己的乐器和风格,却要在现场配合出和谐的音乐:
- 纯合作= 四重奏乐团——所有人共享一个目标(演奏好这首曲子),需要协调谁主旋律、谁伴奏。
- 纯竞争= 拳击比赛——我赢就是你输,零和博弈,要学会预测并反制对手。
- **混合(既有合作又有竞争)= 足球联赛——队内合作、队间竞争,是最复杂的设定。
- 非平稳性问题= 当多个智能体同时学习时,对每个智能体来说环境在不断变化(因为其他智能体的策略在变),传统的 RL 收敛性保证失效——这是 MARL 的核心难点。
- Nash 均衡= 一种”谁都不想单方面改变策略”的稳定状态——就像博弈论中的囚徒困境,每个玩家的策略在给定对手策略下都是最优的。
- 中心化训练、去中心化执行(CTDE)= 训练时允许看到所有智能体的信息(中心化),执行时每个智能体只用自己的观测做决策(去中心化)——这是当前主流 MARL 的范式。
数学基础:从 MDP 到马尔可夫博弈
Section titled “数学基础:从 MDP 到马尔可夫博弈”单智能体强化学习建立在马尔可夫决策过程(Markov Decision Process, MDP)之上——即一个智能体与环境交互的数学框架,由状态、动作、转移、奖励四元组描述。当环境中有多个智能体同时决策时,MDD 自然推广为马尔可夫博弈(Markov Game / Stochastic Game),它是博弈论与 RL 的交汇点。
一个 N 个智能体的马尔可夫博弈可形式化为元组 ⟨𝒩, 𝒮, 𝒜₁…𝒜_N, 𝒯, r₁…r_N, γ⟩,其中:
- 𝒩 = {1, 2, …, N}:智能体集合。
- 𝒮:全局状态空间(所有智能体共享的环境状态)。
- 𝒜_i:智能体 i 的动作空间。
- 𝒯(s’ | s, a₁, …, a_N):联合状态转移函数——注意它依赖于所有智能体的联合动作,这是与单智能体 MDP 的本质区别。
- r_i(s, a₁, …, a_N):智能体 i 的奖励函数——不同智能体的奖励可以相同(纯合作)、相反(零和竞争)或任意关系(混合博弈)。
- γ ∈ [0, 1):折扣因子(discount factor),权衡近期与远期奖励。
每个智能体 i 的目标是最大化自己的期望折扣回报:
G_i(t) = r_i(t+1) + γ·r_i(t+2) + γ²·r_i(t+3) + … = Σₖ₌₀^∞ γᵏ · r_i(t+k+1)
由于回报取决于所有智能体的联合策略,单智能体的最优策略概念不再适用——取而代之的是博弈论中的 Nash 均衡:一组策略 π₁, …, π_N,使得没有任何智能体能通过单方面改变自己的策略来获得更高回报。形式化地,对每个智能体 i:
J_i(π_i, π{-i}) ≥ J_i(π_i, π*{-i}),∀ π_i
其中 π*_{-i} 表示除 i 以外所有智能体的联合策略,J_i 是智能体 i 的期望回报。MARL 算法的核心挑战就是在非平稳环境下逼近这种均衡。
非平稳性与”移动目标”问题
Section titled “非平稳性与”移动目标”问题”当所有智能体同时学习时,每个智能体面临的环境是非平稳的——其他智能体的策略在不断变化,这使得 Bellman 方程(描述最优价值函数的自洽方程,是大多数 RL 算法的理论基础)的收敛假设失效。直观地说,智能体 i 刚学会针对智能体 j 的策略 π_j 做出最佳响应,但 π_j 已经变了,于是 i 之前的”最优解”不再最优——这就是所谓的移动目标问题(moving target problem)。MARL 的几乎所有主流方法(CTDE、值分解、自对弈等)都可以理解为应对这一问题的不同策略。
三种多智能体交互模式
Section titled “三种多智能体交互模式”不同交互模式决定了奖励结构、训练方法完全不同:
典型场景架构:自动驾驶多车路口协调
Section titled “典型场景架构:自动驾驶多车路口协调”一个具体的 MARL 落地场景:多辆自动驾驶车辆在无信号灯路口共享环境。执行时各车只用本地观测做决策(去中心化),训练阶段由中心化 Critic 统一学习(CTDE):
值分解:合作 MARL 的核心技巧
Section titled “值分解:合作 MARL 的核心技巧”在纯合作设定中,所有智能体共享一个团队奖励,但每个智能体只能用自己的局部观测做决策。如果直接用团队 Q 值指导每个智能体,会出现懒惰智能体问题:个别智能体的动作对全局几乎无影响,梯度信号被稀释。值分解(Value Decomposition) 的核心思想是把全局 Q 值分解为各智能体的局部 Q 值,保证”局部最优 = 全局最优”:
- VDN(Value-Decomposition Networks, Sunehag et al. 2018):假设联合 Q 值是各智能体局部 Q 值的简单求和:Q_tot = Σᵢ Qᵢ(τᵢ, aᵢ)。简单有效,但表达能力有限。
- QMIX(Rashid et al. 2018):用一个带单调性约束的超网络(Hypernetwork,即生成网络权重的网络)实现非线性值分解:Q_tot = f_mix(Q₁, …, Q_N, s_global),同时保证 ∂Q_tot / ∂Qᵢ ≥ 0(局部值越大,联合值一定越大),从而保证局部 argmax 与全局 argmax 一致。这是目前合作 MARL 最广泛使用的算法之一。
- QPLEX(Wang et al. 2020):进一步推广 QMIX,用优势函数分解实现更灵活的值分解,能表达更复杂的合作结构。
平均场 MARL(Mean-Field MARL)
Section titled “平均场 MARL(Mean-Field MARL)”当智能体数量极大(如数百万个交易机器人、大规模交通流),为每个智能体分别建模其他所有智能体在计算上不可行。平均场方法(Mean-Field MARL, Yang & Luo et al. 2018) 借鉴统计物理的思想:每个智能体不再关注每一个其他智能体,而是将”邻近智能体的平均行为”作为近似交互对象,将 N 体交互简化为二体交互:
a_{-i} ≈ ā = (1/N) Σⱼ aⱼ(邻近智能体动作的均值)
这种方法在交通信号灯控制、大规模经济仿真、群体智能等场景中非常实用,且理论上可以证明在满足一定条件时收敛到近似 Nash 均衡。
中心化训练、去中心化执行(CTDE)
Section titled “中心化训练、去中心化执行(CTDE)”MADDPG 等主流算法采用 CTDE 范式,训练时用全局信息解决非平稳性,执行时每个智能体独立决策:
自对弈学习循环
Section titled “自对弈学习循环”AlphaGo、AlphaStar 等里程碑系统通过自对弈(self-play)从零学习超强策略:
numpy 求解博弈矩阵的 Nash 均衡
Section titled “numpy 求解博弈矩阵的 Nash 均衡”经典的协调博弈(Coordination Game):两个智能体同时选择动作,收益矩阵已知,求混合策略 Nash 均衡:
import numpy as np
# 囚徒困境收益矩阵(行=玩家1,列=玩家2)# (合作, 背叛) 两选一R1 = np.array([[-1, -3], # 玩家1的收益 [0, -2]])R2 = np.array([[-1, 0], # 玩家2的收益 [-3, -2]])
# 求混合策略 Nash 均衡:玩家1选动作0的概率 p 使玩家2无差异# 玩家2选动作0的期望收益 = p*R2[0,0] + (1-p)*R2[1,0]# 玩家2选动作1的期望收益 = p*R2[0,1] + (1-p)*R2[1,1]p = (R2[1,1] - R2[1,0]) / (R2[0,0] - R2[0,1] - R2[1,0] + R2[1,1])print(f"玩家1混合策略:以 {p:.2f} 概率选合作")
# 纯策略 Nash 均衡:逐个检查是否无人愿意单方面偏离for i in range(2): for j in range(2): # 玩家1是否有动力偏离到另一行 dev1 = 1 - i if R1[dev1, j] > R1[i, j]: continue # 玩家2是否有动力偏离到另一列 dev2 = 1 - j if R2[i, dev2] > R2[i, j]: continue print(f"纯策略 Nash 均衡:玩家1选{i}, 玩家2选{j}")# 囚徒困境的 Nash 均衡是 (背叛, 背叛)——虽非全局最优但无人愿单方面改变主流算法详解
Section titled “主流算法详解”下面从简单到复杂梳理 MARL 的几大算法家族,帮助读者建立完整知识地图。
1. 独立 Q 学习(IQL)——最朴素的基线
Section titled “1. 独立 Q 学习(IQL)——最朴素的基线”独立 Q 学习(Independent Q-Learning, IQL) 是最简单的 MARL 方法:让每个智能体把其他智能体当作环境的一部分,各自独立学习自己的 Q 函数(Q-function,即状态-动作价值函数,衡量在某个状态下采取某动作的长期期望回报)。优点是实现极简,直接复用单智能体算法;缺点是在非平稳环境下 Q 值估计不稳定,且智能体越多越容易发散。但在经验上,配合 PPO/SAC 等现代算法,IQL 在某些任务中表现并不差(即所谓”independent PPO”)。
2. MADDPG——CTDE 范式的开创者
Section titled “2. MADDPG——CTDE 范式的开创者”MADDPG(Multi-Agent Deep Deterministic Policy Gradient, Lowe et al. 2017) 是首个成熟的 CTDE 算法,核心思想是”训练时作弊、执行时诚实”。每个智能体 i 有一个 Actor π_i(a_i | o_i) 和一个中心化 Critic Q_i(s, a₁, …, a_N),其中 Critic 能看到全局状态和所有智能体动作:
L(θ_i) = E[ (y_i - Q_i(s, a₁,…,a_N))² ], 其中 y_i = r_i + γ · Q’_i(s’, a’₁,…,a’N) |{a’_j = π’_j(o’_j)}
由于 Critic 看到所有智能体的真实动作,即使其他智能体策略在变,Critic 也能正确评估当前联合策略下的价值,从而为 Actor 提供稳定的梯度。部署时只保留 Actor,每个智能体仅用自己的局部观测 o_i 做决策。MADDPG 是连续动作空间混合博弈的经典选择。
3. MAPPO——“简单就是好”的胜利
Section titled “3. MAPPO——“简单就是好”的胜利”MAPPO(Multi-Agent PPO, Yu et al. 2022) 是 PPO(Proximal Policy Optimization,近端策略优化,一种策略梯度算法,通过限制每次更新的策略变化幅度来稳定训练)的多智能体版本。它用单一中心化 Critic V(s) 评估全局状态价值,每个智能体共享或各自拥有 Actor π_i(a_i | o_i),目标函数与 PPO 相同(截断的 Clipped Surrogate Objective):
L^CLIP(θ) = E_t[ min(ρ_t(θ) · Â_t, clip(ρ_t(θ), 1-ε, 1+ε) · Â_t) ], 其中 ρ_t = π_θ(a_t|s_t) / π_θ_old(a_t|s_t)
MAPPO 的重大发现在于:一个实现极其简单的算法(本质就是 PPO + 共享 Critic),在 StarCraft Multi-Agent Challenge (SMAC) 等 benchmark 上超过了复杂的 MADDPG、QMIX 等算法,揭示了 MARL 中”工程实现质量 > 算法复杂度”的重要经验。2023–2025 年间,MAPPO 已成为合作 MARL 的事实标准基线。
4. 算法选择速查
Section titled “4. 算法选择速查”| 场景 | 推荐算法 | 理由 |
|---|---|---|
| 纯合作、离散动作 | MAPPO / QMIX | 简单稳定,benchmark 表现好 |
| 纯合作、连续动作 | MAPPO / MADDPG | MAPPO 更稳,MADDPG 更灵活 |
| 混合博弈(合作+竞争) | MADDPG | 原生支持多智能体不同奖励 |
| 纯竞争(零和、2 人) | NFSP / PSRO + 自对弈 | 博弈论方法保证收敛到均衡 |
| 大规模智能体(>100) | Mean-Field MARL | 计算可行,近似有效 |
| 完全信息棋类 | AlphaZero 式自对弈 + MCTS | 教科书级方案 |
- CTDE 是默认范式:中心化训练、去中心化执行(如 MADDPG、MAPPO)能缓解非平稳性,同时保持部署时每个智能体独立,是当前工程实践的主流选择。
- 自对弈要控制对手池:纯自对弈容易”遗忘”(新策略针对当前版本,但输给旧版本)——OpenAI Five、AlphaStar 都用历史版本池(fictitious play)稳定训练。
- 奖励塑造在合作 MARL 中尤其关键:仅有团队稀疏奖励时学习极难,常加入个体奖励(基于贡献度分配 credit assignment)或内在奖励鼓励探索。
- MAPPO 比 MADDPG 更稳定:近年研究表明 PPO 的多智能体版本(MAPPO)在多数 benchmark 上比 MADDPG 更稳定且效果相当甚至更好,实现也更简单。
- 通信学习(learned communication):智能体是否需要显式通信?合作任务中可让智能体学会发送离散/连续信号,Emergent Communication 是活跃研究方向。
- 博弈规模决定方法:2 人零和(围棋、象棋)用自对弈 + MCTS 即可;多人复杂博弈(星际、Dota)需要大规模工程 + 课程学习 + 人口(population)训练。
- 棋类 AI:AlphaGo、AlphaZero 通过自对弈从零掌握围棋、国际象棋、将棋,2017 年击败柯洁——MARL 自对弈范式在完全信息零和博弈中的巅峰。详见里程碑。
- 即时战略与多人游戏:OpenAI Five(Dota 2 五对五)、AlphaStar(星际争霸 II)、Suphx(麻将)展示了 MARL 处理不完全信息、超大动作空间、长时序决策的能力。
- 自动驾驶多车协调:多辆自动驾驶汽车在路口无信号灯通行、高速编队行驶等场景,用 MARL 学习协调策略,Waymo、Mobileye 均有研究布局。
- 无人机集群协同:多架无人机协同搜索、编队飞行、目标围捕,MARL 让集群在没有中心调度的情况下自组织协作。
- 多机器人仓库拣货:亚马逊、京东的智能仓库中,多台 AGV 小车用 MARL 协调路径、避免碰撞、优化拣货效率。详见分层强化学习。
- 电力市场竞价:多个发电厂商在电力市场中通过 MARL 学习最优竞价策略,模拟寡头竞争博弈。
典型类库与工具
Section titled “典型类库与工具”| 类库 | 语言 | 说明 |
|---|---|---|
| PettingZoo | Python | 多智能体环境标准库(Gymnasium 姊妹项目),提供 Atari 多人、MPE、国际象棋等环境 |
| RLlib (Ray) | Python | 原生支持 MARL 的分布式训练库,实现 RNN-PPO、APPO、MADDPG 等 |
| EPyMARL | Python | 专注于 MARL 算法复现的研究库(基于 PyMARL),代码清晰 |
| MAGrid | Python | 多智能体网格世界环境,适合教学与算法验证 |
| OpenSpiel | C++/Python | DeepMind 开源的游戏与博弈 AI 研究框架,含棋类、扑克、博弈求解器 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 多智能体强化学习 | MARL | 多个智能体在同一环境中交互学习的 RL 范式 |
| Nash 均衡 | Nash Equilibrium | 每个智能体策略在给定其他智能体策略下都最优的稳定状态 |
| 中心化训练去中心化执行 | CTDE | 训练时共享全局信息、执行时各自独立决策的主流 MARL 范式 |
| 自对弈 | Self-Play | 智能体以自身(或历史版本)为对手进行训练的策略提升方法 |
| 零和博弈 | Zero-Sum Game | 一方所得等于另一方所失的纯竞争博弈 |
| 混合博弈 | Mixed-Motive Game | 既有合作元素又有竞争元素的一般和博弈 |
| 独立 Q 学习 | Independent Q-Learning (IQL) | 每个智能体独立学习、无视其他智能体的最简单 MARL 方法 |
| 信用分配 | Credit Assignment | 在合作任务中把团队奖励分配到各智能体贡献上的方法 |
| 虚构自博弈 | Fictitious Self-Play | 以对手历史策略分布的最佳响应来更新自己策略的训练方法 |
- Lowe et al.,「Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments」(NeurIPS 2017):MADDPG 论文,提出 CTDE 范式,是现代 MARL 的里程碑。
- Yu et al.,「The Surprising Effectiveness of PPO in Cooperative Multi-Agent Games」(NeurIPS 2022):MAPPO 论文,证明简单 PPO 多智能体版在多数 benchmark 上不输复杂算法。
- Silver et al.,「Mastering the Game of Go without Human Knowledge」(Nature 2017):AlphaGo Zero/AlphaZero 论文,自对弈 + MCTS 从零掌握棋类的巅峰。
- Vinyals et al.,「Grandmaster Level in StarCraft II Using Multi-Agent Reinforcement Learning」(Nature 2019):AlphaStar 论文,MARL 在复杂即时战略游戏的里程碑。
- Berner et al.,「Dota 2 with Large Scale Deep Reinforcement Learning」(arXiv 2019):OpenAI Five 技术报告,大规模 MARL 工程实践典范。
- Lanctot et al.,「A Unified Game-Theoretic Approach to Multiagent Reinforcement Learning」(NeurIPS 2017):PSRO(Policy-Space Response Oracles)论文,统一了自对弈与博弈论求解。
- Zhang et al.,「Multi-Agent Reinforcement Learning: A Selective Overview of Theories and Algorithms」(arXiv 2019):MARL 理论综述,系统梳理数学基础与算法分类。