Skip to content

多智能体强化学习

多智能体强化学习(Multi-Agent Reinforcement Learning, MARL)研究多个智能体在同一环境中交互学习的场景——从棋牌对弈到自动驾驶车队协调,是 RL 走向复杂现实世界的必经之路。如果说单智能体 RL 解决的是”一个大脑对抗固定环境”,那么 MARL 要解决的是”多个大脑在彼此都在变化的环境中共同进化”——这正是迈向通用人工智能、多智能体社会模拟、以及大规模 LLM Agent 协作的关键技术。本页梳理合作/竞争/混合设定、Nash 均衡、IQL、VDN/QMIX 值分解、MADDPG、MAPPO、平均场方法到自对弈的完整脉络,并覆盖 2024–2026 年 MARLL 在大模型协作中的最新进展。前置阅读:强化学习概览、里程碑。

把多智能体 RL 想象成一场即兴爵士合奏,每个乐手(智能体)有自己的乐器和风格,却要在现场配合出和谐的音乐:

  • 纯合作= 四重奏乐团——所有人共享一个目标(演奏好这首曲子),需要协调谁主旋律、谁伴奏。
  • 纯竞争= 拳击比赛——我赢就是你输,零和博弈,要学会预测并反制对手。
  • **混合(既有合作又有竞争)= 足球联赛——队内合作、队间竞争,是最复杂的设定。
  • 非平稳性问题= 当多个智能体同时学习时,对每个智能体来说环境在不断变化(因为其他智能体的策略在变),传统的 RL 收敛性保证失效——这是 MARL 的核心难点。
  • Nash 均衡= 一种”谁都不想单方面改变策略”的稳定状态——就像博弈论中的囚徒困境,每个玩家的策略在给定对手策略下都是最优的。
  • 中心化训练、去中心化执行(CTDE)= 训练时允许看到所有智能体的信息(中心化),执行时每个智能体只用自己的观测做决策(去中心化)——这是当前主流 MARL 的范式。

数学基础:从 MDP 到马尔可夫博弈

Section titled “数学基础:从 MDP 到马尔可夫博弈”

单智能体强化学习建立在马尔可夫决策过程(Markov Decision Process, MDP)之上——即一个智能体与环境交互的数学框架,由状态、动作、转移、奖励四元组描述。当环境中有多个智能体同时决策时,MDD 自然推广为马尔可夫博弈(Markov Game / Stochastic Game),它是博弈论与 RL 的交汇点。

一个 N 个智能体的马尔可夫博弈可形式化为元组 ⟨𝒩, 𝒮, 𝒜₁…𝒜_N, 𝒯, r₁…r_N, γ⟩,其中:

  • 𝒩 = {1, 2, …, N}:智能体集合。
  • 𝒮:全局状态空间(所有智能体共享的环境状态)。
  • 𝒜_i:智能体 i 的动作空间。
  • 𝒯(s’ | s, a₁, …, a_N):联合状态转移函数——注意它依赖于所有智能体的联合动作,这是与单智能体 MDP 的本质区别。
  • r_i(s, a₁, …, a_N):智能体 i 的奖励函数——不同智能体的奖励可以相同(纯合作)、相反(零和竞争)或任意关系(混合博弈)。
  • γ ∈ [0, 1):折扣因子(discount factor),权衡近期与远期奖励。

每个智能体 i 的目标是最大化自己的期望折扣回报:

G_i(t) = r_i(t+1) + γ·r_i(t+2) + γ²·r_i(t+3) + … = Σₖ₌₀^∞ γᵏ · r_i(t+k+1)

由于回报取决于所有智能体的联合策略,单智能体的最优策略概念不再适用——取而代之的是博弈论中的 Nash 均衡:一组策略 π₁, …, π_N,使得没有任何智能体能通过单方面改变自己的策略来获得更高回报。形式化地,对每个智能体 i:

J_i(π_i, π{-i}) ≥ J_i(π_i, π*{-i}),∀ π_i

其中 π*_{-i} 表示除 i 以外所有智能体的联合策略,J_i 是智能体 i 的期望回报。MARL 算法的核心挑战就是在非平稳环境下逼近这种均衡。

当所有智能体同时学习时,每个智能体面临的环境是非平稳的——其他智能体的策略在不断变化,这使得 Bellman 方程(描述最优价值函数的自洽方程,是大多数 RL 算法的理论基础)的收敛假设失效。直观地说,智能体 i 刚学会针对智能体 j 的策略 π_j 做出最佳响应,但 π_j 已经变了,于是 i 之前的”最优解”不再最优——这就是所谓的移动目标问题(moving target problem)。MARL 的几乎所有主流方法(CTDE、值分解、自对弈等)都可以理解为应对这一问题的不同策略。

不同交互模式决定了奖励结构、训练方法完全不同:

典型场景架构:自动驾驶多车路口协调

Section titled “典型场景架构:自动驾驶多车路口协调”

一个具体的 MARL 落地场景:多辆自动驾驶车辆在无信号灯路口共享环境。执行时各车只用本地观测做决策(去中心化),训练阶段由中心化 Critic 统一学习(CTDE):

在纯合作设定中,所有智能体共享一个团队奖励,但每个智能体只能用自己的局部观测做决策。如果直接用团队 Q 值指导每个智能体,会出现懒惰智能体问题:个别智能体的动作对全局几乎无影响,梯度信号被稀释。值分解(Value Decomposition) 的核心思想是把全局 Q 值分解为各智能体的局部 Q 值,保证”局部最优 = 全局最优”:

  • VDN(Value-Decomposition Networks, Sunehag et al. 2018):假设联合 Q 值是各智能体局部 Q 值的简单求和:Q_tot = Σᵢ Qᵢ(τᵢ, aᵢ)。简单有效,但表达能力有限。
  • QMIX(Rashid et al. 2018):用一个带单调性约束的超网络(Hypernetwork,即生成网络权重的网络)实现非线性值分解:Q_tot = f_mix(Q₁, …, Q_N, s_global),同时保证 ∂Q_tot / ∂Qᵢ ≥ 0(局部值越大,联合值一定越大),从而保证局部 argmax 与全局 argmax 一致。这是目前合作 MARL 最广泛使用的算法之一。
  • QPLEX(Wang et al. 2020):进一步推广 QMIX,用优势函数分解实现更灵活的值分解,能表达更复杂的合作结构。

当智能体数量极大(如数百万个交易机器人、大规模交通流),为每个智能体分别建模其他所有智能体在计算上不可行。平均场方法(Mean-Field MARL, Yang & Luo et al. 2018) 借鉴统计物理的思想:每个智能体不再关注每一个其他智能体,而是将”邻近智能体的平均行为”作为近似交互对象,将 N 体交互简化为二体交互:

a_{-i} ≈ ā = (1/N) Σⱼ aⱼ(邻近智能体动作的均值)

这种方法在交通信号灯控制、大规模经济仿真、群体智能等场景中非常实用,且理论上可以证明在满足一定条件时收敛到近似 Nash 均衡。

中心化训练、去中心化执行(CTDE)

Section titled “中心化训练、去中心化执行(CTDE)”

MADDPG 等主流算法采用 CTDE 范式,训练时用全局信息解决非平稳性,执行时每个智能体独立决策:

AlphaGo、AlphaStar 等里程碑系统通过自对弈(self-play)从零学习超强策略:

经典的协调博弈(Coordination Game):两个智能体同时选择动作,收益矩阵已知,求混合策略 Nash 均衡:

import numpy as np
# 囚徒困境收益矩阵(行=玩家1,列=玩家2)
# (合作, 背叛) 两选一
R1 = np.array([[-1, -3], # 玩家1的收益
[0, -2]])
R2 = np.array([[-1, 0], # 玩家2的收益
[-3, -2]])
# 求混合策略 Nash 均衡:玩家1选动作0的概率 p 使玩家2无差异
# 玩家2选动作0的期望收益 = p*R2[0,0] + (1-p)*R2[1,0]
# 玩家2选动作1的期望收益 = p*R2[0,1] + (1-p)*R2[1,1]
p = (R2[1,1] - R2[1,0]) / (R2[0,0] - R2[0,1] - R2[1,0] + R2[1,1])
print(f"玩家1混合策略:以 {p:.2f} 概率选合作")
# 纯策略 Nash 均衡:逐个检查是否无人愿意单方面偏离
for i in range(2):
for j in range(2):
# 玩家1是否有动力偏离到另一行
dev1 = 1 - i
if R1[dev1, j] > R1[i, j]:
continue
# 玩家2是否有动力偏离到另一列
dev2 = 1 - j
if R2[i, dev2] > R2[i, j]:
continue
print(f"纯策略 Nash 均衡:玩家1选{i}, 玩家2选{j}")
# 囚徒困境的 Nash 均衡是 (背叛, 背叛)——虽非全局最优但无人愿单方面改变

下面从简单到复杂梳理 MARL 的几大算法家族,帮助读者建立完整知识地图。

1. 独立 Q 学习(IQL)——最朴素的基线

Section titled “1. 独立 Q 学习(IQL)——最朴素的基线”

独立 Q 学习(Independent Q-Learning, IQL) 是最简单的 MARL 方法:让每个智能体把其他智能体当作环境的一部分,各自独立学习自己的 Q 函数(Q-function,即状态-动作价值函数,衡量在某个状态下采取某动作的长期期望回报)。优点是实现极简,直接复用单智能体算法;缺点是在非平稳环境下 Q 值估计不稳定,且智能体越多越容易发散。但在经验上,配合 PPO/SAC 等现代算法,IQL 在某些任务中表现并不差(即所谓”independent PPO”)。

MADDPG(Multi-Agent Deep Deterministic Policy Gradient, Lowe et al. 2017) 是首个成熟的 CTDE 算法,核心思想是”训练时作弊、执行时诚实”。每个智能体 i 有一个 Actor π_i(a_i | o_i) 和一个中心化 Critic Q_i(s, a₁, …, a_N),其中 Critic 能看到全局状态和所有智能体动作:

L(θ_i) = E[ (y_i - Q_i(s, a₁,…,a_N))² ], 其中 y_i = r_i + γ · Q’_i(s’, a’₁,…,a’N) |{a’_j = π’_j(o’_j)}

由于 Critic 看到所有智能体的真实动作,即使其他智能体策略在变,Critic 也能正确评估当前联合策略下的价值,从而为 Actor 提供稳定的梯度。部署时只保留 Actor,每个智能体仅用自己的局部观测 o_i 做决策。MADDPG 是连续动作空间混合博弈的经典选择。

3. MAPPO——“简单就是好”的胜利

Section titled “3. MAPPO——“简单就是好”的胜利”

MAPPO(Multi-Agent PPO, Yu et al. 2022) 是 PPO(Proximal Policy Optimization,近端策略优化,一种策略梯度算法,通过限制每次更新的策略变化幅度来稳定训练)的多智能体版本。它用单一中心化 Critic V(s) 评估全局状态价值,每个智能体共享或各自拥有 Actor π_i(a_i | o_i),目标函数与 PPO 相同(截断的 Clipped Surrogate Objective):

L^CLIP(θ) = E_t[ min(ρ_t(θ) · Â_t, clip(ρ_t(θ), 1-ε, 1+ε) · Â_t) ], 其中 ρ_t = π_θ(a_t|s_t) / π_θ_old(a_t|s_t)

MAPPO 的重大发现在于:一个实现极其简单的算法(本质就是 PPO + 共享 Critic),在 StarCraft Multi-Agent Challenge (SMAC) 等 benchmark 上超过了复杂的 MADDPG、QMIX 等算法,揭示了 MARL 中”工程实现质量 > 算法复杂度”的重要经验。2023–2025 年间,MAPPO 已成为合作 MARL 的事实标准基线。

场景推荐算法理由
纯合作、离散动作MAPPO / QMIX简单稳定,benchmark 表现好
纯合作、连续动作MAPPO / MADDPGMAPPO 更稳,MADDPG 更灵活
混合博弈(合作+竞争)MADDPG原生支持多智能体不同奖励
纯竞争(零和、2 人)NFSP / PSRO + 自对弈博弈论方法保证收敛到均衡
大规模智能体(>100)Mean-Field MARL计算可行,近似有效
完全信息棋类AlphaZero 式自对弈 + MCTS教科书级方案
  • CTDE 是默认范式:中心化训练、去中心化执行(如 MADDPG、MAPPO)能缓解非平稳性,同时保持部署时每个智能体独立,是当前工程实践的主流选择。
  • 自对弈要控制对手池:纯自对弈容易”遗忘”(新策略针对当前版本,但输给旧版本)——OpenAI Five、AlphaStar 都用历史版本池(fictitious play)稳定训练。
  • 奖励塑造在合作 MARL 中尤其关键:仅有团队稀疏奖励时学习极难,常加入个体奖励(基于贡献度分配 credit assignment)或内在奖励鼓励探索。
  • MAPPO 比 MADDPG 更稳定:近年研究表明 PPO 的多智能体版本(MAPPO)在多数 benchmark 上比 MADDPG 更稳定且效果相当甚至更好,实现也更简单。
  • 通信学习(learned communication):智能体是否需要显式通信?合作任务中可让智能体学会发送离散/连续信号,Emergent Communication 是活跃研究方向。
  • 博弈规模决定方法:2 人零和(围棋、象棋)用自对弈 + MCTS 即可;多人复杂博弈(星际、Dota)需要大规模工程 + 课程学习 + 人口(population)训练。
  • 棋类 AI:AlphaGo、AlphaZero 通过自对弈从零掌握围棋、国际象棋、将棋,2017 年击败柯洁——MARL 自对弈范式在完全信息零和博弈中的巅峰。详见里程碑。
  • 即时战略与多人游戏:OpenAI Five(Dota 2 五对五)、AlphaStar(星际争霸 II)、Suphx(麻将)展示了 MARL 处理不完全信息、超大动作空间、长时序决策的能力。
  • 自动驾驶多车协调:多辆自动驾驶汽车在路口无信号灯通行、高速编队行驶等场景,用 MARL 学习协调策略,Waymo、Mobileye 均有研究布局。
  • 无人机集群协同:多架无人机协同搜索、编队飞行、目标围捕,MARL 让集群在没有中心调度的情况下自组织协作。
  • 多机器人仓库拣货:亚马逊、京东的智能仓库中,多台 AGV 小车用 MARL 协调路径、避免碰撞、优化拣货效率。详见分层强化学习。
  • 电力市场竞价:多个发电厂商在电力市场中通过 MARL 学习最优竞价策略,模拟寡头竞争博弈。
类库语言说明
PettingZooPython多智能体环境标准库(Gymnasium 姊妹项目),提供 Atari 多人、MPE、国际象棋等环境
RLlib (Ray)Python原生支持 MARL 的分布式训练库,实现 RNN-PPO、APPO、MADDPG 等
EPyMARLPython专注于 MARL 算法复现的研究库(基于 PyMARL),代码清晰
MAGridPython多智能体网格世界环境,适合教学与算法验证
OpenSpielC++/PythonDeepMind 开源的游戏与博弈 AI 研究框架,含棋类、扑克、博弈求解器
术语英文解释
多智能体强化学习MARL多个智能体在同一环境中交互学习的 RL 范式
Nash 均衡Nash Equilibrium每个智能体策略在给定其他智能体策略下都最优的稳定状态
中心化训练去中心化执行CTDE训练时共享全局信息、执行时各自独立决策的主流 MARL 范式
自对弈Self-Play智能体以自身(或历史版本)为对手进行训练的策略提升方法
零和博弈Zero-Sum Game一方所得等于另一方所失的纯竞争博弈
混合博弈Mixed-Motive Game既有合作元素又有竞争元素的一般和博弈
独立 Q 学习Independent Q-Learning (IQL)每个智能体独立学习、无视其他智能体的最简单 MARL 方法
信用分配Credit Assignment在合作任务中把团队奖励分配到各智能体贡献上的方法
虚构自博弈Fictitious Self-Play以对手历史策略分布的最佳响应来更新自己策略的训练方法
  • Lowe et al.,「Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments」(NeurIPS 2017):MADDPG 论文,提出 CTDE 范式,是现代 MARL 的里程碑。
  • Yu et al.,「The Surprising Effectiveness of PPO in Cooperative Multi-Agent Games」(NeurIPS 2022):MAPPO 论文,证明简单 PPO 多智能体版在多数 benchmark 上不输复杂算法。
  • Silver et al.,「Mastering the Game of Go without Human Knowledge」(Nature 2017):AlphaGo Zero/AlphaZero 论文,自对弈 + MCTS 从零掌握棋类的巅峰。
  • Vinyals et al.,「Grandmaster Level in StarCraft II Using Multi-Agent Reinforcement Learning」(Nature 2019):AlphaStar 论文,MARL 在复杂即时战略游戏的里程碑。
  • Berner et al.,「Dota 2 with Large Scale Deep Reinforcement Learning」(arXiv 2019):OpenAI Five 技术报告,大规模 MARL 工程实践典范。
  • Lanctot et al.,「A Unified Game-Theoretic Approach to Multiagent Reinforcement Learning」(NeurIPS 2017):PSRO(Policy-Space Response Oracles)论文,统一了自对弈与博弈论求解。
  • Zhang et al.,「Multi-Agent Reinforcement Learning: A Selective Overview of Theories and Algorithms」(arXiv 2019):MARL 理论综述,系统梳理数学基础与算法分类。