Skip to content

高级强化学习

本页介绍强化学习的前沿方向——离线 RL、多智能体 RL,以及驱动大模型推理突破的 RLVR / GRPO:前者从历史数据(而非自己试错)中学习,后者让多个智能体在同环境中博弈或协作,最后一个则是 DeepSeek-R1 等新一代推理模型的训练核心。它们是强化学习概览和RLHF 与 LLM 训练的进阶延伸。

  • 离线 RL = 从别人的录像学,不用自己下场试错。传统在线 RL(如 DQN,即用神经网络逼近动作价值函数 Q(s,a) 的深度强化学习算法)需要智能体自己与真实环境交互 millions 次来探索——这在现实中代价极高甚至危险(自动驾驶撞了怎么办?医疗方案错了谁负责?)。离线 RL 的思路:用别人(专家或旧策略)已经积累的海量交互数据(录像 / 日志)来训练策略,学完直接用,不在真实环境里冒险。像学生看名师讲课录像自学,不必每道题都自己去试。
  • 多智能体 RL = 多个 AI 互相博弈或协作。现实世界很少只有一个智能体——无人车队要协同避堵、游戏里多角色配合、多个推荐位互相抢流量。多智能体 RL 让每个智能体不仅要学”怎么跟环境互动”,还要学”怎么跟其他智能体互动”——合作(共赢)或竞争(博弈)。像下棋(对抗)与足球(团队协作),是单智能体 RL 处理不了的新维度。
  • RLVR / GRPO = 大模型推理的新引擎。RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)指奖励信号可以客观判定对错(如数学题答案唯一可判对错),而非依赖人类偏好打分。DeepSeek-R1 用 RLVR 做强化学习,配合 GRPO(Group Relative Policy Optimization,组内相对策略优化——一种无需 critic 网络的策略梯度算法)让模型自主发展出长链推理能力——这是不依赖人类示范的纯 RL 推理突破。

离线 RL 的 Bellman 目标与分布偏移

Section titled “离线 RL 的 Bellman 目标与分布偏移”

强化学习的终极目标是学习一个最优动作价值函数 Q*(s, a),它表示在状态 s 下执行动作 a 后,遵循最优策略能获得的期望累计折扣回报:

Q∗(s,a)=E[∑tγt⋅rt  |  s0=s,  a0=a,  π∗]Q^*(s, a) = \mathbb{E} \left[ \sum_t \gamma^t \cdot r_t \;\middle|\; s_0 = s, \; a_0 = a, \; \pi^* \right]

其中 γ ∈ (0, 1) 是折扣因子(控制对未来奖励的重视程度,越接近 1 越重视长远),r_t 是时刻 t 的即时奖励。Bellman 最优算子将 Q* 分解为递归形式:

Q∗(s,a)=Es′∼P(⋅∣s,a)[r+γ⋅max⁡a′Q∗(s′,a′)]Q^*(s, a) = \mathbb{E}_{s' \sim P(\cdot|s,a)} \left[ r + \gamma \cdot \max_{a'} Q^*(s', a') \right]

在线 RL 中,智能体通过不断与环境交互来采集 (s, a, r, s') 转移样本,用时序差分(Temporal Difference, TD)更新逼近 Q*。离线 RL 的困境在于:数据集 D 由行为策略 π_β 产生,数据只覆盖 π_β 走过的轨迹,但学出的目标策略 π 可能把智能体带到数据集从未见过的 (s, a) 区域。此时 max_{a'} Q*(s', a') 的估计会基于神经网络的外推——而外推通常是不可靠的,这种系统性误差被称为分布偏移(distributional shift)或外推误差(extrapolation error)。

Conservative Q-Learning(CQL)的核心思路:在标准 Bellman 误差之外,额外惩罚数据集中未出现过的 (s,a) 的 Q 值,迫使模型对分布外动作做悲观估计,从而抑制外推误差。其优化目标可简化为:

min⁡Q  α⋅[Es∼D, a∼π(⋅∣s)Q(s,a)−E(s,a)∼DQ(s,a)]+12⋅E(s,a,r,s′)∼D[Q(s,a)−(r+γ⋅max⁡a′Q(s′,a′))]2\min_Q \; \alpha \cdot \left[ \mathbb{E}_{s \sim \mathcal{D}, \, a \sim \pi(\cdot|s)} Q(s,a) - \mathbb{E}_{(s,a) \sim \mathcal{D}} Q(s,a) \right] + \frac{1}{2} \cdot \mathbb{E}_{(s,a,r,s') \sim \mathcal{D}} \left[ Q(s,a) - \left(r + \gamma \cdot \max_{a'} Q(s',a')\right) \right]^2

第一项是”保守正则项”——它拉开”数据集内动作的 Q 值”与”策略偏好的动作 Q 值”之间的差距,让 OOD(out-of-distribution,分布外)动作的 Q 值被压低,从而在 argmax 选动作时自动避开它们。α 是保守强度超参数。

IQL:另一种思路——隐式 Q 学习

Section titled “IQL:另一种思路——隐式 Q 学习”

IQL(Implicit Q-Learning, Kostrikov et al., NeurIPS 2022)是另一种广受欢迎的离线 RL 算法。它的巧妙之处在于:完全避免查询分布外动作的 Q 值。它通过**期望回归(expectile regression)**从数据集自身的动作分布中估计一个上分位数价值函数 V(s),然后用 V 作为 Q 值的上界目标:

LV=E(s,a)∼D[L2τ(Q(s,a)−V(s))]L_V = \mathbb{E}_{(s,a) \sim \mathcal{D}} \left[ L_2^\tau(Q(s,a) - V(s)) \right] LQ=E(s,a,r,s′)∼D[(Q(s,a)−r−γ⋅V(s′))2]L_Q = \mathbb{E}_{(s,a,r,s') \sim \mathcal{D}} \left[ (Q(s,a) - r - \gamma \cdot V(s'))^2 \right]

其中 L₂^τ(u) = |τ − 𝟙(u<0)| · u² 是非对称最小二乘损失。提取策略时只需对数据集内动作做 advantage-weighted regression:

π(a∣s)∝exp⁡(β⋅(Q(s,a)−V(s)))⋅πβ(a∣s)\pi(a|s) \propto \exp\left( \beta \cdot (Q(s,a) - V(s)) \right) \cdot \pi_\beta(a|s)

IQL 简洁稳定,无需复杂的正则项调参,在 D4RL 基准上长期是强基线。

传统 Actor-Critic 框架(如 PPO)需要训练一个价值网络(critic)来估计优势函数 A(s,a) = Q(s,a) − V(s),以此降低策略梯度的方差。但在 LLM 场景下,critic 网络与策略网络同等庞大,显存开销翻倍。GRPO 的创新在于:用组内(group)基线替代 critic 网络。

对于每个问题 q,从当前策略 π_θ 中采样一组 G 个输出 {o₁, o₂, ..., o_G},对每个输出计算奖励 r_i(如数学题对错),然后在组内归一化得到相对优势:

Ai=ri−mean(r1,…,rG)std(r1,…,rG)A_i = \frac{r_i - \text{mean}(r_1, \ldots, r_G)}{\text{std}(r_1, \ldots, r_G)}

GRPO 的策略梯度目标为(去掉 KL 正则项后):

J(θ)=Eq Eoi∼πold[min⁡(ρi⋅Ai,  clip(ρi,1−ε,1+ε)⋅Ai)]J(\theta) = \mathbb{E}_q \, \mathbb{E}_{o_i \sim \pi_{\text{old}}} \left[ \min\left( \rho_i \cdot A_i, \; \text{clip}(\rho_i, 1-\varepsilon, 1+\varepsilon) \cdot A_i \right) \right]

其中 ρ_i = π_θ(o_i|q) / π_old(o_i|q) 是重要性采样比率,ε 是 PPO 式的截断范围。关键优势:无需训练 critic 网络,显存减半;组内归一化天然适合”只有对/错”的二元可验证奖励(RLVR)——做对的样本优势为正,做错的为负,天然构成对比信号。

多智能体 RL:部分可观测马尔可夫博弈

Section titled “多智能体 RL:部分可观测马尔可夫博弈”

多智能体 RL 的形式化框架是马尔可夫博弈(Markov Game / Stochastic Game)——它是单智能体 MDP(Markov Decision Process,马尔可夫决策过程——用状态、动作、转移、奖励四元组描述序贯决策的数学框架)的多智能体推广。N 个智能体在共享状态 s 下各自选择动作 (a¹, a², ..., aᴺ),联合动作决定状态转移 P(s' | s, a¹, ..., aᴺ),每个智能体 i 获得各自的奖励 rⁱ。每个智能体寻求最大化自身的折扣累计回报。

核心挑战是非平稳性(non-stationarity):从单个智能体的视角看,其他智能体也在学习和改变策略,导致环境的转移函数不断变化——这违反了 MDP 的马尔可夫平稳假设,使传统单智能体算法直接套用时不收敛。主流解决方案包括:

  • 独立学习(Independent Learning, IPPO):每个智能体把其他智能体当作环境的一部分,各自跑 PPO。简单但受非平稳性影响大。
  • 集中式训练分散式执行(CTDE, Centralized Training with Decentralized Execution):训练时允许访问所有智能体的观测和动作(全局信息),执行时每个智能体只用自己的局部观测做决策。这是当前 MARL 的事实标准范式。
  • MAPPO(Multi-Agent PPO):CTDE 范式下的代表作——共享一个集中式价值函数 V(s, o¹, ..., oᴺ) 评估全局状态,每个智能体的 Actor 用局部观测执行,是合作型 MARL 的强基线。

离线 RL 的最大难点:训练数据只覆盖了行为策略走过的”路”,而目标策略可能想去没见过的”新地方”——保守 Q 学习(CQL)等算法通过”对未见过的状态悲观估计”来缓解这个问题。

RLVR 训练流程:可验证奖励如何驱动推理

Section titled “RLVR 训练流程:可验证奖励如何驱动推理”

RLVR 的关键在于奖励的确定性:数学题的正确答案可以用符号计算引擎(如 SymPy)验证,代码题可以用单元测试通过与否判定,这些奖励不需要人类标注,不会随主观偏好波动。正是这种确定性让 RL 信号稳定、可大规模扩展。

自 DeepSeek-R1 将 GRPO 推向主流后,学界对”无 critic 策略优化”产生了广泛兴趣,催生了一系列改进:

  • DAPO(Decoupled clip and dynamic sAmpling Policy Optimization):字节跳动团队(2025)提出,解耦 PPO 式 clip 的上下界、动态调整采样温度,解决了 GRPO 在困难推理题上”采样全错导致优势全零、梯度消失”的问题,在 AIME 等数学竞赛基准上大幅超越 vanilla GRPO。
  • Dr.GRPO(Biased-free GRPO):修正 GRPO 中 KL 散度惩罚和长度归一化带来的隐式偏差,使得优势信号更纯净,训练更稳定。
  • GSPO(Group Sequence Policy Optimization):在序列级别而非 token 级别计算重要性采样比率,减少长序列推理中的方差问题。

这些工作的共同方向是:让 RL 训练信号更适配推理任务的长输出、稀疏奖励特性。

离线到在线 RL(Offline-to-Online RL)

Section titled “离线到在线 RL(Offline-to-Online RL)”

纯离线 RL 虽安全,但受限于数据集质量和覆盖范围;纯在线 RL 效果好但代价高。离线到在线 RL 的思路是:先用离线数据预训练一个好策略,再用少量在线交互微调(fine-tune),兼顾安全与性能。

  • 校准不确定性(Calibrated Uncertainty):用集成 Q 网络(ensemble)估计模型对每个 (s,a) 的”信心”。在在线微调阶段,优先探索模型”不确定但有可能好”的状态,避免盲目试错。
  • RLPD / AWAC / Cal-QL:一系列算法实现了平滑的离线→在线过渡。Cal-QL(Calibrated CQL, Nakamoto et al., ICML 2023)在离线阶段就用下界估计做保守,在在线阶段自动放宽保守度,是当前工业界的常用方案。

序列建模与 RL 的融合:Decision Transformer 之后

Section titled “序列建模与 RL 的融合:Decision Transformer 之后”

传统 RL 用 Bellman 递归求解,而 Decision Transformer(Chen et al., 2021)另辟蹊径——把 RL 重新表述为条件序列生成问题:给定期望回报 R̂、历史状态和动作,用 Transformer 自回归地预测下一个动作。

输入序列: R̂₁, s₁, a₁, R̂₂, s₂, a₂, R̂₃, s₃, ...
↑ 预测目标 a₃

2024–2025 的后续工作包括:

  • Elastic Decision Transformer / Q-learning Decision Transformer:解决原 DT 无法在推理时”指定任意目标回报”的问题(回报条件化失效),通过 Q 值引导采样改善鲁棒性。
  • Diffusion-based Policy(扩散策略):用扩散模型(Diffusion Model)替代 Transformer 作为策略网络,对多模态动作分布(同一状态下多种合理动作)有天然优势,在机器人操作任务上成为 2024–2025 的主流方向之一。
  • Trajectory Transformer:将整条轨迹(含奖励、状态、动作)统一 token 化,用 GPT 式模型建模,实现规划、反事实推理等扩展能力。

世界模型(World Model)学习环境的动态模拟器,让智能体可以”在脑中 rollout”而非与真实环境交互——这本质上是一种可微的离线 RL。代表性工作:

  • DreamerV3(Hafner et al., 2023):用循环状态空间模型(RSSM)学习世界模型,然后在想象的轨迹上做 Actor-Critic。一个固定超参数配置跨 150+ 任务全部收敛,是 2023–2025 世界模型 RL 的里程碑。
  • Genie(Google DeepMind, 2024):从大量无标注游戏视频中自监督学习可控的世界模型,生成可交互的环境——模糊了”学习环境模型”与”生成虚拟世界”的边界。
import d3rlpy
import numpy as np
# 准备离线数据集(模拟历史交互日志:状态/动作/奖励/下一状态/结束标志)
observations = np.random.rand(1000, 8).astype("float32") # 8 维状态
actions = np.random.rand(1000, 2).astype("float32") # 连续动作
rewards = np.random.rand(1000).astype("float32")
dataset = d3rlpy.dataset.MDPDataset(observations, actions, rewards, terminals=np.zeros(1000))
# 用 CQL(保守 Q 学习)训练离线策略——无需环境交互
cql = d3rlpy.algos.CQLConfig().create(device="cuda:0")
cql.build_with_dataset(dataset)
cql.fit(dataset, n_steps=1000) # 训练 1000 步
# 也可以用 IQL(隐式 Q 学习),无需调保守正则项 α
iql = d3rlpy.algos.IQLConfig().create(device="cuda:0")
iql.build_with_dataset(dataset)
iql.fit(dataset, n_steps=1000)

d3rlpy 是业界最成熟的离线 RL 库,内置 CQL、IQL、BCQ、TD3+BC、AWAC 等主流算法,接口与 scikit-learn 风格一致。

GRPO 最小概念代码(PyTorch 风格)

Section titled “GRPO 最小概念代码(PyTorch 风格)”

以下伪代码展示 GRPO 的核心逻辑——对每个问题采样一组输出,用组内归一化优势做 PPO 式更新:

import torch
import torch.nn.functional as F
def grpo_step(model, ref_model, questions, reward_fn, group_size=8, beta=0.01):
"""GRPO 单步训练(简化版,省略 clip 细节)"""
advantages = []
all_outputs = []
for q in questions:
# 1. 从当前策略采样 G 个输出
outputs = [model.generate(q) for _ in range(group_size)]
rewards = torch.tensor([reward_fn(q, o) for o in outputs]) # RLVR: 对错 → 0/1
# 2. 组内归一化得到相对优势(无需 critic 网络!)
adv = (rewards - rewards.mean()) / (rewards.std() + 1e-8)
advantages.extend(adv.tolist())
all_outputs.extend(outputs)
advantages = torch.tensor(advantages)
# 3. PPO 式策略梯度更新 + KL 惩罚(保持不偏离参考模型)
log_probs = torch.stack([model.log_prob(o) for o in all_outputs])
with torch.no_grad():
ref_log_probs = torch.stack([ref_model.log_prob(o) for o in all_outputs])
kl = (log_probs - ref_log_probs).mean()
loss = -(log_probs * advantages).mean() + beta * kl # 最大化优势 → 取负号最小化
loss.backward()
return loss

注意:reward_fn 在 RLVR 中是确定性的验证函数(如用 sympy.simplify 检查数学答案、用 unittest 检查代码输出),这正是 RLVR 区别于 RLHF(需人类偏好标注)的根本所在。

  • DeepSeek-R1 推理训练(RLVR + GRPO):DeepSeek-R1 不依赖人类示范(无 SFT 冷启动),纯靠”可验证奖励”(数学/代码题答案可判对错)的强化学习,让模型自主发展出长链推理、自我反思能力——这是 GPT-o1、DeepSeek-R1 等推理模型的范式核心。详见RLHF 与 LLM 训练。
  • 机器人从演示学习:波士顿动力的机器人通过模仿专家遥操作的录像(离线数据)学习行走、抓取,无需在真实世界中数百万次试错——既安全又高效,是目前机器人技能迁移的主流路线。
  • 游戏 AI 多角色协作:OpenAI Five(Dota 2 五对五)、AlphaStar(星际争霸多阵营)都需要多智能体 RL 来处理”队友配合 + 对手博弈”——自博弈(self-play)让 AI 在对抗中不断进化。
  • 推荐系统冷启动:用大量历史用户交互日志(离线数据)训练推荐策略,避免用探索性策略在线上”坑”真实用户——大厂推荐系统普遍采用离线 RL + 线上微调的闭环。
类库语言说明
d3rlpyPython业界最成熟的离线 RL 库,内置 CQL/IQL/BCQ/AWAC 等算法
Stable-Baselines3Python经典在线 RL 库(PPO/SAC/TD3),教学与基线首选
PettingZooPython多智能体环境标准接口,类似单智能体的 Gym
MARLlibPython多智能体强化学习统一框架,支持多种 MARL 算法
RLlib (Ray)Python分布式 RL 框架,支持大规模多智能体训练
TianshouPython轻量级 RL 库(清华团队),模块化设计,支持离线/在线
术语英文解释
离线强化学习Offline RL仅从固定的历史交互数据集学习策略,不与环境交互
在线强化学习Online RL智能体边与环境交互边学习,不断探索试错
行为策略Behavior Policy产生离线数据集的策略(可能是专家或旧版本策略)
分布偏移Distributional Shift目标策略遇到训练数据未覆盖的状态导致的误差
保守 Q 学习Conservative Q-Learning (CQL)对未见过状态做悲观估计的离线 RL 算法
多智能体强化学习Multi-Agent RL (MARL)多个智能体在同环境中共存,学习合作或竞争
合作/竞争Cooperative / Competitive多智能体关系的两种基本类型:共赢或零和博弈
可验证奖励RLVR (RL with Verifiable Rewards)奖励可客观判定的 RL(如数学题对错),DeepSeek-R1 的训练范式
GRPOGroup Relative Policy Optimization组内相对策略优化算法,DeepSeek-R1 的核心优化器
  • 离线 RL 基础:Levine et al., “Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems”, 2020. 离线 RL 的权威综述。
  • CQL:Kumar et al., “Conservative Q-Learning for Offline Reinforcement Learning”, NeurIPS 2020. 保守 Q 学习,离线 RL 里程碑算法。
  • 决策 Transformer:Chen et al., “Decision Transformer: Reinforcement Learning via Sequence Modeling”, NeurIPS 2021. 把 RL 重新表述为序列建模的新范式。
  • DeepSeek-R1:DeepSeek-AI, “DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning”, 2025. RLVR + GRPO 的纯 RL 推理突破,不依赖人类示范。
  • 多智能体 RL 综述:Hernandez-Leal et al., “A Survey of Opponent Modeling in Multiagent Systems”, 2019.