高级强化学习
本页介绍强化学习的前沿方向——离线 RL、多智能体 RL,以及驱动大模型推理突破的 RLVR / GRPO:前者从历史数据(而非自己试错)中学习,后者让多个智能体在同环境中博弈或协作,最后一个则是 DeepSeek-R1 等新一代推理模型的训练核心。它们是强化学习概览和RLHF 与 LLM 训练的进阶延伸。
- 离线 RL = 从别人的录像学,不用自己下场试错。传统在线 RL(如 DQN,即用神经网络逼近动作价值函数 Q(s,a) 的深度强化学习算法)需要智能体自己与真实环境交互 millions 次来探索——这在现实中代价极高甚至危险(自动驾驶撞了怎么办?医疗方案错了谁负责?)。离线 RL 的思路:用别人(专家或旧策略)已经积累的海量交互数据(录像 / 日志)来训练策略,学完直接用,不在真实环境里冒险。像学生看名师讲课录像自学,不必每道题都自己去试。
- 多智能体 RL = 多个 AI 互相博弈或协作。现实世界很少只有一个智能体——无人车队要协同避堵、游戏里多角色配合、多个推荐位互相抢流量。多智能体 RL 让每个智能体不仅要学”怎么跟环境互动”,还要学”怎么跟其他智能体互动”——合作(共赢)或竞争(博弈)。像下棋(对抗)与足球(团队协作),是单智能体 RL 处理不了的新维度。
- RLVR / GRPO = 大模型推理的新引擎。RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)指奖励信号可以客观判定对错(如数学题答案唯一可判对错),而非依赖人类偏好打分。DeepSeek-R1 用 RLVR 做强化学习,配合 GRPO(Group Relative Policy Optimization,组内相对策略优化——一种无需 critic 网络的策略梯度算法)让模型自主发展出长链推理能力——这是不依赖人类示范的纯 RL 推理突破。
关键数学基础
Section titled “关键数学基础”离线 RL 的 Bellman 目标与分布偏移
Section titled “离线 RL 的 Bellman 目标与分布偏移”强化学习的终极目标是学习一个最优动作价值函数 Q*(s, a),它表示在状态 s 下执行动作 a 后,遵循最优策略能获得的期望累计折扣回报:
其中 γ ∈ (0, 1) 是折扣因子(控制对未来奖励的重视程度,越接近 1 越重视长远),r_t 是时刻 t 的即时奖励。Bellman 最优算子将 Q* 分解为递归形式:
在线 RL 中,智能体通过不断与环境交互来采集 (s, a, r, s') 转移样本,用时序差分(Temporal Difference, TD)更新逼近 Q*。离线 RL 的困境在于:数据集 D 由行为策略 π_β 产生,数据只覆盖 π_β 走过的轨迹,但学出的目标策略 π 可能把智能体带到数据集从未见过的 (s, a) 区域。此时 max_{a'} Q*(s', a') 的估计会基于神经网络的外推——而外推通常是不可靠的,这种系统性误差被称为分布偏移(distributional shift)或外推误差(extrapolation error)。
CQL 的保守化思想
Section titled “CQL 的保守化思想”Conservative Q-Learning(CQL)的核心思路:在标准 Bellman 误差之外,额外惩罚数据集中未出现过的 (s,a) 的 Q 值,迫使模型对分布外动作做悲观估计,从而抑制外推误差。其优化目标可简化为:
第一项是”保守正则项”——它拉开”数据集内动作的 Q 值”与”策略偏好的动作 Q 值”之间的差距,让 OOD(out-of-distribution,分布外)动作的 Q 值被压低,从而在 argmax 选动作时自动避开它们。α 是保守强度超参数。
IQL:另一种思路——隐式 Q 学习
Section titled “IQL:另一种思路——隐式 Q 学习”IQL(Implicit Q-Learning, Kostrikov et al., NeurIPS 2022)是另一种广受欢迎的离线 RL 算法。它的巧妙之处在于:完全避免查询分布外动作的 Q 值。它通过**期望回归(expectile regression)**从数据集自身的动作分布中估计一个上分位数价值函数 V(s),然后用 V 作为 Q 值的上界目标:
其中 L₂^τ(u) = |τ − 𝟙(u<0)| · u² 是非对称最小二乘损失。提取策略时只需对数据集内动作做 advantage-weighted regression:
IQL 简洁稳定,无需复杂的正则项调参,在 D4RL 基准上长期是强基线。
GRPO:组内相对策略优化
Section titled “GRPO:组内相对策略优化”传统 Actor-Critic 框架(如 PPO)需要训练一个价值网络(critic)来估计优势函数 A(s,a) = Q(s,a) − V(s),以此降低策略梯度的方差。但在 LLM 场景下,critic 网络与策略网络同等庞大,显存开销翻倍。GRPO 的创新在于:用组内(group)基线替代 critic 网络。
对于每个问题 q,从当前策略 π_θ 中采样一组 G 个输出 {o₁, o₂, ..., o_G},对每个输出计算奖励 r_i(如数学题对错),然后在组内归一化得到相对优势:
GRPO 的策略梯度目标为(去掉 KL 正则项后):
其中 ρ_i = π_θ(o_i|q) / π_old(o_i|q) 是重要性采样比率,ε 是 PPO 式的截断范围。关键优势:无需训练 critic 网络,显存减半;组内归一化天然适合”只有对/错”的二元可验证奖励(RLVR)——做对的样本优势为正,做错的为负,天然构成对比信号。
多智能体 RL:部分可观测马尔可夫博弈
Section titled “多智能体 RL:部分可观测马尔可夫博弈”多智能体 RL 的形式化框架是马尔可夫博弈(Markov Game / Stochastic Game)——它是单智能体 MDP(Markov Decision Process,马尔可夫决策过程——用状态、动作、转移、奖励四元组描述序贯决策的数学框架)的多智能体推广。N 个智能体在共享状态 s 下各自选择动作 (a¹, a², ..., aᴺ),联合动作决定状态转移 P(s' | s, a¹, ..., aᴺ),每个智能体 i 获得各自的奖励 rⁱ。每个智能体寻求最大化自身的折扣累计回报。
核心挑战是非平稳性(non-stationarity):从单个智能体的视角看,其他智能体也在学习和改变策略,导致环境的转移函数不断变化——这违反了 MDP 的马尔可夫平稳假设,使传统单智能体算法直接套用时不收敛。主流解决方案包括:
- 独立学习(Independent Learning, IPPO):每个智能体把其他智能体当作环境的一部分,各自跑 PPO。简单但受非平稳性影响大。
- 集中式训练分散式执行(CTDE, Centralized Training with Decentralized Execution):训练时允许访问所有智能体的观测和动作(全局信息),执行时每个智能体只用自己的局部观测做决策。这是当前 MARL 的事实标准范式。
- MAPPO(Multi-Agent PPO):CTDE 范式下的代表作——共享一个集中式价值函数
V(s, o¹, ..., oᴺ)评估全局状态,每个智能体的 Actor 用局部观测执行,是合作型 MARL 的强基线。
三种 RL 范式对比
Section titled “三种 RL 范式对比”离线 RL 的核心挑战:分布偏移
Section titled “离线 RL 的核心挑战:分布偏移”离线 RL 的最大难点:训练数据只覆盖了行为策略走过的”路”,而目标策略可能想去没见过的”新地方”——保守 Q 学习(CQL)等算法通过”对未见过的状态悲观估计”来缓解这个问题。
RLVR 训练流程:可验证奖励如何驱动推理
Section titled “RLVR 训练流程:可验证奖励如何驱动推理”RLVR 的关键在于奖励的确定性:数学题的正确答案可以用符号计算引擎(如 SymPy)验证,代码题可以用单元测试通过与否判定,这些奖励不需要人类标注,不会随主观偏好波动。正是这种确定性让 RL 信号稳定、可大规模扩展。
前沿进展(2024–2026)
Section titled “前沿进展(2024–2026)”GRPO 的演进与变体
Section titled “GRPO 的演进与变体”自 DeepSeek-R1 将 GRPO 推向主流后,学界对”无 critic 策略优化”产生了广泛兴趣,催生了一系列改进:
- DAPO(Decoupled clip and dynamic sAmpling Policy Optimization):字节跳动团队(2025)提出,解耦 PPO 式 clip 的上下界、动态调整采样温度,解决了 GRPO 在困难推理题上”采样全错导致优势全零、梯度消失”的问题,在 AIME 等数学竞赛基准上大幅超越 vanilla GRPO。
- Dr.GRPO(Biased-free GRPO):修正 GRPO 中 KL 散度惩罚和长度归一化带来的隐式偏差,使得优势信号更纯净,训练更稳定。
- GSPO(Group Sequence Policy Optimization):在序列级别而非 token 级别计算重要性采样比率,减少长序列推理中的方差问题。
这些工作的共同方向是:让 RL 训练信号更适配推理任务的长输出、稀疏奖励特性。
离线到在线 RL(Offline-to-Online RL)
Section titled “离线到在线 RL(Offline-to-Online RL)”纯离线 RL 虽安全,但受限于数据集质量和覆盖范围;纯在线 RL 效果好但代价高。离线到在线 RL 的思路是:先用离线数据预训练一个好策略,再用少量在线交互微调(fine-tune),兼顾安全与性能。
- 校准不确定性(Calibrated Uncertainty):用集成 Q 网络(ensemble)估计模型对每个 (s,a) 的”信心”。在在线微调阶段,优先探索模型”不确定但有可能好”的状态,避免盲目试错。
- RLPD / AWAC / Cal-QL:一系列算法实现了平滑的离线→在线过渡。Cal-QL(Calibrated CQL, Nakamoto et al., ICML 2023)在离线阶段就用下界估计做保守,在在线阶段自动放宽保守度,是当前工业界的常用方案。
序列建模与 RL 的融合:Decision Transformer 之后
Section titled “序列建模与 RL 的融合:Decision Transformer 之后”传统 RL 用 Bellman 递归求解,而 Decision Transformer(Chen et al., 2021)另辟蹊径——把 RL 重新表述为条件序列生成问题:给定期望回报 R̂、历史状态和动作,用 Transformer 自回归地预测下一个动作。
输入序列: R̂₁, s₁, a₁, R̂₂, s₂, a₂, R̂₃, s₃, ... ↑ 预测目标 a₃2024–2025 的后续工作包括:
- Elastic Decision Transformer / Q-learning Decision Transformer:解决原 DT 无法在推理时”指定任意目标回报”的问题(回报条件化失效),通过 Q 值引导采样改善鲁棒性。
- Diffusion-based Policy(扩散策略):用扩散模型(Diffusion Model)替代 Transformer 作为策略网络,对多模态动作分布(同一状态下多种合理动作)有天然优势,在机器人操作任务上成为 2024–2025 的主流方向之一。
- Trajectory Transformer:将整条轨迹(含奖励、状态、动作)统一 token 化,用 GPT 式模型建模,实现规划、反事实推理等扩展能力。
世界模型与 RL 的深度结合
Section titled “世界模型与 RL 的深度结合”世界模型(World Model)学习环境的动态模拟器,让智能体可以”在脑中 rollout”而非与真实环境交互——这本质上是一种可微的离线 RL。代表性工作:
- DreamerV3(Hafner et al., 2023):用循环状态空间模型(RSSM)学习世界模型,然后在想象的轨迹上做 Actor-Critic。一个固定超参数配置跨 150+ 任务全部收敛,是 2023–2025 世界模型 RL 的里程碑。
- Genie(Google DeepMind, 2024):从大量无标注游戏视频中自监督学习可控的世界模型,生成可交互的环境——模糊了”学习环境模型”与”生成虚拟世界”的边界。
离线 RL 概念代码(d3rlpy)
Section titled “离线 RL 概念代码(d3rlpy)”import d3rlpyimport numpy as np
# 准备离线数据集(模拟历史交互日志:状态/动作/奖励/下一状态/结束标志)observations = np.random.rand(1000, 8).astype("float32") # 8 维状态actions = np.random.rand(1000, 2).astype("float32") # 连续动作rewards = np.random.rand(1000).astype("float32")dataset = d3rlpy.dataset.MDPDataset(observations, actions, rewards, terminals=np.zeros(1000))
# 用 CQL(保守 Q 学习)训练离线策略——无需环境交互cql = d3rlpy.algos.CQLConfig().create(device="cuda:0")cql.build_with_dataset(dataset)cql.fit(dataset, n_steps=1000) # 训练 1000 步
# 也可以用 IQL(隐式 Q 学习),无需调保守正则项 αiql = d3rlpy.algos.IQLConfig().create(device="cuda:0")iql.build_with_dataset(dataset)iql.fit(dataset, n_steps=1000)d3rlpy 是业界最成熟的离线 RL 库,内置 CQL、IQL、BCQ、TD3+BC、AWAC 等主流算法,接口与 scikit-learn 风格一致。
GRPO 最小概念代码(PyTorch 风格)
Section titled “GRPO 最小概念代码(PyTorch 风格)”以下伪代码展示 GRPO 的核心逻辑——对每个问题采样一组输出,用组内归一化优势做 PPO 式更新:
import torchimport torch.nn.functional as F
def grpo_step(model, ref_model, questions, reward_fn, group_size=8, beta=0.01): """GRPO 单步训练(简化版,省略 clip 细节)""" advantages = [] all_outputs = []
for q in questions: # 1. 从当前策略采样 G 个输出 outputs = [model.generate(q) for _ in range(group_size)] rewards = torch.tensor([reward_fn(q, o) for o in outputs]) # RLVR: 对错 → 0/1
# 2. 组内归一化得到相对优势(无需 critic 网络!) adv = (rewards - rewards.mean()) / (rewards.std() + 1e-8) advantages.extend(adv.tolist()) all_outputs.extend(outputs)
advantages = torch.tensor(advantages)
# 3. PPO 式策略梯度更新 + KL 惩罚(保持不偏离参考模型) log_probs = torch.stack([model.log_prob(o) for o in all_outputs]) with torch.no_grad(): ref_log_probs = torch.stack([ref_model.log_prob(o) for o in all_outputs])
kl = (log_probs - ref_log_probs).mean() loss = -(log_probs * advantages).mean() + beta * kl # 最大化优势 → 取负号最小化
loss.backward() return loss注意:
reward_fn在 RLVR 中是确定性的验证函数(如用sympy.simplify检查数学答案、用unittest检查代码输出),这正是 RLVR 区别于 RLHF(需人类偏好标注)的根本所在。
- DeepSeek-R1 推理训练(RLVR + GRPO):DeepSeek-R1 不依赖人类示范(无 SFT 冷启动),纯靠”可验证奖励”(数学/代码题答案可判对错)的强化学习,让模型自主发展出长链推理、自我反思能力——这是 GPT-o1、DeepSeek-R1 等推理模型的范式核心。详见RLHF 与 LLM 训练。
- 机器人从演示学习:波士顿动力的机器人通过模仿专家遥操作的录像(离线数据)学习行走、抓取,无需在真实世界中数百万次试错——既安全又高效,是目前机器人技能迁移的主流路线。
- 游戏 AI 多角色协作:OpenAI Five(Dota 2 五对五)、AlphaStar(星际争霸多阵营)都需要多智能体 RL 来处理”队友配合 + 对手博弈”——自博弈(self-play)让 AI 在对抗中不断进化。
- 推荐系统冷启动:用大量历史用户交互日志(离线数据)训练推荐策略,避免用探索性策略在线上”坑”真实用户——大厂推荐系统普遍采用离线 RL + 线上微调的闭环。
典型类库与工具
Section titled “典型类库与工具”| 类库 | 语言 | 说明 |
|---|---|---|
| d3rlpy | Python | 业界最成熟的离线 RL 库,内置 CQL/IQL/BCQ/AWAC 等算法 |
| Stable-Baselines3 | Python | 经典在线 RL 库(PPO/SAC/TD3),教学与基线首选 |
| PettingZoo | Python | 多智能体环境标准接口,类似单智能体的 Gym |
| MARLlib | Python | 多智能体强化学习统一框架,支持多种 MARL 算法 |
| RLlib (Ray) | Python | 分布式 RL 框架,支持大规模多智能体训练 |
| Tianshou | Python | 轻量级 RL 库(清华团队),模块化设计,支持离线/在线 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 离线强化学习 | Offline RL | 仅从固定的历史交互数据集学习策略,不与环境交互 |
| 在线强化学习 | Online RL | 智能体边与环境交互边学习,不断探索试错 |
| 行为策略 | Behavior Policy | 产生离线数据集的策略(可能是专家或旧版本策略) |
| 分布偏移 | Distributional Shift | 目标策略遇到训练数据未覆盖的状态导致的误差 |
| 保守 Q 学习 | Conservative Q-Learning (CQL) | 对未见过状态做悲观估计的离线 RL 算法 |
| 多智能体强化学习 | Multi-Agent RL (MARL) | 多个智能体在同环境中共存,学习合作或竞争 |
| 合作/竞争 | Cooperative / Competitive | 多智能体关系的两种基本类型:共赢或零和博弈 |
| 可验证奖励 | RLVR (RL with Verifiable Rewards) | 奖励可客观判定的 RL(如数学题对错),DeepSeek-R1 的训练范式 |
| GRPO | Group Relative Policy Optimization | 组内相对策略优化算法,DeepSeek-R1 的核心优化器 |
- 离线 RL 基础:Levine et al., “Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems”, 2020. 离线 RL 的权威综述。
- CQL:Kumar et al., “Conservative Q-Learning for Offline Reinforcement Learning”, NeurIPS 2020. 保守 Q 学习,离线 RL 里程碑算法。
- 决策 Transformer:Chen et al., “Decision Transformer: Reinforcement Learning via Sequence Modeling”, NeurIPS 2021. 把 RL 重新表述为序列建模的新范式。
- DeepSeek-R1:DeepSeek-AI, “DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning”, 2025. RLVR + GRPO 的纯 RL 推理突破,不依赖人类示范。
- 多智能体 RL 综述:Hernandez-Leal et al., “A Survey of Opponent Modeling in Multiagent Systems”, 2019.