里程碑:从 TD-Gammon 到图灵奖
本页梳理强化学习(定位见强化学习概览)从 1957 年动态规划奠基到 2025 年图灵奖的关键演进脉络,帮助理解”RL 从游戏 AI 走到 ChatGPT”的技术跃迁。
什么是强化学习:一段直觉
Section titled “什么是强化学习:一段直觉”强化学习(Reinforcement Learning, RL)研究的是智能体(agent)在与环境交互中,通过试错最大化长期累积奖励来学习最优决策策略的方法。它区别于监督学习(有标签告诉”正确答案”)和无监督学习(只找数据结构)——RL 没有”标准答案”,只有环境反馈的奖励信号(reward),智能体必须在”探索未知”与”利用已知”之间做权衡(exploration-exploitation tradeoff,即尝试新动作 vs. 选择当前看起来最好的动作)。
RL 的形式化基础是马尔可夫决策过程(Markov Decision Process, MDP,一种用状态、动作、转移概率和奖励来描述序贯决策问题的数学框架)。一个 MDP 由五元组 (S, A, P, R, γ) 定义:
S:状态空间(state space),环境可能处于的所有情况。A:动作空间(action space),智能体可执行的所有操作。P(s'|s,a):转移概率,在状态s执行动作a后转移到s'的概率。R(s,a):奖励函数,执行动作后环境返回的即时反馈。γ ∈ [0,1):折扣因子(discount factor),权衡近期与远期奖励——越接近 1 越重视长远回报。
智能体的目标是找到一个策略 π(a|s)(在状态 s 下选择动作 a 的概率分布),使得期望累积折扣回报 G_t 最大:
这里 G_t 是从时刻 t 起的累积折扣回报。折扣因子 γ 的意义在于:眼前的奖励固然重要,但不能短视——一个好的策略会为了更大的长远回报牺牲眼前利益(如下棋中的弃子战术)。
RL 的发展可以理解为三波浪潮,每波都解决了前一波的瓶颈:
- 第一波:表格方法(1980s–2000s)——Q-learning 等算法用一张表记录”什么状态做什么动作好”,但状态太多时表就放不下了。这一阶段的代表性工作是 TD-Gammon(1992),它用 TD 学习(Temporal Difference learning,时序差分学习——一种无需等待整个回合结束就能更新价值估计的方法)结合神经网络,达到了西洋双陆棋大师级水平。
- 第二波:深度强化学习(2013–2020)——用神经网络替代 Q 表,从原始像素直接学习策略。DQN 玩 Atari、AlphaGo 下围棋,都是这一波的成果。核心突破在于解决了”维度灾难”(curse of dimensionality,即状态空间随变量数指数增长),并发展出经验回放、目标网络等稳定深度网络训练的技术。
- 第三波:RL 用于 LLM(2022 至今)——不再让 AI 玩游戏,而是用 RL 让语言模型”学会讨人类喜欢”(RLHF,即基于人类反馈的强化学习),甚至”学会推理”(RLVR,即基于可验证奖励的强化学习,用于训练 o1/R1 等推理模型)。这一波让 RL 从”游戏和机器人控制”跨界成为大模型训练的核心技术。
DQN → AlphaGo → RLHF 演进路线
Section titled “DQN → AlphaGo → RLHF 演进路线”RL 技术演进时间线
Section titled “RL 技术演进时间线”DQN 核心流程
Section titled “DQN 核心流程”DQN 的两大创新:经验回放(把交互数据存入缓冲区,随机采样训练,打破数据相关性)和目标网络(用延迟更新的网络计算目标 Q 值,稳定训练)。
DQN 训练伪代码
Section titled “DQN 训练伪代码”初始化主网络 Q(s,a;θ) 和目标网络 Q'(s,a;θ'),θ' = θ初始化经验回放池 D
for episode = 1 to M: 初始化状态 s for t = 1 to T: # ε-greedy 选择动作 以概率 ε 随机选动作 a,否则 a = argmax_a Q(s,a;θ) 执行动作 a,观察奖励 r 和新状态 s' 将 (s, a, r, s') 存入 D # 从回放池随机采样训练 从 D 中随机采样 minibatch {(s_j, a_j, r_j, s'_j)} 计算目标 y_j = r_j + γ · max_a' Q'(s'_j, a';θ') (终止状态 y_j = r_j) 对 (y_j - Q(s_j, a_j;θ))² 做梯度下降,更新 θ 每 C 步:θ' ← θ (同步目标网络) s ← s'核心数学原理
Section titled “核心数学原理”Bellman 方程:RL 的”地基”
Section titled “Bellman 方程:RL 的”地基””几乎所有值函数方法都建立在 Bellman 方程之上。它表达了这样一个递归直觉:当前状态的价值 = 即时奖励 + 下一状态的价值。状态值函数 (遵循策略 π 时状态 s 的期望回报)满足:
类似地,动作值函数 (在状态 s 执行动作 a 后遵循 π 的期望回报)满足:
Q-learning:离策略的 TD 控制
Section titled “Q-learning:离策略的 TD 控制”Q-learning 是一种离策略(off-policy,即学习的目标策略与实际交互的行为策略可以不同)算法。它直接逼近最优动作值函数 Q*(s,a),而不依赖任何特定策略:
Q-learning 的更新规则(Tabular 版本):
其中 α 是学习率,方括号中的项 r + γ·max_{a'} Q(s',a') - Q(s,a) 被称为 TD 误差(temporal difference error),即”实际观察到的回报”与”当前估计”之间的差距。DQN 本质上是将上述表格更新替换为神经网络的梯度下降更新——用 Q(s,a;θ) 近似 Q*(s,a)。
策略梯度:直接优化策略
Section titled “策略梯度:直接优化策略”与值函数方法不同,策略梯度(Policy Gradient)方法直接对策略参数 θ 求梯度,最大化期望回报 J(θ)。经典 REINFORCE 算法的核心公式:
其中 τ 是一条轨迹(trajectory,即一整条状态-动作-奖励序列),G_t 是从时刻 t 起的累积回报。直觉上:∇ log π 指向”增大该动作概率”的方向,乘以 G_t 后,回报高的动作被”强化”(概率增大),回报低的被”弱化”。策略梯度方法的详细对比见各算法适用场景对比。
| 年份 | 事件 | 人物/团队 |
|---|---|---|
| 1957 | 动态规划与 MDP 框架奠基 | Bellman |
| 1959 | 自对弈学习跳棋(TD 思想先驱) | Arthur Samuel(IBM) |
| 1988 | TD 学习形式化 | Sutton |
| 1989/1992 | Q-learning | Watkins(剑桥博士论文;期刊版 Watkins & Dayan 1992) |
| 1992 | TD-Gammon 达西洋双陆棋大师级——首个知名 RL 成功应用 | Tesauro(IBM) |
| 2013/2015 | DQN:Atari 像素输入达人类水平,深度强化学习开端 | Mnih et al.(DeepMind),Nature 2015 |
| 2016 | AlphaGo 4:1 胜李世乭 | Silver, Huang, Hassabis 等(DeepMind),Nature 2016 |
| 2017 | AlphaGo Zero(无需人类棋谱);PPO(后为 RLHF 标配);RLHF 奠基(Christiano et al.) | DeepMind / OpenAI |
| 2018 | AlphaZero(通用棋类);SAC | DeepMind / UC Berkeley |
| 2019 | OpenAI Five 胜 Dota 2 世界冠军 OG;AlphaStar 达星际 II 宗师级 | OpenAI / DeepMind |
| 2020 | MuZero(不知规则也能规划) | DeepMind,Nature |
| 2022 | InstructGPT:RLHF 三阶段流水线(SFT→奖励模型→PPO)→ ChatGPT | Ouyang et al., OpenAI |
| 2024/2025 | RL 训练推理模型:OpenAI o1(2024-09)、DeepSeek-R1(2025-01,GRPO)——RL 从”对齐工具”升级为”能力训练工具” | OpenAI / DeepSeek |
| 2024(2025-03 公布) | 图灵奖授予 RL 奠基人 Barto & Sutton | ACM |
年份双标注(如 Q-learning 1989/1992、DQN 2013/2015)说明见 RLHF 与 LLM 训练。
各算法适用场景对比
Section titled “各算法适用场景对比”不同算法没有绝对的优劣,只有”适不适合当前任务”:
| 算法 | 类型 | 动作空间 | 适用场景 | 一句话点评 |
|---|---|---|---|---|
| Q-learning | 表格型值函数 | 离散 | 小状态空间、入门教学 | 最简形式,状态一多就放不下 |
| DQN 族(Double/Dueling/Rainbow) | 深度值函数 | 离散 | Atari 游戏、离散决策 | 深度 RL 入门首选,改进版锦上添花 |
| REINFORCE | 策略梯度 | 离散/连续 | 理解策略梯度思想 | 方差大、收敛慢,仅作教学 |
| A2C/A3C | Actor-Critic | 离散/连续 | 中等规模任务、并行训练 | 结构简单,样本效率一般 |
| PPO | 策略梯度(on-policy) | 离散/连续 | 通用默认:游戏、机器人、RLHF | 最稳的”万金油”,最常用 |
| DDPG | 确定性策略(off-policy) | 连续 | 连续控制(机器人) | 超参数敏感,已被取代 |
| TD3 | 确定性策略(off-policy) | 连续 | 连续控制 | DDPG 的稳定改进版 |
| SAC | 最大熵(off-policy) | 连续 | 连续控制 | 样本效率高,连续控制事实标准 |
| MuZero | 学习模型 + 规划 | 离散 | 规则未知的游戏(棋类/Atari) | 不靠规则也能规划 |
选型经验:离散动作优先 DQN 族;连续动作优先 SAC;拿不准就上 PPO;状态空间巨大且有规则可学(如棋类)时考虑 MuZero 式”学模型 + 规划”。
- 从简单环境开始:不要一上来就训 Atari,先用 OpenAI Gym(现 Gymnasium)的
CartPole-v1(倒立摆)验证算法正确性——只有 4 个状态维度、2 个动作,几分钟就能收敛。 - DQN 的两个 trick 缺一不可:没有经验回放,数据高度相关,网络会”忘掉”旧经验;没有目标网络,训练目标本身在动,导致发散。
- PPO 是目前最常用的策略梯度算法:OpenAI 用它做 RLHF,因为它的 trust region 机制使训练比 TRPO 更稳定且易于实现。
- AlphaGo 的成功不只靠 RL:它是”监督学习预训练 + RL 自对弈 + MCTS 搜索”的组合体,纯 RL 在围棋上收敛极慢。
- AlphaGo → 围棋:2016 年 4:1 击败李世乭,RL 自对弈 + MCTS 搜索的组合让 AI 掌握了此前被认为”还需十年”的围棋——RL 在完全信息博弈中的里程碑。
- OpenAI Five → Dota 2:2019 年击败世界冠军 OG 战队,五个 RL 智能体协作完成了长达 45 分钟、状态空间天文数字的即时战略对局。
- AlphaStar → 星际争霸 II:DeepMind 的 AlphaStar 达到 Grandmaster 级(前 0.2%),是 RL 在不完全信息、多智能体实时博弈上的突破。
- ChatGPT 的 RLHF 训练:OpenAI 用 RLHF(SFT → 奖励模型 → PPO)让 GPT-3 学会遵循人类偏好回答问题,ChatGPT 的成功直接催生了 RLHF 在大模型对齐中的普及。
- DeepMind 数据中心冷却优化:Google 用 RL 控制数据中心的冷却系统(PUE 降低约 40%),每年节省数亿美元电费——RL 从”玩游戏”走向”省真金白银”的工业级应用典范。
典型类库与工具
Section titled “典型类库与工具”| 类库 | 语言 | 说明 |
|---|---|---|
| Gymnasium | Python | 标准 RL 环境库(CartPole 到 Atari),验证算法正确性的首选 |
| Stable-Baselines3 | Python | 封装 DQN、PPO、A2C、SAC 等深度 RL 算法的高层库 |
| RLlib (Ray) | Python | 分布式深度 RL 库,支持多机多卡的大规模训练实验 |
| OpenAI Baselines | Python | OpenAI 早期发布的 DQN/A2C/TRPO 参考实现(已归档,但影响深远) |
| Tianshou | Python | 模块化 RL 研究库,代码可读性强,适合复现和修改论文算法 |
| 术语 | 英文 | 解释 |
|---|---|---|
| 经验回放 | Experience Replay | 将交互数据存入缓冲区并随机采样训练,以打破数据时间相关性 |
| 目标网络 | Target Network | 延迟同步的副本网络,用于稳定计算 Q 值训练目标 |
| 策略梯度 | Policy Gradient | 直接对策略参数求梯度、以期望回报为目标的优化方法 |
| Actor-Critic | Actor-Critic | 同时维护策略网络(Actor)和价值网络(Critic)的 RL 架构 |
| 蒙特卡洛树搜索 | MCTS (Monte Carlo Tree Search) | 通过模拟 rollout 构建搜索树的规划方法,AlphaGo 的关键组件 |
| 近端策略优化 | PPO (Proximal Policy Optimization) | 限制策略更新幅度以实现稳定训练的策略梯度算法 |
| 自对弈 | Self-Play | 智能体与自身历史版本对弈以不断生成训练数据的技术 |
- TD-Gammon(1992):Tesauro 在 IBM 工作期间开发,将 TD 学习与神经网络结合,达到西洋双陆棋世界冠军水平——这是 RL 第一个令人信服的成功案例。
- DQN(2013/2015):Mnih et al. 在 arXiv 发表于 2013,Nature 正式版发表于 2015。论文标题”Human-level control through deep reinforcement learning”。
- AlphaGo 系列:2016 Nature 论文记录了对李世乭的比赛;2017 AlphaGo Zero 完全不依赖人类棋谱,从零自对弈;2018 AlphaZero 推广到国际象棋和将棋。MuZero(2020)进一步去除了对游戏规则的依赖。
- RLHF → 推理模型:Christiano et al. 2017 的”Deep RL from Human Preferences”是 RLHF 的奠基论文;InstructGPT(2022)将其产品化;2024 年起 RLVR(可验证奖励的 RL)用于训练推理模型。