Skip to content

里程碑:从 TD-Gammon 到图灵奖

本页梳理强化学习(定位见强化学习概览)从 1957 年动态规划奠基到 2025 年图灵奖的关键演进脉络,帮助理解”RL 从游戏 AI 走到 ChatGPT”的技术跃迁。

强化学习(Reinforcement Learning, RL)研究的是智能体(agent)在与环境交互中,通过试错最大化长期累积奖励来学习最优决策策略的方法。它区别于监督学习(有标签告诉”正确答案”)和无监督学习(只找数据结构)——RL 没有”标准答案”,只有环境反馈的奖励信号(reward),智能体必须在”探索未知”与”利用已知”之间做权衡(exploration-exploitation tradeoff,即尝试新动作 vs. 选择当前看起来最好的动作)。

RL 的形式化基础是马尔可夫决策过程(Markov Decision Process, MDP,一种用状态、动作、转移概率和奖励来描述序贯决策问题的数学框架)。一个 MDP 由五元组 (S, A, P, R, γ) 定义:

  • S:状态空间(state space),环境可能处于的所有情况。
  • A:动作空间(action space),智能体可执行的所有操作。
  • P(s'|s,a):转移概率,在状态 s 执行动作 a 后转移到 s' 的概率。
  • R(s,a):奖励函数,执行动作后环境返回的即时反馈。
  • γ ∈ [0,1):折扣因子(discount factor),权衡近期与远期奖励——越接近 1 越重视长远回报。

智能体的目标是找到一个策略 π(a|s)(在状态 s 下选择动作 a 的概率分布),使得期望累积折扣回报 G_t 最大:

Gt=rt+γ⋅rt+1+γ2⋅rt+2+⋯=∑k=0∞γk⋅rt+kG_t = r_t + \gamma \cdot r_{t+1} + \gamma^2 \cdot r_{t+2} + \cdots = \sum_{k=0}^{\infty} \gamma^k \cdot r_{t+k}

这里 G_t 是从时刻 t 起的累积折扣回报。折扣因子 γ 的意义在于:眼前的奖励固然重要,但不能短视——一个好的策略会为了更大的长远回报牺牲眼前利益(如下棋中的弃子战术)。

RL 的发展可以理解为三波浪潮,每波都解决了前一波的瓶颈:

  • 第一波:表格方法(1980s–2000s)——Q-learning 等算法用一张表记录”什么状态做什么动作好”,但状态太多时表就放不下了。这一阶段的代表性工作是 TD-Gammon(1992),它用 TD 学习(Temporal Difference learning,时序差分学习——一种无需等待整个回合结束就能更新价值估计的方法)结合神经网络,达到了西洋双陆棋大师级水平。
  • 第二波:深度强化学习(2013–2020)——用神经网络替代 Q 表,从原始像素直接学习策略。DQN 玩 Atari、AlphaGo 下围棋,都是这一波的成果。核心突破在于解决了”维度灾难”(curse of dimensionality,即状态空间随变量数指数增长),并发展出经验回放、目标网络等稳定深度网络训练的技术。
  • 第三波:RL 用于 LLM(2022 至今)——不再让 AI 玩游戏,而是用 RL 让语言模型”学会讨人类喜欢”(RLHF,即基于人类反馈的强化学习),甚至”学会推理”(RLVR,即基于可验证奖励的强化学习,用于训练 o1/R1 等推理模型)。这一波让 RL 从”游戏和机器人控制”跨界成为大模型训练的核心技术。

DQN 的两大创新:经验回放(把交互数据存入缓冲区,随机采样训练,打破数据相关性)和目标网络(用延迟更新的网络计算目标 Q 值,稳定训练)。

初始化主网络 Q(s,a;θ) 和目标网络 Q'(s,a;θ'),θ' = θ
初始化经验回放池 D
for episode = 1 to M:
初始化状态 s
for t = 1 to T:
# ε-greedy 选择动作
以概率 ε 随机选动作 a,否则 a = argmax_a Q(s,a;θ)
执行动作 a,观察奖励 r 和新状态 s'
将 (s, a, r, s') 存入 D
# 从回放池随机采样训练
从 D 中随机采样 minibatch {(s_j, a_j, r_j, s'_j)}
计算目标 y_j = r_j + γ · max_a' Q'(s'_j, a';θ') (终止状态 y_j = r_j)
对 (y_j - Q(s_j, a_j;θ))² 做梯度下降,更新 θ
每 C 步:θ' ← θ (同步目标网络)
s ← s'

几乎所有值函数方法都建立在 Bellman 方程之上。它表达了这样一个递归直觉:当前状态的价值 = 即时奖励 + 下一状态的价值。状态值函数 Vπ(s)V^\pi(s)(遵循策略 π 时状态 s 的期望回报)满足:

Vπ(s)=∑aπ(a∣s)⋅∑s′P(s′∣s,a)⋅[R(s,a)+γ⋅Vπ(s′)]V^\pi(s) = \sum_a \pi(a|s) \cdot \sum_{s'} P(s'|s,a) \cdot \left[ R(s,a) + \gamma \cdot V^\pi(s') \right]

类似地,动作值函数 Qπ(s,a)Q^\pi(s,a)(在状态 s 执行动作 a 后遵循 π 的期望回报)满足:

Qπ(s,a)=∑s′P(s′∣s,a)⋅[R(s,a)+γ⋅∑a′π(a′∣s′)⋅Qπ(s′,a′)]Q^\pi(s,a) = \sum_{s'} P(s'|s,a) \cdot \left[ R(s,a) + \gamma \cdot \sum_{a'} \pi(a'|s') \cdot Q^\pi(s',a') \right]

Q-learning 是一种离策略(off-policy,即学习的目标策略与实际交互的行为策略可以不同)算法。它直接逼近最优动作值函数 Q*(s,a),而不依赖任何特定策略:

Q∗(s,a)=E[r+γ⋅max⁡a′Q∗(s′,a′)]Q^*(s,a) = \mathbb{E}\left[ r + \gamma \cdot \max_{a'} Q^*(s',a') \right]

Q-learning 的更新规则(Tabular 版本):

Q(s,a)←Q(s,a)+α⋅[r+γ⋅max⁡a′Q(s′,a′)−Q(s,a)]Q(s,a) \leftarrow Q(s,a) + \alpha \cdot \left[ r + \gamma \cdot \max_{a'} Q(s',a') - Q(s,a) \right]

其中 α 是学习率,方括号中的项 r + γ·max_{a'} Q(s',a') - Q(s,a) 被称为 TD 误差(temporal difference error),即”实际观察到的回报”与”当前估计”之间的差距。DQN 本质上是将上述表格更新替换为神经网络的梯度下降更新——用 Q(s,a;θ) 近似 Q*(s,a)。

与值函数方法不同,策略梯度(Policy Gradient)方法直接对策略参数 θ 求梯度,最大化期望回报 J(θ)。经典 REINFORCE 算法的核心公式:

∇θJ(θ)=Eτ[∑t∇θlog⁡πθ(at∣st)⋅Gt]\nabla_\theta J(\theta) = \mathbb{E}_\tau \left[ \sum_t \nabla_\theta \log \pi_\theta(a_t|s_t) \cdot G_t \right]

其中 τ 是一条轨迹(trajectory,即一整条状态-动作-奖励序列),G_t 是从时刻 t 起的累积回报。直觉上:∇ log π 指向”增大该动作概率”的方向,乘以 G_t 后,回报高的动作被”强化”(概率增大),回报低的被”弱化”。策略梯度方法的详细对比见各算法适用场景对比。

年份事件人物/团队
1957动态规划与 MDP 框架奠基Bellman
1959自对弈学习跳棋(TD 思想先驱)Arthur Samuel(IBM)
1988TD 学习形式化Sutton
1989/1992Q-learningWatkins(剑桥博士论文;期刊版 Watkins & Dayan 1992)
1992TD-Gammon 达西洋双陆棋大师级——首个知名 RL 成功应用Tesauro(IBM)
2013/2015DQN:Atari 像素输入达人类水平,深度强化学习开端Mnih et al.(DeepMind),Nature 2015
2016AlphaGo 4:1 胜李世乭Silver, Huang, Hassabis 等(DeepMind),Nature 2016
2017AlphaGo Zero(无需人类棋谱);PPO(后为 RLHF 标配);RLHF 奠基(Christiano et al.)DeepMind / OpenAI
2018AlphaZero(通用棋类);SACDeepMind / UC Berkeley
2019OpenAI Five 胜 Dota 2 世界冠军 OG;AlphaStar 达星际 II 宗师级OpenAI / DeepMind
2020MuZero(不知规则也能规划)DeepMind,Nature
2022InstructGPT:RLHF 三阶段流水线(SFT→奖励模型→PPO)→ ChatGPTOuyang et al., OpenAI
2024/2025RL 训练推理模型:OpenAI o1(2024-09)、DeepSeek-R1(2025-01,GRPO)——RL 从”对齐工具”升级为”能力训练工具”OpenAI / DeepSeek
2024(2025-03 公布)图灵奖授予 RL 奠基人 Barto & SuttonACM

年份双标注(如 Q-learning 1989/1992、DQN 2013/2015)说明见 RLHF 与 LLM 训练。

不同算法没有绝对的优劣,只有”适不适合当前任务”:

算法类型动作空间适用场景一句话点评
Q-learning表格型值函数离散小状态空间、入门教学最简形式,状态一多就放不下
DQN 族(Double/Dueling/Rainbow)深度值函数离散Atari 游戏、离散决策深度 RL 入门首选,改进版锦上添花
REINFORCE策略梯度离散/连续理解策略梯度思想方差大、收敛慢,仅作教学
A2C/A3CActor-Critic离散/连续中等规模任务、并行训练结构简单,样本效率一般
PPO策略梯度(on-policy)离散/连续通用默认:游戏、机器人、RLHF最稳的”万金油”,最常用
DDPG确定性策略(off-policy)连续连续控制(机器人)超参数敏感,已被取代
TD3确定性策略(off-policy)连续连续控制DDPG 的稳定改进版
SAC最大熵(off-policy)连续连续控制样本效率高,连续控制事实标准
MuZero学习模型 + 规划离散规则未知的游戏(棋类/Atari)不靠规则也能规划

选型经验:离散动作优先 DQN 族;连续动作优先 SAC;拿不准就上 PPO;状态空间巨大且有规则可学(如棋类)时考虑 MuZero 式”学模型 + 规划”。

  • 从简单环境开始:不要一上来就训 Atari,先用 OpenAI Gym(现 Gymnasium)的 CartPole-v1(倒立摆)验证算法正确性——只有 4 个状态维度、2 个动作,几分钟就能收敛。
  • DQN 的两个 trick 缺一不可:没有经验回放,数据高度相关,网络会”忘掉”旧经验;没有目标网络,训练目标本身在动,导致发散。
  • PPO 是目前最常用的策略梯度算法:OpenAI 用它做 RLHF,因为它的 trust region 机制使训练比 TRPO 更稳定且易于实现。
  • AlphaGo 的成功不只靠 RL:它是”监督学习预训练 + RL 自对弈 + MCTS 搜索”的组合体,纯 RL 在围棋上收敛极慢。
  • AlphaGo → 围棋:2016 年 4:1 击败李世乭,RL 自对弈 + MCTS 搜索的组合让 AI 掌握了此前被认为”还需十年”的围棋——RL 在完全信息博弈中的里程碑。
  • OpenAI Five → Dota 2:2019 年击败世界冠军 OG 战队,五个 RL 智能体协作完成了长达 45 分钟、状态空间天文数字的即时战略对局。
  • AlphaStar → 星际争霸 II:DeepMind 的 AlphaStar 达到 Grandmaster 级(前 0.2%),是 RL 在不完全信息、多智能体实时博弈上的突破。
  • ChatGPT 的 RLHF 训练:OpenAI 用 RLHF(SFT → 奖励模型 → PPO)让 GPT-3 学会遵循人类偏好回答问题,ChatGPT 的成功直接催生了 RLHF 在大模型对齐中的普及。
  • DeepMind 数据中心冷却优化:Google 用 RL 控制数据中心的冷却系统(PUE 降低约 40%),每年节省数亿美元电费——RL 从”玩游戏”走向”省真金白银”的工业级应用典范。
类库语言说明
GymnasiumPython标准 RL 环境库(CartPole 到 Atari),验证算法正确性的首选
Stable-Baselines3Python封装 DQN、PPO、A2C、SAC 等深度 RL 算法的高层库
RLlib (Ray)Python分布式深度 RL 库,支持多机多卡的大规模训练实验
OpenAI BaselinesPythonOpenAI 早期发布的 DQN/A2C/TRPO 参考实现(已归档,但影响深远)
TianshouPython模块化 RL 研究库,代码可读性强,适合复现和修改论文算法
术语英文解释
经验回放Experience Replay将交互数据存入缓冲区并随机采样训练,以打破数据时间相关性
目标网络Target Network延迟同步的副本网络,用于稳定计算 Q 值训练目标
策略梯度Policy Gradient直接对策略参数求梯度、以期望回报为目标的优化方法
Actor-CriticActor-Critic同时维护策略网络(Actor)和价值网络(Critic)的 RL 架构
蒙特卡洛树搜索MCTS (Monte Carlo Tree Search)通过模拟 rollout 构建搜索树的规划方法,AlphaGo 的关键组件
近端策略优化PPO (Proximal Policy Optimization)限制策略更新幅度以实现稳定训练的策略梯度算法
自对弈Self-Play智能体与自身历史版本对弈以不断生成训练数据的技术
  • TD-Gammon(1992):Tesauro 在 IBM 工作期间开发,将 TD 学习与神经网络结合,达到西洋双陆棋世界冠军水平——这是 RL 第一个令人信服的成功案例。
  • DQN(2013/2015):Mnih et al. 在 arXiv 发表于 2013,Nature 正式版发表于 2015。论文标题”Human-level control through deep reinforcement learning”。
  • AlphaGo 系列:2016 Nature 论文记录了对李世乭的比赛;2017 AlphaGo Zero 完全不依赖人类棋谱,从零自对弈;2018 AlphaZero 推广到国际象棋和将棋。MuZero(2020)进一步去除了对游戏规则的依赖。
  • RLHF → 推理模型:Christiano et al. 2017 的”Deep RL from Human Preferences”是 RLHF 的奠基论文;InstructGPT(2022)将其产品化;2024 年起 RLVR(可验证奖励的 RL)用于训练推理模型。