Skip to content

安全强化学习

安全强化学习(Safe RL)研究在约束条件下(不能违反安全、预算、伦理底线)学习最优策略的问题——是 RL 走向自动驾驶、医疗、金融等高风险场景的必要前提。本页梳理约束 MDP(CMDP,一种在标准 MDP 基础上附加约束代价信号和预算的数学框架)、风险敏感 RL、CVaR、安全探索与 Shielded RL 等核心方法,并覆盖 2024–2025 年 Safe RL 在大语言模型对齐、自动驾驶和机器人安全方面的最新进展。前置阅读:强化学习概览、里程碑。

把安全 RL 想象成带着安全绳攀岩——你仍然想爬到顶(最大化奖励),但绝不能松手坠崖(违反安全约束):

  • 标准 RL 的问题= RL 靠”试错”学习,但在真实世界里,有些错误是致命的——自动驾驶撞车、医疗方案致敏、金融交易破产,试一次就完了。标准 RL 的目标是最大化期望累积折扣奖励 J(π)=E ⁣[∑tγtrt]J(\pi) = \mathbb{E}\!\left[\sum_t \gamma^t r_t\right],但完全不关心”中途出事”的概率。

  • 约束 MDP(CMDP)= 在标准 MDP(马尔可夫决策过程,一种用状态 s、动作 a、转移概率 P、奖励 r 来建模序贯决策问题的数学框架)上加一条”约束成本”信号:除了奖励 r,每次动作还产生一个约束代价 c(如碰撞风险),要求整个轨迹的累积代价不超过预算 d。形式化地,CMDP 的优化目标为:

    max⁡πEπ ⁣[∑tγtrt]\max_\pi \mathbb{E}_\pi\!\left[\sum_t \gamma^t r_t\right] s.t.Eπ ⁣[∑tγtct]≤d0\text{s.t.} \quad \mathbb{E}_\pi\!\left[\sum_t \gamma^t c_t\right] \leq d_0

    其中 d₀ 是安全预算(budget),cₜ 是时刻 t 的约束代价。这个公式读作:在期望累积代价不超过预算的所有策略中,找到期望累积奖励最大的那个。

  • 安全性与最优性的矛盾= 约束越严,策略越保守,奖励可能越低——Safe RL 的目标是在”绝不破约束”和”尽量高奖励”之间找平衡点。当约束很松(d₀ 很大)时,Safe RL 的解接近无约束 RL 的最优策略;当约束很紧时,策略被迫牺牲奖励来满足安全。

  • CVaR(条件风险价值,Conditional Value at Risk)= 不仅看平均回报,还看”最坏 5% 的情况有多惨”——金融风险管理的经典指标,用于风险敏感 RL。数学上,CVaR_α 定义为回报分布最差 α 分位的条件期望:CVaRα(X)=E[X∣X≤VaRα(X)]\mathrm{CVaR}_\alpha(X) = \mathbb{E}[X \mid X \leq \mathrm{VaR}_\alpha(X)],其中 VaR_α(Value at Risk,风险价值)是回报分布的 α 分位数。

  • 安全探索= 训练过程中也不能违反约束(不能”训练时撞车”),需要用 shield(安全护盾)或 Lyapunov 函数(一种能量函数,如果其在整个轨迹上持续递减则系统渐近稳定)在动作执行前拦截危险动作。这是 Safe RL 区别于”训练后加安全检查”的关键:安全性要内建到学习过程中。

  • Shielded RL= 在策略外面包一层”安全过滤器”——策略输出动作后,Shield 检查该动作是否安全,不安全就强制替换为安全动作。Shield 的安全性通常由控制障碍函数(CBF,Control Barrier Function,一种保证系统状态始终留在安全集内的数学工具)或形式化验证(如模型检测)来提供理论保证。

标准 RL 只优化奖励;Safe RL 在奖励约束下做带约束优化(类似经典 ML 中的约束优化):

两种问题的数学表述对比:

  • 标准 RL:max⁡πJ(π)=Eπ ⁣[∑tγt⋅r(st,at)]\max_\pi J(\pi) = \mathbb{E}_\pi\!\left[\sum_t \gamma^t \cdot r(s_t, a_t)\right],无任何约束。
  • 安全 RL(CMDP):max⁡πJ(π)=Eπ ⁣[∑tγt⋅r(st,at)]\max_\pi J(\pi) = \mathbb{E}_\pi\!\left[\sum_t \gamma^t \cdot r(s_t, a_t)\right],同时满足 Jc(π)=Eπ ⁣[∑tγt⋅c(st,at)]≤d0J_c(\pi) = \mathbb{E}_\pi\!\left[\sum_t \gamma^t \cdot c(s_t, a_t)\right] \leq d_0,其中 c(s,a) 是约束代价函数,d₀ 是安全预算。

拉格朗日松弛法(Lagrangian relaxation)将约束优化转化为无约束问题:构造增广目标 L(π,λ)=J(π)−λ⋅(Jc(π)−d0)L(\pi, \lambda) = J(\pi) - \lambda \cdot (J_c(\pi) - d_0),其中 λ ≥ 0 是拉格朗日乘子(Lagrange multiplier,可理解为”违反约束的惩罚强度”)。通过交替更新策略 π(最大化 L)和乘子 λ(最小化 L,即违反约束时增大 λ),最终收敛到满足约束的最优策略。

从约束信号采集、策略评估到安全动作过滤,完整链路如下:

CVaR 让策略不只看平均,还关心最坏情况的尾部——就像买保险是为了对冲极端风险:

CVaR 与 VaR 的关系可以用回报分布图直观理解:假设回报 X 的累积分布函数为 F(x),则:

  • VaR_α(X) = 回报分布的下 α 分位数,即 VaRα(X)=inf⁡{x:P(X≤x)≥α}\mathrm{VaR}_\alpha(X) = \inf\{x : P(X \leq x) \geq \alpha\}。例如 α=0.05 表示”最坏 5% 情况的回报上限”。
  • CVaR_α(X) = 在回报低于 VaR_α 的条件下的期望值,即 CVaRα(X)=E[X∣X≤VaRα(X)]\mathrm{CVaR}_\alpha(X) = \mathbb{E}[X \mid X \leq \mathrm{VaR}_\alpha(X)]。CVaR 比单独的 VaR 更保守,因为它度量了整个尾部的平均严重程度,而不仅仅是一个分位点。

风险敏感 RL 的一种常见替代目标是最坏情形(worst-case)优化:max⁡πmin⁡ωEπ,ω ⁣[∑tγtrt]\max_\pi \min_\omega \mathbb{E}_{\pi,\omega}\!\left[\sum_t \gamma^t r_t\right],其中 ω 参数化了模型不确定性(如对抗扰动、参数扰动),这等价于鲁棒 RL(Robust RL)。CVaR 可以看作在”完全忽略尾部”和”过度保守的最坏情形”之间的插值——α 越小越保守,α→1 时退化为期望目标。

Safe RL 的主流算法可以按”如何处理约束”分为四大类。理解这些算法的区别有助于在不同场景下选择合适的方法。

1. 拉格朗日方法(Lagrangian Methods)

Section titled “1. 拉格朗日方法(Lagrangian Methods)”

最通用、最简单的约束处理思路。将 CMDP 的约束优化问题通过拉格朗日松弛转化为无约束的 min-max 博弈:

min⁡λ≥0max⁡π  J(π)−λ⋅(Jc(π)−d0)\min_{\lambda \geq 0} \max_\pi \; J(\pi) - \lambda \cdot (J_c(\pi) - d_0)

具体实现如 PPO-Lagrangian、TRPO-Lagrangian:内层用 PPO/TRPO 更新策略 π 来最大化增广目标,外层根据约束违反程度调整乘子 λ(违反则增大 λ、满足则减小 λ)。优点是即插即用,可以嫁接到任何现有 RL 算法上;缺点是训练动态不稳定——λ 的振荡会导致策略在”太激进”和”太保守”之间反复摇摆。2024 年的改进工作(如 PID-Lagrangian、adaptive λ 调度)通过引入 PID 控制器来平滑 λ 的更新,显著改善了收敛性。

2. 基于信任域的方法(Trust Region Methods)

Section titled “2. 基于信任域的方法(Trust Region Methods)”

约束策略优化(CPO,Constrained Policy Optimization) 是第一个在深度 RL 中提供近似约束保证的算法。它在 TRPO(信任域策略优化,一种限制每次策略更新幅度的策略梯度算法)的框架上,将约束直接嵌入到更新规则中:

CPO 更新:在新策略 πnew\pi_{\text{new}} 满足 Jc(πnew)≤d0J_c(\pi_{\text{new}}) \leq d_0 的前提下,找到使 J(πnew)J(\pi_{\text{new}}) 最大的策略更新(限制在旧策略的信任域 KL 范围内)。

CPO 通过对约束代价做线性近似、对目标函数做二次近似,在信任域内求解一个闭式的约束优化,理论上保证每次更新后的策略都近似满足约束。实践中 CPO 计算开销较大(需要二阶信息),后续工作 PCPO(Projection-based CPO)和 RCPO(Reward-Constrained Policy Optimization)提供了更高效的变体。

3. 安全探索方法(Safe Exploration)

Section titled “3. 安全探索方法(Safe Exploration)”

上述方法只能保证渐近约束满足(收敛后),但训练过程中仍可能违反约束。安全探索方法从根源上解决”训练时撞车”问题:

  • Shielded RL:在策略外层加安全过滤器。给定一个形式化验证的安全 Shield(基于时序逻辑、CBF 或可达性分析),策略输出的动作先经 Shield 检查——如果安全则执行,否则 Shield 替换为”最小修正安全动作”。Shield 的正确性由形式化方法保证,而非学习得到。
  • Lyapunov 约束:构造一个 Lyapunov 候选函数 V(s),要求 V(s′)≤V(s)−ϵV(s') \leq V(s) - \epsilon 对所有策略转移成立,从而保证状态始终留在安全集内。代表性工作如 SafeMDP(Turchetta et al., 2016),在探索阶段用高斯过程建模不确定性并避免进入不确定的危险区域。
  • 教师-学生框架(Teacher-Student):在训练早期由安全”教师”(规则或专家)提供示范,学生策略逐渐从模仿过渡到自主探索。2024–2025 年的研究表明,在大规模自主驾驶训练中,这种”人类接管”式的安全机制能将训练事故率降低 90% 以上。

最安全的设定是从已验证安全的历史数据中离线学习——完全不需要在线交互。代表性算法如 BCQ-Lag、CQL-Lag(将离线 RL 的保守性估计与拉格朗日约束结合)以及 2023 年提出的 COptiDice(一种基于分布约束估计的离线安全 RL 方法)。离线安全 RL 在医疗(从病历数据学习安全治疗方案)、金融(从历史交易学习风控策略)等领域极具潜力,因为它天然避免了在线探索的风险。详见离线强化学习。

2024–2025 年,Safe RL 成为大语言模型(LLM)安全对齐的核心技术。RLHF(基于人类反馈的强化学习)本身可以看作一种 Soft 的 Safe RL:奖励模型提供的”有用性”信号驱动策略优化,而安全性约束则通过奖励惩罚、规则过滤等方式施加。以下是最重要的几条技术线索:

Anthropic 提出的 Constitutional AI(宪法 AI) 框架(2022 提出,2023–2024 年被广泛采纳)用一组”宪法原则”(如”不帮助制造武器""不输出歧视性内容”)作为约束规范。具体做法是:

  1. 用 LLM 自我对弈(self-play)生成”违反宪法的输出”,再让 LLM 根据”宪法”自我批评并修正——这是 RLAIF(Reinforcement Learning from AI Feedback) 的核心思路。
  2. 将修正后的好回答作为偏好数据训练奖励模型,再进行 PPO 优化。

这相当于把 CMDP 中的约束代价 c 替换为”违反宪法原则的程度”,用拉格朗日思想在”有用性”和”安全性”之间做平衡。Claude 系列模型(Claude 2/3/3.5)的训练大量依赖此方法。

2024 年的多个工作(如 Safe RLHF,Dai et al., ICLR 2024)明确将 LLM 对齐建模为 CMDP:定义两个独立的奖励模型——有用性奖励(helpfulness reward) 和 安全性奖励(safety reward)——并设定安全性约束预算,用拉格朗日方法求解。相比简单地将”安全”和”不安全”混入单一奖励,这种方法能更精确地控制安全-有用性的 trade-off,避免”要么过于有用但危险、要么过于安全但无用”的两难。

维度纯 RLHFSafe RLHF(CMDP 建模)
奖励模型单一奖励(混合有用性+安全性)双奖励模型(有用性 + 安全性独立建模)
约束处理隐式(通过惩罚项混入奖励)显式(安全性作为硬约束,设预算 d₀)
安全-效用权衡难以精确调控可通过 λ 或 d₀ 连续调节
训练稳定性较好需处理 λ 调度的振荡(用 PID-Lagrangian 改善)
代表系统InstructGPT (GPT-3.5)Claude (Constitutional AI), Safe RLHF

numpy 演示:带惩罚项的约束策略优化

Section titled “numpy 演示:带惩罚项的约束策略优化”

一个简单的投资场景:最大化收益,但要求”单步最大损失不超过预算”——用拉格朗日乘子把约束转化为惩罚项:

import numpy as np
np.random.seed(0)
n_actions = 4 # 4 种投资方案
expected_return = np.array([2.0, 1.5, 3.0, 0.5]) # 各方案期望收益
max_loss = np.array([0.5, 0.2, 5.0, 0.1]) # 各方案最大潜在损失
budget = 1.0 # 安全约束:最大损失预算
# 拉格朗日方法:把约束 max_loss·π ≤ budget 变成目标中的惩罚项
pi = np.ones(n_actions) / n_actions # 初始均匀策略
lagrange = 1.0 # 拉格朗日乘子(动态调整)
lr = 0.1
for iteration in range(200):
# 目标 = 期望收益 - λ · 超出预算的惩罚
objective = expected_return - lagrange * np.maximum(max_loss - budget, 0)
# 策略往目标高的动作倾斜(softmax 近似)
logits = objective * 5.0
pi = np.exp(logits - np.max(logits))
pi /= pi.sum()
# 更新拉格朗日乘子:约束违反则增大 λ
constraint_violation = np.dot(pi, max_loss) - budget
lagrange = max(0.0, lagrange + lr * constraint_violation)
print("学到的策略:", np.round(pi, 3))
print("策略下期望收益:", np.dot(pi, expected_return))
print("策略下最大损失:", np.dot(pi, max_loss))
print("预算:", budget, "(应小于等于)")
# 高收益但高损失的方案 2 会被抑制,学出安全-收益平衡的策略
  • 先定义约束代价= 安全 RL 的第一步是明确”什么算违反约束”:碰撞次数、能耗上限、单次最大损失等,并将其转化为可计算的标量信号 c。这一步看似简单,实际往往是最耗时的——约束设计不当会导致策略学到”钻空子”的行为(如为了降低碰撞代价而完全不动)。
  • 拉格朗日方法是通用基线= 把约束转为惩罚项、动态调整乘子,实现简单且适用于任何 RL 算法;CPO/RCPO 是更严格的变体,提供理论保证。2024 年的实证研究(OmniSafe benchmark)表明,在大多数 Safe RL benchmark 上,PPO-Lagrangian 的性能已经接近甚至超过更复杂的 CPO,且训练更稳定——建议先用 PPO-Lagrangian 作为基线。
  • Shield 要可验证= Shield 本身必须是形式化验证的安全(如基于控制障碍函数 CBF),否则”安全护盾”可能也有漏洞——这在自动驾驶中尤其关键。Shield 的安全证明需要依赖环境的精确动力学模型,如果模型不准(Sim-to-Real gap),Shield 可能过度保守或失效。
  • 模拟器内训练 + 安全迁移= 先在模拟器里用标准 RL 训练,再用 Safe RL 在真实环境中微调,是最实用的工业路径。参见Sim-to-Real 迁移。
  • CVaR vs 期望= 如果任务对极端失败零容忍(医疗、航空),用 CVaR 目标比期望目标安全得多;如果只关心平均表现,标准目标即可。CVaR 的 α 参数选择需要领域知识:α=0.05 是金融中的常用值,但在航空安全中可能需要 α=0.01 甚至更小。
  • 离线安全 RL= 最安全的设定是从已验证安全的历史数据中离线学习,结合离线强化学习和约束方法。2024–2025 年的研究趋势是将离线安全 RL 与决策 Transformer(Decision Transformer)结合,用序列建模处理约束——这避免了传统离线 RL 中的分布偏移问题。
  • 约束松弛要谨慎= 实际中常允许”以概率 1-δ 违反约束”(chance constraint),但 δ 的选取要在安全裕度和策略灵活性间权衡。在自动驾驶等场景中,通常要求 δ < 10⁻⁶ 甚至更严格。
  • 奖励注入(Reward Shaping)vs 硬约束= 实践中很多人把”安全”简单写成大的负奖励——这不等于 Safe RL,因为策略仍可能在高奖励区域冒安全风险。硬约束(CMDP 式)或 Shield 才能提供真正的安全保证;奖励注入只能作为辅助手段。
  • 多约束场景= 真实系统通常有多个约束(碰撞、能耗、舒适度、法规),需要多约束 CMDP(Multi-constraint CMDP)。每个约束有独立的预算和拉格朗日乘子,训练难度随约束数量增长——2024 年的工作提出了分组约束(grouped constraints)和约束优先级调度来缓解维度爆炸。
  • 自动驾驶安全决策= Waymo、Cruise 在变道、急刹等决策上用 Safe RL 保证不碰撞——约束代价是碰撞概率、急加速度等,Shield 在动作执行前过滤危险轨迹。2024–2025 年,Tesla、Waymo 开始在端到端驾驶系统中引入 Safe RL:将交通规则编码为 CMDP 约束(如”红灯停""限速""保持车距”),用拉格朗日方法在行驶效率和安全之间平衡。Waymo 的研究表明,Safe RL 策略在罕见场景(如行人突然闯入)中的安全表现优于纯规则系统和标准 RL。
  • 医疗治疗方案= 脓毒症(Sepsis)、糖尿病治疗方案优化中,约束是”不出现低血糖/过敏”等严重副作用,策略必须在安全剂量范围内学习——通常结合离线强化学习。2024 年的临床研究将离线安全 RL 应用于脓毒症静脉输液策略,从 MIMIC-III 等电子病历数据库中学习,约束是”不引发器官衰竭”——研究显示这类策略在模拟器中将死亡率降低了 3–5%。
  • 金融交易与组合管理= 高频交易策略用 CVaR 目标控制尾部风险,在极端市场行情(如 2008、2020)中避免灾难性损失——摩根士丹利、文艺复兴科技有相关研究。2024–2025 年,强化学习在量化交易中的合规性要求日益严格,Safe RL 的约束方法被用于编码监管要求(如最大持仓限制、单笔交易上限、日内回撤上限)。
  • 电网安全控制= 电力系统调频中,约束是电压不越限、频率稳定,RL 必须在安全运行域内操作,Shield 基于物理方程实时校验。2024 年的研究将 Safe RL 用于新能源高比例接入下的电网调度——风光发电的间歇性使得传统优化方法难以实时响应,Safe RL 能在毫秒级做出安全调度决策。
  • 机器人协作安全= 人机协作场景中,机器人必须在人类附近保持安全距离和力限制,ISO 10272 安全标准要求形式化验证。详见Sim-to-Real 迁移。2024–2025 年,人形机器人(如 Figure 02、Tesla Optimus、Unitree)的商业化推动了对 Safe RL 的迫切需求——这些机器人在人类家庭中工作,碰撞约束和力限制必须是硬约束而非软惩罚。
  • 无人机自主飞行= 城市环境无人机配送要避开禁飞区、建筑物、人群,Safe RL 把这些作为硬约束或严重惩罚。Amazon Prime Air、Wing(Alphabet)在真实配送中用 Safe RL 保证飞行安全。
  • 内容安全与 LLM 对齐= Safe RL 是 ChatGPT、Claude、Gemini 等大语言模型安全对齐的核心技术。OpenAI 的 RLHF 流程中,安全性约束(不输出有害内容)与有用性目标之间的平衡,本质上就是一个 CMDP 问题。2024 年 Anthropic 的 Claude 通过 Constitutional AI + RLAIF 实现了比纯 RLHF 更精细的安全控制。详见上方”Safe RL 与大语言模型对齐”一节。
  • 核聚变与等离子体控制= DeepMind 与瑞士等离子体中心(EPFL)合作,用 RL 控制 Tokamak(托卡马克)中的等离子体形态——约束是等离子体不得触碰容器壁(否则损坏反应堆),这是一个典型的安全关键控制问题,Safe RL 为此提供了硬约束保证。
类库语言说明
OmniSafePython专注 Safe RL 的开源库(PKU-Alignment 团队),实现 PPO-Lagrangian、CPO、TRPO-Lagrangian、PPG-Lagrangian 等主流算法,提供标准化 Safe RL benchmark(Safety-Gymnasium)。2023–2024 年持续维护,是目前最活跃的 Safe RL 研究框架
Safety-GymnasiumPythonOmniSafe 配套的安全 RL 环境套件,提供多种连续/离散控制任务(如 Ant、Car、Drone 导航),每个任务定义碰撞、速度等约束代价,是 Safe RL 论文的标准评测平台
safe-control-gymPython基于 PyBullet 的安全控制环境,含安全 RL benchmark,支持 CBF、MPC 等”安全过滤器”的集成评测
safe-rlPythonMicrosoft 维护的安全 RL 工具包,实现 Constrained Policy Optimization (CPO) 及其变体
Verification Toolbox(dReal/dReal4)C++/Python形式化验证工具,用于 Shielded RL 的安全性证明——通过 SMT 求解器验证 Shield 对所有可能状态的覆盖性
Control Barrier Function ToolboxPython/MATLAB控制障碍函数(CBF)库,构建安全过滤器,支持二次规划(QP)形式的最小修正安全动作求解
gym-safetyPython社区维护的安全 RL 环境集合(Safe Island、Chemical Plant 等)
safe-rl-hf / Safe RLHFPython开源实现 Safe RLHF(Dai et al., ICLR 2024),将 LLM 对齐建模为双约束 CMDP,含奖励模型训练和拉格朗日微调流程
术语英文解释
安全强化学习Safe RL在安全/资源约束下学习最优策略的 RL 范式
约束马尔可夫决策过程Constrained MDP (CMDP)在标准 MDP 上附加约束代价信号和预算的数学框架
约束策略优化Constrained Policy Optimization (CPO)在策略优化中显式处理约束、提供近似保证的算法
拉格朗日方法Lagrangian Method把约束转为惩罚项、动态调整乘子的通用约束优化方法
条件风险价值CVaR (Conditional Value at Risk)最坏 α 分位的期望值,衡量尾部风险的风险度量
风险价值VaR (Value at Risk)回报分布的 α 分位数,表示”最坏 α 比例情况下的临界值”
安全探索Safe Exploration训练过程中也保证不违反约束的探索策略
安全护盾Safety Shield在策略输出后过滤不安全动作的外层安全机制
控制障碍函数Control Barrier Function (CBF)保证系统状态留在安全集内的数学工具,常用于 Shield 构建
风险敏感Risk-Sensitive不仅关心期望回报、还关心回报分布尾部(如方差、CVaR)的目标设定
Lyapunov 函数Lyapunov Function一种能量型标量函数,若沿轨迹递减则证明系统稳定,可用于安全集构造
信任域Trust Region策略更新时限制新旧策略 KL 散度不超过阈值的区域,保证更新稳定性
Constitutional AIConstitutional AI (CAI)Anthropic 提出的 LLM 安全对齐框架,用一组”宪法原则”约束模型行为
RLAIFRL from AI Feedback用 AI 模型(而非人类)提供偏好反馈来训练奖励模型的方法,是 Constitutional AI 的核心组件
Safe RLHFSafe RLHF将 LLM 对齐显式建模为 CMDP(双奖励:有用性+安全性)的 Safe RL 方法
鲁棒强化学习Robust RL在最坏模型扰动下优化策略的 RL 范式,与风险敏感 RL 密切相关
机会约束Chance Constraint允许以小概率 δ 违反约束的松弛约束形式:P(违反) ≤ δ
  • Altman,《Constrained Markov Decision Processes》(1999):CMDP 的经典教科书,奠定了安全 RL 的数学框架。
  • Achiam et al.,「Constrained Policy Optimization」(NeurIPS 2017):CPO 论文,首个在深度 RL 中提供约束保证的策略优化算法。
  • Chow et al.,「Risk-Constrained Reinforcement Learning with Percentile Risk Criteria」(ICML 2015):风险敏感 RL 的代表作,将 CVaR 引入策略优化。
  • Alshiekh et al.,「Safe Reinforcement Learning via Shielding」(AAAI 2018):Shielded RL 的开创性论文,用形式化方法构建安全护盾。
  • García & Fernández,「A Comprehensive Survey on Safe Reinforcement Learning」(JMLR 2015):Safe RL 的经典综述,系统梳理方法分类与应用场景。
  • Amodei et al.,「Concrete Problems in AI Safety」(arXiv 2016):OpenAI 的 AI 安全白皮书,列出 RL 安全的关键实际问题。
  • Ray et al.,「Rendering Safe Reinforcement Learning Practical」(NeurIPS 2019):Crashing Cars benchmark 与实用算法,推动 Safe RL 的实证研究。