Skip to content

贝叶斯优化

贝叶斯优化(Bayesian Optimization, BO)是一种高效的序贯模型搜索策略(sequential model-based search strategy),专为评估代价高昂的黑盒函数(expensive black-box functions)设计。它用概率代理模型拟合目标函数,通过采集函数智能决定下一个评估点,用尽可能少的评估次数找到全局最优。它是超参数调优和 AutoML 的事实标准方法。前置阅读:其他交叉分支、贝叶斯推断基础、凸优化基础、自动化机器学习。

假设你要调整一个深度学习模型的 10 个超参数,每评估一组超参数就需要训练模型 2 小时。网格搜索(grid search)需要上千次评估,随机搜索(random search)也好不到哪里去。贝叶斯优化的思路是:从少量评估中学习目标函数的形状,用概率模型推断哪些区域更可能有最优解,然后只去最有希望的地方试:

  • 代理模型(Surrogate)= 你不可能把每寸土地都挖一遍来找宝藏,那就画一张”宝藏概率地图”。高斯过程(Gaussian Process, GP)就是这张地图:已挖过的地方知道精确深度(不确定度低),没挖过的地方不确定度高。地图随每次挖掘不断更新——这就是贝叶斯优化对目标函数建立概率代理的核心。代理模型比真实目标函数”便宜得多”,我们可以在代理模型上做无限次推理。
  • 采集函数(Acquisition)= 有了概率地图,下一步去哪里?采集函数在”利用”(exploitation,去当前最优附近挖,追求稳妥)和”探索”(exploration,去未知区域挖,可能有惊喜)之间权衡。就像勘探矿产:一直在已知矿脉上深挖可能错过新矿,但满世界乱跑又太浪费。采集函数把这种权衡变成一个可计算的数学公式。
  • 高斯过程(GP)= 贝叶斯优化最常用的代理模型。GP 的核心假设是”相似输入对应相似输出”——输入点之间的相似度由核函数(kernel function)度量,离已知点近的新点预测方差小,远处方差大。GP 天然提供预测均值和不确定度,正好是采集函数需要的两个量。可以把它想象成一张连续的、带有误差棒的曲面:观测点处误差棒为零,离观测点越远误差棒越宽。
  • 样本效率(Sample Efficiency)= 贝叶斯优化的最大优势。在目标函数评估昂贵时(每次评估数小时甚至数天),用 50 次评估达到网格搜索 1000 次的效果——省下的算力成本极为可观。本质上,BO 用”在代理模型上推理”替代了大量”在真实函数上评估”。
  • 序贯决策(Sequential Decision)= 贝叶斯优化不是一次性规划所有评估点,而是一个闭环:评估一个点、更新代理模型、重新计算采集函数、选下一个点——每一步都利用所有历史信息做出最优决策。这种”越做越聪明”的特性使得 BO 的后期迭代远比早期高效。
  • 黑盒函数(Black-box Function)= 我们只需要能向目标函数输入参数、获取返回值,不需要知道函数的内部结构或解析表达式。这种”不关心原理、只关心输入输出”的特性,使得 BO 可以应用于从机器学习调参到化学反应优化的极广泛场景。

贝叶斯优化是一个”代理模型拟合 → 采集函数优化 → 真实评估 → 更新模型”的闭环。每次迭代利用全部历史数据重新拟合代理模型,采集函数据此推荐下一个最有价值的评估点:

GP 拟合后,已知点附近的不确定度低(置信带窄),未探索区域的不确定度高(置信带宽)。采集函数综合均值和方差,智能地在高期望区域和高不确定区域之间分配评估预算:

要理解 BO 为什么有效,需要理解 GP 后验(posterior,即在观测到数据后对函数的更新认知)是怎么算出来的。核心是多元高斯分布的条件分布(conditional distribution of a multivariate Gaussian)——这听起来吓人,但逻辑很直接:

  1. 先验假设:假设目标函数 ff 在任意有限个输入点上的联合分布服从多元高斯——f∼N(0,K)f \sim \mathcal{N}(0, K),其中 KK 是核矩阵(kernel matrix),元素 Kij=k(xi,xj)K_{ij} = k(\mathbf{x}_i, \mathbf{x}_j) 由核函数给出。核函数度量”两个输入有多相似”,最常用的是 RBF 核(也叫高斯核):

k(xi,xj)=exp⁡(−∥xi−xj∥22ℓ2)k(\mathbf{x}_i, \mathbf{x}_j) = \exp\left(-\frac{\|\mathbf{x}_i - \mathbf{x}_j\|^2}{2\ell^2}\right)

其中 ℓ\ell 是长度尺度(length scale),控制”相似度衰减多快”——ℓ\ell 越大,函数越平滑。

  1. 联合分布:已观测到 nn 个点 (X,y)(X, \mathbf{y}),想预测新点 x∗\mathbf{x}_* 处的值。把已知值和未知值拼在一起,联合分布是:

[yf∗]∼N(0,[K+σn2Ik∗k∗⊤k(x∗,x∗)])\begin{bmatrix} \mathbf{y} \\ f_* \end{bmatrix} \sim \mathcal{N}\left(\mathbf{0}, \begin{bmatrix} K + \sigma_n^2 I & \mathbf{k}_* \\ \mathbf{k}_*^\top & k(\mathbf{x}_*, \mathbf{x}_*) \end{bmatrix}\right)

其中 k∗=[k(x1,x∗),…,k(xn,x∗)]⊤\mathbf{k}_* = [k(\mathbf{x}_1, \mathbf{x}_*), \dots, k(\mathbf{x}_n, \mathbf{x}_*)]^\top 是新点与所有已知点的核值向量,σn2\sigma_n^2 是观测噪声方差。

  1. 条件分布(后验):由多元高斯的条件分布公式(这是纯线性代数,不是近似),新点的预测分布仍然是高斯:

μ(x∗)=k∗⊤(K+σn2I)−1y\mu(\mathbf{x}_*) = \mathbf{k}_*^\top (K + \sigma_n^2 I)^{-1} \mathbf{y}

σ2(x∗)=k(x∗,x∗)−k∗⊤(K+σn2I)−1k∗\sigma^2(\mathbf{x}_*) = k(\mathbf{x}_*, \mathbf{x}_*) - \mathbf{k}_*^\top (K + \sigma_n^2 I)^{-1} \mathbf{k}_*

直觉解读:均值 μ(x∗)\mu(\mathbf{x}_*) 是已知值 y\mathbf{y} 的加权平均,权重是新点到各已知点的核相似度——离哪个已知点越近,该点的值贡献越大;方差 σ2(x∗)\sigma^2(\mathbf{x}_*) 等于先验方差减去一个正项——离已知点越近,减去的越多,方差越小。这就是”已知点附近不确定度低、远处不确定度高”的数学根源。注意 (K+σn2I)−1(K + \sigma_n^2 I)^{-1} 只需计算一次,每次迭代只需重新算 k∗\mathbf{k}_*,计算复杂度为 O(n)O(n)(不计矩阵求逆)。

期望改进(Expected Improvement, EI)是 BO 中最经典、最常用的采集函数,它的推导展示了”探索 vs. 利用”如何自然地从数学中涌现。

  1. 定义改进量:设当前已观测到的最优值为 f∗=min⁡if(xi)f^* = \min_i f(\mathbf{x}_i)(假设是最小化问题)。在候选点 x\mathbf{x} 处,改进量(improvement)定义为:

I(x)=max⁡(f∗−f(x),  0)I(\mathbf{x}) = \max(f^* - f(\mathbf{x}),\; 0)

即:如果新点比当前最优更好,改进量就是提升幅度;否则为零。

  1. 对改进量取期望:GP 告诉我们 f(x)∼N(μ(x),σ2(x))f(\mathbf{x}) \sim \mathcal{N}(\mu(\mathbf{x}), \sigma^2(\mathbf{x})),所以 I(x)I(\mathbf{x}) 是一个随机变量。EI 就是它的期望值:

EI(x)=E[I(x)]=∫−∞f∗(f∗−f)⋅N(f;μ,σ2) df\text{EI}(\mathbf{x}) = \mathbb{E}[I(\mathbf{x})] = \int_{-\infty}^{f^*} (f^* - f) \cdot \mathcal{N}(f; \mu, \sigma^2)\, df

  1. 解析解:这个积分有优美的闭式解(closed-form solution,即可以写出精确公式,不需要数值积分):

EI(x)=(f∗−μ(x))⋅Φ(Z)+σ(x)⋅φ(Z),Z=f∗−μ(x)σ(x)\text{EI}(\mathbf{x}) = (f^* - \mu(\mathbf{x})) \cdot \Phi(Z) + \sigma(\mathbf{x}) \cdot \varphi(Z), \quad Z = \frac{f^* - \mu(\mathbf{x})}{\sigma(\mathbf{x})}

其中 Φ(⋅)\Phi(\cdot) 和 φ(⋅)\varphi(\cdot) 分别是标准正态分布的累积分布函数(CDF)和概率密度函数(PDF)。

  1. 两项的意义:第一项 (f∗−μ)⋅Φ(Z)(f^* - \mu) \cdot \Phi(Z) 是利用项——当预测均值 μ\mu 远低于当前最优 f∗f^* 时(即这个点大概率很好),这项很大;第二项 σ⋅φ(Z)\sigma \cdot \varphi(Z) 是探索项——当不确定度 σ\sigma 很大时(即这个区域还没探过),这项很大。EI 自动平衡两者,这正是它比 PI(改进概率,只看 Φ(Z)\Phi(Z) 这一项)更稳定的原因。

Regret Bound:贝叶斯优化的理论保证

Section titled “Regret Bound:贝叶斯优化的理论保证”

工程上我们需要回答一个问题:BO 真的比随机搜索好吗?理论分析通过 regret bound(遗憾界) 给出了肯定答案。

  • 累积遗憾(Cumulative Regret):设 TT 次迭代,每次选点 xt\mathbf{x}_t,真实最优点 x∗\mathbf{x}^*,则累积遗憾定义为 RT=∑t=1T[f(x∗)−f(xt)]R_T = \sum_{t=1}^{T} \left[f(\mathbf{x}^*) - f(\mathbf{x}_t)\right]。它衡量”如果一开始就知道最优解,能省多少损失”。
  • 收敛速度:Srinivas et al. (2010) 证明了使用 GP-UCB(上置信界)采集函数时,在温和条件下累积遗憾以高概率满足 RT=O(T⋅γT⋅log⁡T)R_T = O(\sqrt{T \cdot \gamma_T \cdot \log T}),其中 γT\gamma_T 是最大信息增益(maximum information gain),取决于核函数——对 RBF 核 γT=O((log⁡T)d+1)\gamma_T = O((\log T)^{d+1})。
  • 平均遗憾趋于零:平均遗憾 RT/T=O(γTlog⁡T/T)R_T / T = O(\sqrt{\gamma_T \log T / T}),当 T→∞T \to \infty 时趋于零,意味着 BO 的采样策略渐近地收敛到全局最优。
  • 实际含义:这些理论结果说明,即使目标函数是任意的(不需要凸性、不需要光滑性),只要它能在 GP 的核函数假设下被合理建模,BO 就能保证找到越来越好的解——这是网格搜索和随机搜索所没有的理论保证。

以下代码不依赖外部 BO 库,仅用 numpy 和 scipy 手写高斯过程 + 期望改进(EI)采集函数,最小化一个 1D 目标函数。核心流程展示了代理模型拟合和采集函数优化的完整闭环:

import numpy as np
from scipy.optimize import minimize
# 目标函数(黑盒):有多个局部最优的全局优化测试函数
def f(x):
return (x - 2) ** 2 + np.sin(3 * x)
# 高斯过程:RBF 核,返回预测均值和标准差
def gp_predict(X_train, y_train, X_test, length=1.0, noise=1e-6):
K = np.exp(-0.5 * (X_train[:, None] - X_train[None, :]) ** 2 / length ** 2)
K += noise * np.eye(len(K))
K_s = np.exp(-0.5 * (X_train[:, None] - X_test[None, :]) ** 2 / length ** 2)
K_inv = np.linalg.inv(K)
mu = K_s.T @ K_inv @ y_train # 后验均值
sigma = np.sqrt(np.maximum(1.0 - np.sum(K_s.T @ K_inv * K_s.T, axis=1), 1e-10))
return mu, sigma
# 期望改进 EI 采集函数
def acquisition(mu, sigma, y_best):
improvement = y_best - mu # 最小化问题中的改进量
return np.where(sigma > 0, improvement + sigma, 0) # 简化版 EI
# 贝叶斯优化主循环
X_train = np.array([0.0, 1.0, 3.0, 5.0]) # 初始采样点
y_train = f(X_train)
for i in range(10): # 10 次迭代
X_test = np.linspace(0, 6, 200)
mu, sigma = gp_predict(X_train, y_train, X_test)
ei = acquisition(mu, sigma, y_train.min()) # 计算采集函数值
x_next = X_test[np.argmax(ei)] # 选 EI 最大的点
X_train = np.append(X_train, x_next)
y_train = np.append(y_train, f(x_next)) # 评估真实函数
print(f"最优值 ≈ f({X_train[np.argmin(y_train)]:.3f}) = {y_train.min():.4f}")

在生产环境中,推荐直接使用成熟的 BO 框架。以下是用 Optuna(默认 TPE 采样器)调优一个 PyTorch 模型学习率的典型代码模式:

import optuna
def objective(trial):
# 定义搜索空间
lr = trial.suggest_float("lr", 1e-5, 1e-1, log=True)
batch_size = trial.suggest_categorical("batch_size", [32, 64, 128, 256])
dropout = trial.suggest_float("dropout", 0.0, 0.5)
# ... 用这些超参数训练模型,返回验证集指标
val_loss = train_and_evaluate(lr, batch_size, dropout)
return val_loss # 最小化验证损失
study = optuna.create_study(direction="minimize")
study.optimize(objective, n_trials=50, n_jobs=4) # n_jobs=4 支持并行评估
print(f"最佳参数:{study.best_params}")

Optuna 的 TPE(树状 Parzen 估计器)是一种非参数代理模型,比 GP 更适合高维和混合类型的搜索空间(连续 + 离散参数混合)。

  • 何时用贝叶斯优化:核心判断标准是”单次评估有多贵”。如果评估一次目标函数需要 10 分钟以上(如训练一个深度学习模型、运行 CFD 仿真、做一次湿实验),贝叶斯优化几乎总是值得的。如果评估极快(如简单数学函数),网格搜索或随机搜索就够了。经验法则:当单次评估 ≥ 1 分钟、评估次数预算 ≤ 200 次时,BO 的性价比最高。
  • 高斯过程的核函数选择:RBF 核(高斯核)是最常用的默认选择,适合光滑函数;Matern 核更适合不太光滑的函数(如带噪声的实验数据)。Matern 5/2 是一个很好的默认选择——它比 RBF 更不容易过度平滑。核函数的超参数(长度尺度等)可通过最大化边际似然(marginal likelihood,也叫 type-II MLE)自动优化,不需要手动调参。
  • 采集函数的选择:期望改进(EI)是最常用且最稳定的采集函数,平衡探索与利用。PI(改进概率)偏保守,容易陷入局部最优;UCB(上置信界)通过探索参数 β\beta 灵活控制探索-利用权衡,适合理论分析。Thompson Sampling(汤普森采样)在理论上优雅且在高维场景中表现好——它从 GP 后验中随机采样一条函数实现,选该函数的最优点,天然实现了探索-利用的随机平衡。
  • 高维是难点:标准 GP 在超过 20 维时效果急剧下降——高维空间中”距离”失去区分度(“维度灾难”),GP 的核假设不再成立。降维技巧(如 TPE 的树状结构、SAAS 高斯过程、随机嵌入)是高维贝叶斯优化的关键。2024 年大规模应用中,TuRBO(Trust Region Bayesian Optimization,信赖域贝叶斯优化) 和 SAAS(Sparse Axis-Aligned Subspace,稀疏轴对齐子空间)先验 已成为处理高维 BO 问题的标准武器。
  • 并行评估= 标准贝叶斯优化是串行的(一次只推荐一个点),但实际中常有多个 GPU 或计算节点可用。q-EI(q-Expected Improvement)、Kriging Believer(克里金信徒,幻想未来观测值)、Constant Liar 等并行采集策略允许同时推荐多个点,充分利用并行计算资源。Optuna 的 n_jobs 参数、BoTorch 的 batch acquisition 都基于这类思路。
  • 与随机搜索对比:Bergstra & Bengio (2012) 的研究表明随机搜索在高维空间中出奇有效(因为许多超参数实际不重要,随机采样就能覆盖)。贝叶斯优化在低维(小于 10 维)且评估昂贵时优势最明显。一个实用策略:先用随机搜索快速跑 20-30 次缩小搜索空间,再切换到 BO 精细搜索。
  • 噪声目标函数= 如果目标函数有随机性(如 mini-batch 训练的验证精度),GP 需要显式建模观测噪声。通过在核矩阵对角线加入噪声项 σn2I\sigma_n^2 I,GP 会自动对重复观测取平均,避免被噪声误导。对极强噪声场景,可使用异方差 GP(heteroscedastic GP,方差随输入变化的 GP)或多保真度方法(见下文)。详见贝叶斯推断中关于不确定性建模的讨论。
  • 多保真度优化(Multi-Fidelity BO):当你有多个精度的评估方式时(如训练 1 epoch 的快速近似 vs. 训练 100 epoch 的完整结果),多保真度 BO 利用廉价低保真度评估筛选掉差的配置,只对有希望的配置做昂贵的高保真度评估。典型方法包括 BOHB(BO + Hyperband)、MF-GP-UCB 等,能在相同预算下多探索 3-10 倍的配置。
  • 成本感知优化:现实中不同评估点的代价可能不同(如训练大 batch 比小 batch 慢)。成本感知 BO(cost-aware BO)在采集函数中显式建模评估代价,优先推荐”性价比高”的点,而非单纯追求改进最大。
  • 深度学习超参数调优:这是贝叶斯优化最广泛的应用场景——学习率、批量大小、正则化系数、网络层数等超参数的搜索空间巨大,每次评估需要训练完整模型。Google Vizier、Optuna、Hyperopt 等工具都以贝叶斯优化为核心算法。详见自动化机器学习。
  • LLM 超参数调优(2024-2025 关键应用):大语言模型(LLM)的训练成本极高——一次完整的预训练评估动辄消耗数千 GPU 小时,传统网格搜索完全不可行。Meta 用 Ax/BoTorch 平台优化 Llama 系列模型的训练超参数(学习率调度、批量大小、正则化等),将搜索效率提升了数倍。这是 BO 在工业界最昂贵的优化场景之一,每次评估成本可达数万美元。
  • AutoML 与神经架构搜索:Google 的 AutoML Vision、Cloud ML 使用贝叶斯优化自动搜索模型架构和超参数配置,将”调参”这一高度依赖经验的工作自动化。Auto-sklearn 和 TPOT 也将 BO 作为核心搜索策略。
  • A/B 测试与在线实验:网页设计、推荐策略、广告创意等在线实验中,每次实验的代价是时间和流量。贝叶斯优化可高效搜索最佳策略配置,减少实验次数和机会成本。Meta 的 Ax 驱动的 A/B 测试平台日均运行数万实验,是全球规模最大的 BO 产业化应用之一。Netflix 在推荐系统调优中也大量使用此技术。
  • 材料科学与自主实验(2024-2025 里程碑):新材料合成和药物活性测试的实验成本极高(每次实验数天到数周)。贝叶斯优化指导自主实验系统(self-driving labs,“自驶实验室”)——机器人自动合成、测试、用 BO 决定下一批实验,用最少的实验次数找到最优配方。2024 年多个研究团队报告了 BO 驱动的 self-driving lab 在电池材料、催化剂、合金发现中的突破性进展,将传统数月的材料筛选缩短到数天。MIT、丰田研究院、以及加拿大的 Acceleration 等机构是这一方向的领先者。
  • 机器人与控制系统:机器人步态参数、控制器的 PID 参数等需要在线调试,每次试错成本高(可能损坏硬件)。贝叶斯优化以最少的试错次数找到最优控制策略——Boston Dynamics 等公司在足式机器人步态优化中使用了 BO。
  • 强化学习的超参数调优:RL 算法(如 PPO、SAC)对超参数极为敏感,且每次训练需要数百万步交互。贝叶斯优化在有限的训练预算内找到最佳超参数配置,显著提升 RL 模型的性能和稳定性。详见强化学习里程碑。

贝叶斯优化在 2024-2025 年迎来了几个重要发展方向,核心驱动力是大语言模型(LLM)的崛起使优化问题的”单次评估成本”暴涨到前所未有的量级,倒逼 BO 方法在大规模、高维、多保真度场景上快速进化:

  • BO 驱动 LLM 训练调优:Meta 公开分享了使用 Ax/BoTorch 平台优化 Llama 系列模型训练超参数的实践经验。LLM 预训练的超参数搜索是 BO 迄今面临的最昂贵优化场景——单次评估可能消耗数千 GPU 小时、成本数万美元。BO 的极高样本效率在这里是不可替代的。
  • TuRBO(Trust Region BO)大规模应用:Trippa 等人于 2020 年提出的 TuRBO 方法在 2024 年被大规模采用。核心思想是在高维空间中维护多个局部信赖域(trust region,即局部搜索子区域),在每个信赖域内部独立做低维 BO,动态扩缩信赖域——成功时扩大、失败时缩小或分裂。这巧妙地绕过了”标准 GP 在高维失效”的瓶颈,在数百维的超参数空间中仍然有效。
  • SAAS(Sparse Axis-Aligned Subspace)先验:Eriksson 等人提出的方法在 BoTorch 中实现,通过在 GP 的长度尺度参数上施加马蹄先验(horseshoe prior,一种诱导稀疏性的贝叶斯先验),自动识别出哪些维度重要、哪些维度可以忽略。效果上相当于让 GP 自动做特征选择,大幅提升高维 BO 的效果。
  • BO + LLM 混合优化:2024 年出现的新方向——使用 LLM 来生成搜索空间定义、编码先验知识、甚至建议初始采样点,然后交给 BO 的序贯搜索做精细优化。LLM 的语义理解能力 + BO 的数学严谨性形成互补:LLM 知道”学习率通常在 1e-5 到 1e-2 之间”这类经验,BO 知道如何在这个区间里高效搜索。
  • 多保真度 BO 的进展:在计算预算有限时,多保真度方法(如 BOHB、mfBoTorch)利用不同精度的评估信号——例如用少量训练步数的快速实验筛掉差的配置,再对候选配置做完整评估。2024 年的方法进展集中在自适应保真度分配(adaptive fidelity allocation)上,根据配置的潜力动态决定投入多少计算预算。
  • Ax 平台的产业化规模:Meta 的 Ax 实验优化平台已成为工业界最大规模的 BO 部署——日均运行数万实验,覆盖 A/B 测试、系统调优、ML 超参数搜索等场景。Ax 团队在 2024 年分享了大规模 BO 系统的工程经验,包括如何在高并发下管理 GP 拟合、如何处理异构实验数据。
  • BO 与可微分编程结合:一些探索性工作将 BO 与自动求导结合——当目标函数可微时(如某些神经网络训练指标),利用梯度信息加速 GP 拟合和采集函数优化,减少 BO 的迭代次数。
类库语言说明
OptunaPython当前最流行的超参数优化框架,默认使用 TPE(树状 Parzen 估计器)采样器,也支持 CMA-ES 和 GP
HyperoptPython早期流行的 BO 库,基于 TPE 算法,支持 Spark 并行优化
scikit-optimizePythonscikit-learn 生态的贝叶斯优化库,提供 GP-based BO,API 与 sklearn 风格一致
BoTorchPythonMeta(Facebook)开源的贝叶斯优化库,基于 PyTorch 的 GP 模型,支持高维、SAAS 先验和批量 BO,是学术前沿方法的首选实现
AxPythonMeta 开源的实验优化平台,基于 BoTorch,提供更高级别的 API 和自适应实验管理,支持大规模 A/B 测试和 ML 调优
GPyOptPython谢菲尔德大学开源的 GP 优化库,提供灵活的模块化 BO 工作流
Google VizierPython/GoGoogle 内部超参数调优平台(云版为 Vertex AI Vizier),服务了 Google 大量机器学习实验
TriestePythonSecondmind 开发的 BO 库,基于 TensorFlow Probability,强调模块化和可研究性
术语英文解释
贝叶斯优化Bayesian Optimization (BO)用概率代理模型和采集函数高效搜索昂贵黑盒函数最优值的序贯优化方法
代理模型Surrogate Model对真实目标函数建立的概率近似模型,常用高斯过程,提供均值和方差预测
高斯过程Gaussian Process (GP)一种随机过程,任意有限个点的联合分布服从高斯分布,提供预测均值和不确定度
采集函数Acquisition Function根据代理模型的预测均值和方差决定下一个评估点的函数,平衡探索与利用
期望改进Expected Improvement (EI)最常用的采集函数,度量新点改进当前最优值的期望量,有闭式解析解
改进概率Probability of Improvement (PI)采集函数之一,度量新点优于当前最优的概率,偏保守易陷入局部最优
上置信界Upper Confidence Bound (UCB)采集函数之一,通过均值加减方差加权和平衡探索与利用,理论分析友好
树状 Parzen 估计器Tree-structured Parzen Estimator (TPE)Optuna 默认采样器,将超参数分为”好”和”坏”两组分别建模,适合高维搜索
核函数Kernel Function高斯过程中度量输入点相似度的函数,RBF 核和 Matern 核是最常用选择
长度尺度Length Scale核函数的关键超参数,控制相似度随距离衰减的速度,影响 GP 拟合的平滑程度
边际似然Marginal Likelihood概率框架下数据出现的概率,最大化边际似然可自动优化 GP 的核超参数
探索与利用Exploration vs. Exploitation优化中的核心权衡:探索未知区域寻求潜在改进 vs. 利用已知最优区域深入搜索
Thompson 采样Thompson Sampling一种概率匹配采集策略,从代理模型后验中采样函数并选其最优点,适合高维
信赖域贝叶斯优化Trust Region BO (TuRBO)高维 BO 方法,在多个局部信赖域中独立做低维 BO,动态扩缩信赖域
稀疏轴对齐子空间先验SAAS Prior诱导 GP 长度尺度稀疏的贝叶斯先验,自动做特征选择以处理高维 BO
累积遗憾Cumulative RegretTT 次迭代中每次选择与真实最优差距的总和,用于衡量优化算法的理论性能
最大信息增益Maximum Information Gain (γT\gamma_T)GP 在 TT 次观测后能获得的最大信息量,决定 BO 的 regret bound 收敛速度
多保真度优化Multi-Fidelity BO利用不同精度的评估信号,用廉价低保真度评估筛选、昂贵高保真度评估确认的 BO 变体
  • Jones, Schonlau & Welch,「Efficient Global Optimization of Expensive Black-Box Functions」(Journal of Global Optimization, 1998):贝叶斯优化的里程碑论文,提出 EI(期望改进)采集函数和 Kriging 代理模型的标准框架,奠定了现代 BO 的工程范式,引用量极高。
  • Snoek, Larochelle & Adams,「Practical Bayesian Optimization of Machine Learning Hyperparameters」(NeurIPS 2012):将贝叶斯优化系统应用于深度学习超参数调优的经典论文,证明了 BO 在 ML 超参数优化中显著优于网格搜索和随机搜索。
  • Mockus,「Bayesian Approach to Global Optimization」(Kluwer Academic, 1989):贝叶斯优化的理论奠基著作,首次系统性地提出基于高斯过程代理的序贯全局优化框架。
  • Shahriari et al.,「Taking the Human Out of the Loop: A Review of Bayesian Optimization」(Proceedings of the IEEE, 2016):来自 Oxford 的权威综述论文,全面梳理了 BO 的理论、采集函数变体和工程实践,入门 BO 的首选文献。
  • Srinivas et al.,「Gaussian Process Optimization in the Bandit Setting: No Regret and Experimental Design」(ICML 2010):GP-UCB 的理论奠基论文,证明了 BO 的 regret bound,是理解 BO 理论保证的必读文献。
  • Eriksson et al.,「Scalable Global Optimization via Local Bayesian Optimization」(NeurIPS 2019):TuRBO(信赖域 BO)的原始论文,解决了高维 BO 的核心难题,是当前大规模 BO 实践的基础。
  • Eriksson & Jankowiak et al.,「High-Dimensional Bayesian Optimization with Sparse Axis-Aligned Subspaces」(ICML 2021):SAAS 先验的原始论文,为高维 BO 提供了优雅的贝叶斯特征选择方案。
  • Garnelo et al.,「Neural Processes: Continuous Stochastic Functions」(ICML Workshop 2018):将神经网络与高斯过程结合的神经过程模型,解决 GP 在大数据集上的可扩展性问题,是代理模型的前沿方向。
  • Frazier,「A Tutorial on Bayesian Optimization」(arXiv, 2018):面向工程实践者的 BO 教程,从 GP 到 EI 到并行优化,配合清晰的数学推导和实用建议,适合快速上手。
  • Bergstra et al.,「Algorithms for Hyper-Parameter Optimization」(NeurIPS 2011):TPE(树状 Parzen 估计器)的原始论文,提出适合高维条件空间的自适应采样策略,是 Optuna 默认采样器的理论基础。
  • Rasmussen & Williams,「Gaussian Processes for Machine Learning」(MIT Press, 2006):GP 的权威教材,俗称”GPMLE 圣经”,免费在线获取,是理解 GP 代理模型数学基础的终极参考。