ALAS: 可加可学习 Alpha-Stable 核用于灵活贝叶斯优化

arXiv cs.LG 论文

摘要

本文介绍了 ALAS,一种灵活的 Gaussian Process 核族,它从数据中学习稳定性参数以适应平滑度,同时捕捉平滑趋势和尖锐不规则性,具有适用于高维的可分离变体以及关于信息增益的理论保证。

arXiv:2607.18282v1 公告类型: 新 摘要: 贝叶斯优化广泛应用于昂贵的黑箱优化,但其成功通常依赖于选择与目标未知结构匹配的核。在这项工作中,我们提出了 ALAS,一种灵活的 Gaussian Process 核族,由对称 $\alpha$-稳定谱分量构建。通过学习稳定性参数 $\alpha$,ALAS 根据数据调整其有效平滑度,同时捕捉平滑趋势和尖锐不规则性。我们提出了两种参数化:ALAS,具有联合谱调制的单一平稳分量,以及 ALAS-Sep,一种可分离变体,学习逐维度尾部行为以提高在近似可分解目标上的鲁棒性。在标准基准和真实世界替代函数上的实验表明,ALAS 在多种设置下表现出强大且鲁棒的性能。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:18

# ALAS: 加法可学习Alpha-Stable核用于灵活贝叶斯优化
来源:https://arxiv.org/html/2607.18282

###### 摘要

贝叶斯优化广泛用于昂贵的黑箱优化,但其成功通常取决于选择与目标未知结构相匹配的核。在这项工作中,我们提出了 ALAS,一个灵活的 Gaussian Process 核族,由对称的 α-稳定谱分量构建而成。通过学习稳定性参数 α,ALAS 从数据中调整其有效平滑度,既能捕捉平滑趋势,也能捕捉尖锐的不规则性。我们提出了两种参数化:ALAS,一个具有联合谱调制的单一平稳分量;以及 ALAS-Sep,一个可分离变体,学习每个维度的尾部行为,以提高在近似可分解目标上的鲁棒性。在标准基准和真实世界代理上的实验表明,ALAS 在各种设置下都具有强大且鲁棒的性能。

贝叶斯优化,高斯过程,谱核

## 1 引言

在科学和工程中,评估预算紧张的黑箱优化问题普遍存在。贝叶斯优化 (BO) 通过拟合高斯过程 (GP) 代理并使用采集函数选择评估点来解决这一问题。在 BO 中,GP 核是归纳偏差的主要来源,通常主导样本效率。然而,广泛使用的平稳核 (SE/Matérn/RQ/周期性) 强加了一种固定的平滑度概念,这可能导致在具有多尺度变化、尖锐局部不规则性或长程依赖的目标上欠拟合。

通过 Bochner 定理 (Stein,1999 (https://arxiv.org/html/2607.18282#bib.bib13)) 学习核的谱密度是一种丰富平稳核的原则性方法。谱混合 (SM) 核 (Wilson and Adams,2013 (https://arxiv.org/html/2607.18282#bib.bib4)) 将谱密度 S(ω) 建模为高斯混合,提供闭式协方差和强大的实证结果。尽管后续变体进一步扩展了这种在 BO 中的灵活性 (Remes et al.,2017 (https://arxiv.org/html/2607.18282#bib.bib10)),但仍然存在两个挑战。首先,高斯谱分量在频率上是轻尾的,因此捕捉重尾或强低频结构可能需要许多分量。其次,随着维度的增长,这些模型更难可靠地拟合,其有效复杂性更难表征,使得基于特征值衰减和信息增益的 BO 分析不那么透明。

**本文的工作。** 我们提出了 ALAS,一个可学习的 α-稳定核族。ALAS 由一个对称 α-稳定 (SαS) 谱分量构建,其中稳定性参数 α ∈ (0,2] 直接控制谱尾的重尾程度。通过 GP 边际似然从数据中学习 α,ALAS 从类似高斯的行为 (α=2) 平滑过渡到重尾区域 (α<2),包括 Cauchy 标志点 (α=1)。这使得代理能够表示平滑趋势和尖锐变化,而无需手动选择固定的平滑度核类。为了更好地处理高维输入,我们引入了 ALAS-Sep,一个可分离构造,将一维 ALAS 分量跨坐标求和。ALAS-Sep 实现了逐维度自适应:每个坐标学习自己的尾部参数 α_j,而学习到的分量尺度反映了维度相关性。在理论方面,我们将谱尾与 Mercer 特征值衰减联系起来,得到由 α 控制的显式信息增益和遗憾率。特别地,在高斯边界处,我们恢复了一维中经典的对数多项式信息增益。

我们总结了本文的主要贡献如下:

*   **可学习的 α-稳定核族。** 我们提出了 ALAS,一个基于对称 α-稳定谱分量的平稳 GP 核族。学习稳定性参数 α 提供了一种数据驱动的方式调整谱尾行为和有效正则性,范围从近高斯 (α=2) 到重尾区域 (α<2),并在单一核族内同时捕捉平滑结构和尖锐变化。
*   **带理论的可分离变体。** 我们引入了 ALAS-Sep,一个可分离构造,将一维 ALAS 分量求和。这种结构化参数化通过让每个维度学习自己的 α_j 同时保留精确 GP 推理,提高了多维度 BO 中的鲁棒性。我们进一步将谱尾行为与 Mercer 特征值衰减联系起来,并为一维分量和可分离变体推导出显式的信息增益和遗憾界。
*   **实证验证。** 我们在从 d=3 到 30 的多种合成和真实世界基准上评估了 ALAS。结果表明了互补的优势:ALAS 在处理强交互的低到中度维度任务时是一个鲁棒的默认选择,而 ALAS-Sep 通过学习维度特定的尾部参数,在更大维度和近似可分解目标上最为有效。在这些设置下,ALAS 相对于竞争基线实现了强大且鲁棒的性能。

## 2 相关工作

#### BO 中的平稳先验

贝叶斯优化 (BO) 通常使用平稳 GP 先验对目标函数建模。常见选择包括平方指数 (SE)、Matérn 或有理二次 (RQ) 核,通常结合自动相关性确定 (ARD) 来捕获不同长度尺度 (Rasmussen and Williams,2006 (https://arxiv.org/html/2607.18282#bib.bib3); Srinivas et al.,2009 (https://arxiv.org/html/2607.18282#bib.bib5); Snoek et al.,2012 (https://arxiv.org/html/2607.18282#bib.bib7); Shahriari et al.,2015 (https://arxiv.org/html/2607.18282#bib.bib9))。这些核对于合理平滑、单尺度的目标效果良好,但它们强加了固定的平滑度假设和特定形式的谱衰减。因此,当真实目标表现出多尺度结构、尖锐局部变化或长程依赖时,它们可能效率低下。

已经探索了两个主要方向来提高灵活性。第一个方向学习更灵活的输入表示或协方差结构,例如通过深度核学习、深度 GP、输入扭曲或非平稳核 (Wilson et al.,2016 (https://arxiv.org/html/2607.18282#bib.bib2); Damianou and Lawrence,2013 (https://arxiv.org/html/2607.18282#bib.bib8); Snoek et al.,2014 (https://arxiv.org/html/2607.18282#bib.bib38); Paciorek and Schervish,2003 (https://arxiv.org/html/2607.18282#bib.bib39))。第二个方向,也是我们所遵循的,保持平稳核结构,但使用 Bochner 定理直接学习谱密度。这包括谱混合核及其变体,这些在 BO 中最近已被探索 (Wilson and Adams,2013 (https://arxiv.org/html/2607.18282#bib.bib4); Remes et al.,2017 (https://arxiv.org/html/2607.18282#bib.bib10))。我们的工作通过引入可学习的 α-稳定谱分量和可分离变体 (ALAS-Sep) 扩展了这种谱方法,以提高多维 BO 中的鲁棒性。

#### 谱核学习

谱核学习源于 Bochner 定理,该定理将任何平稳核表示为谱密度 S(ω) 的傅里叶变换 (Stein,1999 (https://arxiv.org/html/2607.18282#bib.bib13))。谱混合 (SM) 核用高斯混合逼近该密度,使其能够以闭式协方差捕获复杂模式 (Wilson and Adams,2013 (https://arxiv.org/html/2607.18282#bib.bib4))。相关方法探索了广义谱形状 (Samo and Roberts,2015 (https://arxiv.org/html/2607.18282#bib.bib19)) 或稀疏逼近以提高效率 (Lázaro-Gredilla et al.,2010 (https://arxiv.org/html/2607.18282#bib.bib20); Jang et al.,2017 (https://arxiv.org/html/2607.18282#bib.bib21))。然而,一个关键限制仍然存在:高斯谱分量在频率上是轻尾的,因此匹配粗糙或重尾行为可能需要许多混合分量。

#### 重尾先验

提高鲁棒性的一种常见方法是用更重尾的随机过程替换 GP 先验,例如 Student-t 过程 (Shah et al.,2014 (https://arxiv.org/html/2607.18282#bib.bib14))。最近的工作也研究了贝叶斯神经网络和非参数模型中的重尾先验 (Fortuin et al.,2021 (https://arxiv.org/html/2607.18282#bib.bib40); Loría and Bhadra,2023 (https://arxiv.org/html/2607.18282#bib.bib42); Agapiou and Castillo,2024 (https://arxiv.org/html/2607.18282#bib.bib41))。前人工作也研究了 α-稳定过程,其中稳定性参数 α ∈ (0,2] 直接控制尾部重尾程度 (Samorodnitsky and Taqqu,1994 (https://arxiv.org/html/2607.18282#bib.bib22))。该族包括两个著名的标志点:α=2 恢复高斯情况,而 α=1 恢复柯西情况。在核设置中,柯西情况对应于洛伦兹谱和指数平稳协方差 (Nolan,2020 (https://arxiv.org/html/2607.18282#bib.bib31); Rahimi and Recht,2007 (https://arxiv.org/html/2607.18282#bib.bib35))。我们的方法是独特的:我们保留 GP 框架以保持可处理的推理,但对核谱使用 α-稳定分量建模,并通过边际似然学习 α,从而使核从数据中自适应其有效正则性。

#### 特征值衰减、信息增益和 BO 理论

GP 遗憾界通常用最大信息增益 γ_T 来表示,该量受核的 Mercer 特征值衰减的控制 (Srinivas et al.,2012 (https://arxiv.org/html/2607.18282#bib.bib6); Chowdhury and Gopalan,2017 (https://arxiv.org/html/2607.18282#bib.bib27))。对于平稳核,特征值的衰减反映了谱密度的尾部行为。具体来说,高斯谱导致快速的特征值衰减,而多项式谱尾导致较慢的衰减 (Widom,1963 (https://arxiv.org/html/2607.18282#bib.bib16))。这激发了我们的设计:虽然更重的谱尾可以增加理论复杂性,但我们的可分离构造 (ALAS-Sep) 通过将核跨维度分解来降低这一成本 (Kandasamy et al.,2015 (https://arxiv.org/html/2607.18282#bib.bib24))。我们为 ALAS 推导出了显式的遗憾界。特别地,在高斯边界 α=2 处,我们恢复了标准的对数多项式速率。

## 3 预备知识

我们研究在紧致域 X ⊂ R^d 上最大化未知目标函数 f: X → R 的贝叶斯优化 (BO)。我们通过累积遗憾 R_T := Σ_{t=1}^T (f(x^⋆) - f(x_t)) 量化性能,其中 x^⋆ ∈ arg max_{x∈X} f(x)。

### 3.1 高斯过程

高斯过程 (GP) 先验 f ∼ GP(0, k) 由协方差核 k 指定。给定带噪声的观测 D_n = {(x_i, y_i)}_{i=1}^n,其中 y_i = f(x_i) + ε_i 且 ε_i ∼ N(0, σ²),在 x 处的后验是高斯分布:

μ_n(x) = k_n(x)^⊤ (K_n + σ²I)^{-1} y_n,      (1)

σ_n²(x) = k(x,x) - k_n(x)^⊤ (K_n + σ²I)^{-1} k_n(x),     (2)

其中 K_n 是训练数据上的核矩阵。核超参数通过最大化对数边际似然 (MLL) 来学习:

log p(y_n | X_n, θ) = -½ y_n^⊤ (K_n + σ²I)^{-1} y_n - ½ log |K_n + σ²I| + C.   (3) (4)

### 3.2 平稳核的谱表示

如果 k(x, x') = k(τ) 仅取决于 τ = x - x',则该核是平稳的。根据 Bochner 定理 (Stein,1999 (https://arxiv.org/html/2607.18282#bib.bib13)),平稳核由非负谱测度表征。

###### 定理 3.1 (Bochner 定理)。R^d 上的连续函数 k(τ) 是正定的当且仅当它是 R^d 上有限非负测度 μ 的傅里叶变换:

k(τ) = ∫_{R^d} e^{i2π ω^⊤ τ} dμ(ω).      (5)

当谱测度具有密度时,我们记 dμ(ω) = S(ω) dω 并称 S(ω) 为谱密度。这种对偶性将核设计映射到谱密度建模。当 ∥ω∥ → ∞ 时 S(ω) 的尾部行为控制着 GP 样本路径的有效平滑度。两个例子是:

*   **高斯衰减:** S(ω) ∝ e^{-c∥ω∥²}。这意味着样本路径是无限平滑的,滤除了高频变化。
*   **多项式衰减:** S(ω) ∝ (1 + ∥ω∥²)^{-ν - d/2}。这允许对有限平滑函数进行建模,其中粗糙度由 ν 控制。

现有方法 (Wilson and Adams,2013 (https://arxiv.org/html/2607.18282#bib.bib4)) 使用高斯混合逼近 S(ω),这继承了超指数衰减率。然而,这意味着无限的样本路径平滑度,并且通常难以捕捉粗糙特征或重尾谱行为。

### 3.3 Mercer 谱与信息增益

我们的遗憾分析遵循标准的 GP-UCB 框架,其中关键复杂性度量是最大信息增益 γ_T。为了将平稳核的谱尾与 γ_T 联系起来,我们通过核积分算子在紧致域 X 上的 Mercer 特征值衰减来上界 γ_T。

令 ν 为 X 上的有限测度。由于 X 是紧致的且 k 是连续的,相关的积分算子 T_k: L²(X, ν) → L²(X, ν),(T_k g)(x) = ∫_X k(x,z) g(z) dν(z),是紧致的,并允许一个离散的非负谱。

###### 定理 3.2 (Mercer 定理)。存在特征值 {λ_h}_{h=1}^∞ 满足 λ_h ≥ 0 和 L²(X, ν) 中的标准正交特征函数 {φ_h}_{h=1}^∞,使得对所有 x, x' ∈ X,

k(x, x') = Σ_{h=1}^∞ λ_h φ_h(x) φ_h(x').      (6)

#### 最大信息增益

对于方差为 σ² 的含噪声 GP 观测,f 与设计集 A = {x_1, ..., x_T} ⊂ X 上观测之间的互信息为

I(y_A; f_A) = ½ log det(I + σ^{-2} K_A),

相似文章

学习预测性模糊集以用于面向决策的分布鲁棒优化

arXiv cs.LG

提出学习预测性模糊集(LPAS)用于分布鲁棒优化,其中深度上下文模型输出名义情景分布、状态依赖的Wasserstein半径和基础度量,并通过决策损失和校准进行训练。应用于S&P 500数据的投资组合优化,该方法实现了更高的回报和夏普比率,同时相比于固定半径基线减少了保守性。

通过预测梯度催化剂加速多目标贝叶斯优化

arXiv cs.LG

本文介绍了一种通用加速机制,用于多目标贝叶斯优化,该机制利用高斯过程预测梯度作为辅助信号来增强现有的采集函数,从而在有限的评估预算下更快地收敛到全局帕累托集。

高效条件化:伪观测批量贝叶斯优化为何有效及何时失效

arXiv cs.LG

本文为伪观测批量贝叶斯优化提供了一个统一的理论框架,证明了高斯过程(Gaussian processes)能产生不同的批量点,并且像Constant Liar和Kriging Believer这样的常见方法是一个单一条件化机制的实例。它引入了结构多样性诊断(SDD)来测试代理模型兼容性,并在多个基准函数和超参数调优中验证了预测结果。