在线自适应核混合的高斯过程决策制定

arXiv cs.LG 论文

摘要

本文介绍 HACK GPs,这是一种使用专家建议在线学习的方法,用于高斯过程中的核选择,增强在序贯决策任务(如贝叶斯优化和主动学习)中的鲁棒性。

arXiv:2609.19891v1 公告类型:新 摘要:高斯过程(GPs)广泛用作序贯决策问题中黑箱函数的代理,如贝叶斯优化(BO)、水平集估计(LSE)和贝叶斯主动学习(BAL)。GP性能关键依赖于核,标准核在误指定下可能导致次优决策。为解决此问题,我们引入 HACK GPs(Hedge Adaptive Cumulative Kernels),一种将核选择视为专家建议在线学习问题的方法。HACK 将每个候选核视为GP“专家”,并使用 AdaHedge 在线更新专家分布,基于一个作为其拟合函数和与任务目标对齐能力代理的损失。我们提供 HACK 的两个变体:(i)高斯混合(MoG)和(ii)分类抽样。我们建立一般保证,表明在损失间隙条件下,权重集中在最佳核上,得到的采集函数接近最佳专家的采集函数。在实验上,我们观察到与标准核(如平方指数核和Matern-5/2)以及简单集成基线相比,在BO、LSE和BAL中具有鲁棒性能。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:10

# 高斯过程决策中的在线自适应核混合  
来源:https://arxiv.org/html/2609.19891  
**作者**:Mani Tej Sriram(隶属:海得拉巴国际信息技术学院)、Gautam Dasarathy(隶属:亚利桑那州立大学)、Tejas Bodas(隶属:海得拉巴国际信息技术学院)  

###### 摘要  
高斯过程(GP)被广泛用作序列决策问题(如贝叶斯优化(BO)、水平集估计(LSE)和贝叶斯主动学习(BAL))中黑箱函数的代理模型。GP 的性能高度依赖于核函数,而标准核函数在误指定情况下可能导致次优决策。为此,我们提出 HACK GP(Hedge Adaptive Cumulative Kernels),该方法将核选择视为专家建议的在线学习问题。HACK 将每个候选核视为一个 GP "专家",并基于每个专家拟合函数及与任务目标对齐的能力所对应的损失,使用 AdaHedge 在线更新专家权重分布。我们提供了两种 HACK 变体:(i)高斯混合(MoG)和(ii)分类采样。我们证明了通用保证:在损失间隙条件下,权重将集中于最佳核,且所得到的采集函数接近最佳专家的采集函数。实证表明,与标准核函数(如平方指数核和 Matérn-5/2 核)以及简单的集成基线相比,HACK 在 BO、LSE 和 BAL 中均表现出稳健的性能。  

###### 关键词:高斯过程、在线学习、贝叶斯优化、主动学习、水平集估计。  

## 1 引言  
科学、工程和机器学习中的许多实验设置都需要优化和建模具有噪声、评估成本高昂的黑箱函数。高斯过程(GP)因其样本效率和建模不确定性的能力,已成为这些任务的有效选择。其中许多任务本质上是序列化的:在每轮 \(t\),代理模型提出一个输入 \(x_t\),观测到黑箱函数 \(f\) 的带噪评估值 \(y_t\),并在下一次决策前更新其后验。这一模板支撑了贝叶斯优化(BO),旨在有限预算下寻找最大化值 \(x^* = \arg\max_{x \in \mathcal{X}} f(x)\);水平集估计(LSE),旨在恢复超水平集 \(S_h := \{x \in \mathcal{X} : f(x) \geq h\}\);以及贝叶斯主动学习(BAL),通过查询最大程度地减少对目标量的不确定性。GP 非常适合这些场景,因为它能够将后验模型的不确定性估计转化为称为采集函数的采样策略。确保 GP 的质量对于这些任务的可靠性能至关重要。  

GP 的性能由核函数的选择决定,它编码了关于底层函数的假设,例如平滑性、平稳性以及这些现象发生的尺度。核误指定——即这些假设与底层函数不匹配——可能导致不确定性估计校准不良,并在序列决策中产生累积误差。尽管如此,标准核函数(如平方指数核和 Matérn-5/2 核)在实践中经常被使用,即使它们可能不适合当前任务。为解决此问题,我们提出 HACK GP(Hedge Adaptive Cumulative Kernels),这是一种简单的替代方案,通过专家建议的在线学习视角看待核选择。我们将每个候选核视为一个 GP "专家",维护专家的权重分布,并使用 AdaHedge(一种无参数、具有时变学习率的 Hedge 变体)在线更新该分布。专家根据其预测性能的每轮概率损失进行评分,例如负对数似然,可选择性地加入任务相关代理,从而使权重(因此采集策略)能够随时间调整。  

我们将该方法具体化为两种使用模式:(i)混合高斯(MoG)预测分布,通过对每个专家后验加权形成;(ii)分类采样,每轮采样单个核。两者均提供了一种即插即用的过程,逐步降低未对齐核的权重,同时提升合适的核的权重,并且当用户指定的核候选集较小时,仅引入适度的计算开销。为定位我们的方法,接下来我们回顾在基于 GP 的序列决策中解决核误指定和模型不确定性的现有方法。大多数使用 GP 作为代理模型的方法采用标准核函数,这些核函数不一定是为当前函数设计的,例如平方指数核或 Matérn-5/2 核。虽然使用通用核很方便,但当核与拟合函数的性质不匹配时,可能导致任务性能不佳,这种现象称为核误指定。已知当核选择过于通用时,在中高维复杂函数上,BO 等任务可能收敛缓慢。  

早期尝试解决核误指定的方法包括用于 GP 回归的组合核结构搜索,其中使用语法生成可能更好地拟合数据的新核组合。并行工作则侧重于灵活的核族,例如谱混合核,它们能够近似一大类平稳协方差。然而,这些方法通常需要大量数据,其选择标准才能有效区分候选核。一种现代变体通过利用大型语言模型(LLM)的泛化能力来建议和组合核,无需大量样本即可形成一个有效且表达力强的核族。  

集成方法提供了另一种途径,通过维护多个 GP 模型并组合其预测或决策,而不是在整个序列过程中坚持单一核。Roman 等人研究了多种 GP 集成启发式方法。Lu 等人形式化了这一过程,对核应用了贝叶斯模型平均(BMA);Ravishankar 等人将集成方法扩展到核和采集函数。Sandberg 等人将 BMA 应用于一般 GP 先验,同时采用了由 Ziomek 等人引入的消除策略。早期的基于 GP 的 LSE 方法使用置信界启发式方法,Bryan 等人引入了 straddle 算法,在阈值附近采样方差高的点。Gotovos 通过利用 GP-UCB 风格的界形式化了这一点,提供了收敛保证。或者,Ravishankar 等人通过 EI(期望改进)形式化该问题,以缩小与阈值的差距为目标。然而,这些方法依赖于 GP 对黑箱函数的良好指定。为解决潜在的不匹配问题,Zanette 等人提出了一种对模型误指定具有鲁棒性的采集函数 RMILE。基于 GP 的回归主动学习通常使用基于不确定性的采集策略,预测熵是标准选择。另一种选择是 Houlsby 等人提出的贝叶斯主动学习分歧(BALD),它提议最大化预期预测熵减少。为尝试解决 BAL 中的超参数误指定问题,Riis 等人建议对 GP 超参数采用全贝叶斯处理,并提供了其他利用 GP 全贝叶斯性质的采集函数变体。Polyzos 等人使用 BMA 制定了自适应集成 GP 方法以处理核误指定,利用了加权混合的采集函数。  

综上所述,现有方法通过使用更具表达力的核族、模型平均或选择、或使用特定任务的鲁棒采集策略来解决模型误指定问题。HACK 补充了这些方向,将核适应本身视为一个在线专家建议问题,允许候选核的相对重要性在序列决策过程中根据其性能和与任务的对齐程度而演变。  

### 主要贡献:  
- 1. 我们引入 HACK GP,这是一个用于高斯过程序列决策中在线自适应核加权的框架,被构建为有限候选核集合上的专家建议问题。  
- 2. 我们开发了两种实际实例:(i)HACK-MoG,将专家后验预测分布组合成混合高斯预测分布;(ii)HACK-Cat,每轮采样单个核,两者均可与标准采集驱动方法无缝集成。  
- 3. 我们建立了理论保证,证明在损失间隙条件下,专家权重在事后将集中于最佳核,并且这种集中转化为采集函数的接近性。  
- 4. 我们在 BO、LSE 和 BAL 基准测试中实证表明,自适应核加权相较于标准单核和简单集成方法,提高了对核误指定的鲁棒性。  

## 2 背景  
### 2.1 高斯过程  
高斯过程(GP)是一种随机过程,其任何有限个随机变量的集合都服从多元高斯分布。GP 常被用作代理模型,以近似 BO、LSE 和 BAL 中的黑箱函数 \(f\)。GP 由均值函数 \(\mu\) 和由核 \(k(\cdot, \cdot)\) 给出的协方差函数参数化。我们用 GP 先验 \(f(x) \sim \mathcal{GP}\left(\mu(x),\, k(x, x')\right)\) 建模黑箱函数 \(f\)。均值函数 \(\mu(x)\) 提供点 \(x\) 处的均值,而核 \(k(x, x')\) 决定两个输入 \(x\) 和 \(x'\) 处函数值之间的协方差。我们使用带噪观测 \(y_i = f(x_i) + \epsilon_i\) 拟合 GP,其中 \(\epsilon_i \sim \mathcal{N}(0, \sigma_n^2)\)。设 \(\mathcal{D}_t = \{(x_i, y_i) \mid i = 1, 2, \dots, t\}\),\(\mathbf{X} = [x_1, \dots, x_t]^\top\),\(\mathbf{y} = [y_1, \dots, y_t]^\top\)。定义核矩阵 \(K \in \mathbb{R}^{t \times t}\),其中 \(K_{ij} = k(x_i, x_j)\),以及交叉协方差向量 \(k(x, \mathbf{X}) = [k(x, x_1), \dots, k(x, x_t)]\) 和 \(k(\mathbf{X}, x) = k(x, \mathbf{X})^\top\)。令 \(Y_{t+1} = f(x_{t+1}) + \epsilon_{t+1}\) 表示在测试点 \(x_{t+1}\) 处的带噪观测。在基于 \(\mathcal{D}_t\) 调节 GP 后,函数值和带噪观测的后验分布为  

\[
\begin{aligned}
f(x_{t+1}) \mid \mathcal{D}_t, x_{t+1} &\sim \mathcal{N}\!\left(\mu_{f \mid \mathcal{D}_t}(x_{t+1}),\, \sigma_{f \mid \mathcal{D}_t}^2(x_{t+1})\right), \\
Y_{t+1} \mid \mathcal{D}_t, x_{t+1} &\sim \mathcal{N}\!\left(\mu_{f \mid \mathcal{D}_t}(x_{t+1}),\, \sigma_{f \mid \mathcal{D}_t}^2(x_{t+1}) + \sigma_n^2\right),
\end{aligned}
\]  

其中  

\[
\begin{aligned}
\mu_{f \mid \mathcal{D}_t}(x) &= \mu(x) + k(x, \mathbf{X})\bigl(K + \sigma_n^2 I\bigr)^{-1}\bigl(\mathbf{y} - \mu(\mathbf{X})\bigr), \\
\sigma_{f \mid \mathcal{D}_t}^2(x) &= k(x, x) - k(x, \mathbf{X})\bigl(K + \sigma_n^2 I\bigr)^{-1}k(\mathbf{X}, x).
\end{aligned}
\]  

详见参考文献。核编码了关于被拟合函数性质的假设(例如平滑性、平稳性)。当核不适合底层函数时,可能导致使用 GP 的任务性能不佳,这种现象称为核误指定。图 1 说明了使用 1D Ackley 函数进行高斯过程回归时核误指定的影响。我们分别用平方指数(SE)核和周期(PER)核拟合相同的 15 个均匀采样观测集。虽然 SE 核捕捉了函数的平滑全局结构,但它未能建模 Ackley 中存在的潜在周期性成分,导致过度平滑。相反,周期核施加了强周期性归纳偏置,导致在观测区域外出现虚假振荡和外推不良。此例突显了不恰当的核选择如何显著扭曲后验均值和不确定性估计,从而激发了自适应核选择。在本工作中,我们考虑对应于不同核的 GP 模型集合,每个模型诱导自己的后验和采集函数。  

### 2.2 贝叶斯优化  
贝叶斯优化(BO)是一种用于优化评估成本高昂的黑箱函数 \(f: \mathcal{X} \to \mathbb{R}\) 的序列方法,目标是找到 \(x^* \in \arg\max_{x \in \mathcal{X}} f(x)\)。采集函数 \(\alpha_t\) 使用以 \(\mathcal{D}_t\) 为条件的后验 GP 通过 \(x_{t+1} \in \arg\max_{x \in \mathcal{X}} \alpha_t(x)\) 选择下一个评估点。常用的采集函数包括期望改进(EI),由 \(\mathrm{EI}(x) = \mathbb{E}[\max(f(x) - y^+, 0)]\) 给出,其中 \(y^+\) 是截至当前迭代的最佳观测输出,期望基于 GP 在 \(x\) 处的后验分布。其他常见的采集函数包括 UCB 和 KG。  

图 1:GP 在 Ackley 1D 上的拟合

相似文章

ALAS: 可加可学习 Alpha-Stable 核用于灵活贝叶斯优化

arXiv cs.LG

本文介绍了 ALAS,一种灵活的 Gaussian Process 核族,它从数据中学习稳定性参数以适应平滑度,同时捕捉平滑趋势和尖锐不规则性,具有适用于高维的可分离变体以及关于信息增益的理论保证。

通过预测梯度催化剂加速多目标贝叶斯优化

arXiv cs.LG

本文介绍了一种通用加速机制,用于多目标贝叶斯优化,该机制利用高斯过程预测梯度作为辅助信号来增强现有的采集函数,从而在有限的评估预算下更快地收敛到全局帕累托集。