扭曲高斯过程变换的在线梯度计算

arXiv cs.LG 论文

摘要

本文提出了一种针对扭曲高斯过程的在线方法,该方法利用精确递归梯度计算同时更新潜在GP矩并优化扭曲参数。

arXiv:2609.16472v1 Announce Type: new 摘要: 扭曲高斯过程(GPs)通过一种称为扭曲的参数化变换,将非高斯观测映射到潜在标准GP来处理。然而,现有的流式变体要么定期优化扭曲参数,要么为了更高的模型容量而牺牲解析tractability。为了弥合这一差距,我们证明了扭曲GP的瞬时负对数似然的梯度允许精确的递归计算。基于这一结果,我们提出了一种新颖的扭曲GP在线方法,该方法同时更新潜在GP矩并优化扭曲参数。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:53

# 变形高斯过程变换的在线梯度计算
来源:https://arxiv.org/html/2609.16472
Emilio Ruiz-Moreno 单位:挪威奥斯陆 Simula 数字工程大都会中心 SIGIPRO 部门;单位:挪威奥斯陆 Simula 研究实验室 SURE-AI 中心
Konstantinos Slavakis 单位:日本横滨东京科学研究院
本工作由挪威研究委员会 DISCO 资助项目 338740、DRIVE 资助项目 360486 和 SURE-AI 中心资助项目 357482 支持。
代码:https://github.com/SIGIPRO/onlineWGP
Baltasar Beferull-Lozano 单位:挪威奥斯陆 Simula 数字工程大都会中心 SIGIPRO 部门;单位:挪威奥斯陆 Simula 研究实验室 SURE-AI 中心

###### 摘要

变形高斯过程(GPs)通过一个称为变形的参数变换将非高斯观测映射到潜在标准高斯过程中来处理非高斯观测。然而,现有的流式变体要么周期性地优化变形参数,要么为了更高的模型容量而牺牲解析可处理性。为了弥合这一差距,我们证明了变形高斯过程的瞬时负对数似然的梯度可以递归精确计算。基于此结果,我们提出了一种新的变形高斯过程在线方法,该方法联合更新潜在高斯过程矩并优化变形参数。

###### 关键词:

高斯过程,变形变换,在线学习

## 1引言

高斯过程(GPs)提供了一种非参数贝叶斯框架,用于概率函数近似\[16 (https://arxiv.org/html/2609.16472#bib.bib1)\],当真实底层函数解析未知或查询成本高昂时特别有用\[22 (https://arxiv.org/html/2609.16472#bib.bib8),19 (https://arxiv.org/html/2609.16472#bib.bib9)\]。通过直接在感兴趣的函数空间上放置先验,高斯过程提供了一种有原则的不确定性量化方法,使其在预测置信度与点精度同样重要的应用中尤其具有吸引力;例如,在机器人学\[5 (https://arxiv.org/html/2609.16472#bib.bib7)\]或地统计学\[7 (https://arxiv.org/html/2609.16472#bib.bib5),6 (https://arxiv.org/html/2609.16472#bib.bib6)\]中。关键是,高斯过程的数学可处理性允许精确的贝叶斯推断,当与高斯函数观测似然结合时,产生闭式预测分布。

尽管取得了广泛的成功,标准高斯过程从根本上受限于其核心假设,即函数观测能被联合高斯分布充分建模。实际上,这一假设在实践中经常失效,因为现实世界的观测可能呈现重尾、明显偏斜或物理约束(例如严格正性)。因此,将标准高斯过程应用于此类非高斯观测可能会产生高度不准确的预测和校准不佳的不确定性边界。

针对这些局限性,变形高斯过程\[21 (https://arxiv.org/html/2609.16472#bib.bib3)\]通过应用一个称为变形的参数变换来扩展标准高斯过程,将非高斯观测映射到潜在目标空间,使得标准高斯过程假设成立。通过联合估计潜在高斯过程矩和变形参数,变形高斯过程在保留标准高斯过程解析可处理性的同时,适应复杂的观测似。

然而,在内存受限或实时任务中实现变形高斯过程仍然是一个重大挑战。这是因为,据我们所知,目前尚无在线方法能联合更新潜在高斯过程矩并优化变形高斯过程的变形参数。文献中与本文最接近的方法要么周期性地优化变形参数\[12 (https://arxiv.org/html/2609.16472#bib.bib23)\],要么为了更高的模型容量而牺牲解析可处理性\[2 (https://arxiv.org/html/2609.16472#bib.bib24)\]。

在本文中,我们证明了变形高斯过程的负对数似然(NLL)的梯度可以递归地精确计算。基于此,我们提出了一种新的变形高斯过程在线方法,该方法联合更新潜在高斯过程矩并优化变形参数。

## 2背景

图 1:高斯过程先验(上)和高斯过程后验(下),即高斯过程先验根据观测(由 + 标记指示)条件化。实线表示从高斯过程抽取的样本函数。阴影区域覆盖均值的 ±1.96 个标准差。示例改编自\[16 (https://arxiv.org/html/2609.16472#bib.bib1), Ch. 2\]。考虑根据关于其函数空间的先验信念和一组 n 个(可能被破坏的)函数观测 y1,...,yn 在相应的输入位置 x1,...,xn 上推断未知实值函数 f f  over 任意 d 维输入空间 X⊆Rd 的问题。

如果满足某些假设,如我们接下来详细说明,这个问题可以解析地解决。

### 2.1高斯过程

高斯过程模型通常假设函数 f 是零均值高斯过程先验的实现,并且函数观测被白高斯噪声破坏。即,

f⁡\(x\)\\displaystyle f\(\\bm\{x\}\)∼GP\(0,κ⁡\(x,x′\)\),\\displaystyle\\sim\\mathcal\{GP\}\\left\(0,\\kappa\(\\bm\{x\},\\bm\{x\}^\{\\prime\}\)\\right\),\(1a\)yi\\displaystyle y\_\{i\}=f⁡\(xi\)\+εi,\\displaystyle=f\(\\bm\{x\}\_\{i\}\)\+\\epsilon\_\{i\},\(1b\)其中核 κ:X×X→R 是高斯过程先验的协方差函数,并且每个 εi∼N⁡\(0,σ2\) 是具有标准差 σ 的观测噪声项。

得益于高斯性和高斯过程的封闭性质\[16 (https://arxiv.org/html/2609.16472#bib.bib1)\],给定 n 个观测收集在观测向量 yn=\[y1,...,yn\]⊤∈Rn 中的函数后验分布也是高斯分布。具体来说,

f⁡\(x\)\|yn∼N⁡\(mn\(x\),vn\(x\)\),f\(\\bm\{x\}\)\|\\bm\{y\}\_\{n\}\\sim\\mathcal\{N\}\\left\(m\_\{n\}\(\\bm\{x\}\),v\_\{n\}\(\\bm\{x\}\)\\right\),\(2\)具有闭式后验均值和方差

mn\(x\)\\displaystyle m\_\{n\}\(\\bm\{x\}\)=kn\(x\)⊤αn,\\displaystyle=\\bm\{k\}\_\{n\}\(\\bm\{x\}\)^\{\\top\}\\bm\{\\alpha\}\_\{n\},\(3a\)vn\(x\)\\displaystyle v\_\{n\}\(\\bm\{x\}\)=κ⁡\(x,x\)−kn\(x\)⊤Ωnkn\(x\),\\displaystyle=\\kappa\(\\bm\{x\},\\bm\{x\}\)\-\\bm\{k\}\_\{n\}\(\\bm\{x\}\)^\{\\top\}\\bm\{\\Omega\}\_\{n\}\\bm\{k\}\_\{n\}\(\\bm\{x\}\),\(3b\)分别地,其中

αn\\displaystyle\\bm\{\\alpha\}\_\{n\}=Ωnyn∈Rn,\\displaystyle=\\bm\{\\Omega\}\_\{n\}\\bm\{y\}\_\{n\}\\in\\mathbb\{R\}^\{n\},\(4a\)Ωn\\displaystyle\\bm\{\\Omega\}\_\{n\}=\(Kn\+σ2In\)−1∈S≥0n,,\\displaystyle=\\left\(\\bm\{K\}\_\{n\}\+\\sigma^\{2\}\\bm\{I\}\_\{n\}\\right\)^\{\-1\}\\in\\mathbb\{S\}^\{n\}\_\{\\geq 0\},,\(4b\)其中 kn\(x\)∈Rn 和 Kn∈S≥0n 按如下方式构造:\[kn\(x\)\]i=κ⁡\(xi,x\) 和 \[Kn\]i,j=κ⁡\(xi,xj\),对于所有 i,j∈\{1,...,n\}。

为了帮助概念理解,图 1 (https://arxiv.org/html/2609.16472#S2.F1) 提供了一个高斯过程先验 (1a) 和后验 (2) 的示意图。

#### 2.1.1递归高斯过程更新

直接计算后验矩 (3) 中的项 αn 和 Ωn 随观测数 n 的增长而计算代价过高,主要由于 (4b) 右侧的矩阵求逆。幸运的是,通过利用以下递归结构,仍然可以精确计算这些项,但计算负担降低

αn\\displaystyle\\bm\{\\alpha\}\_\{n\}=\[αn−10\]−yn−mn−1\(xn\)sn\[ωn−1\],\\displaystyle=\\begin\{bmatrix\}\\bm\{\\alpha\}\_\{n\-1\}\\\\ 0\\end\{bmatrix\}\-\\frac\{y\_\{n\}\-m\_\{n\-1\}\(\\bm\{x\}\_\{n\}\)\}\{s\_\{n\}\}\\begin\{bmatrix\}\\bm\{\\omega\}\_\{n}\\\\ \-1\\end\{bmatrix\},\(5a\)Ωn\\displaystyle\\bm\{\\Omega\}\_\{n\}=\[Ωn−10n−10n−1⊤0\]\+1sn\[ωn−1\]\[ωn⊤−1\],\\displaystyle=\\begin\{bmatrix\}\\bm\{\\Omega\}\_\{n\-1\}&\\bm\{0\}\_\{n\-1\}\\\\ \\bm\{0\}\_\{n\-1\}^\{\\top\}&0\\end\{bmatrix\}\+\\frac\{1\}\{s\_\{n\}\}\\begin\{bmatrix\}\\bm\{\\omega\}\_\{n}\\\\ \-1\\end\{bmatrix\}\\begin\{bmatrix\}\\bm\{\\omega\}\_\{n}^\{\\top\}&\-1\\end\{bmatrix\},\(5b\)其中 sn=vn−1\(xn\)\+σ2∈R,且 ωn=Ωn−1kn−1\(xn\)∈Rn−1。因此,随着每个新观测 yn 和相关输入位置 xn 可用,高斯过程后验 (2) 可以通过简单地将 αn 和 Ωn 作为状态变量来递归更新。

#### 2.1.2稀疏高斯过程更新

确实,第 2.1.1 节中的递归更新有效地避免了 n×n 矩阵求逆的计算复杂性瓶颈。然而,计算 (3) 中的后验矩仍然需要评估一个 n×1 向量点积(用于均值)和一个 n×n 二次型(用于方差)。也就是说,均值的计算和内存需求按 O(n) 增长,方差按 O(n²) 增长。

这种随观测数 n 的无界增长在文献中被称为“核化诅咒”\[23 (https://arxiv.org/html/2609.16472#bib.bib14),3 (https://arxiv.org/html/2609.16472#bib.bib15)\],通常通过核近似方法解决,例如 Nyström\[24 (https://arxiv.org/html/2609.16472#bib.bib17)\]和随机傅里叶特征\[15 (https://arxiv.org/html/2609.16472#bib.bib16),13 (https://arxiv.org/html/2609.16472#bib.bib18)\],或者通过基于字典的稀疏化方法,包括遗忘机制\[20 (https://arxiv.org/html/2609.16472#bib.bib19)\]和近似线性依赖(ALD)技术\[8 (https://arxiv.org/html/2609.16472#bib.bib10),9 (https://arxiv.org/html/2609.16472#bib.bib11)\]。

在本工作中,我们依赖 ALD 技术,因为它与第 2.1.1 节中的递归更新自然集成(更多细节参见第 4 节)。

### 2.2变形高斯过程

变形高斯过程模型假设观测在应用一个单调、参数化且可微的变换(称为变形)后遵循高斯过程模型\[21 (https://arxiv.org/html/2609.16472#bib.bib3)\]。具体来说,给定一个具有 r 个参数 θ∈Θ⊆Rr 的变形变换 g,观测模型 (1b) 变为

zi:=g⁡\(yi,θ\)=f⁡\(xi\)\+εi,z\_\{i\}:=g\(y\_\{i\};\\bm\{\\theta\}\)=f\(\\bm\{x\}\_\{i\}\)\+\\epsilon\_\{i\},\(6\)其中每个 zi∈R 作为潜在目标。相应地,(4a) 中定义的项 αn 变为 αn=Ωnzn∈Rn,其中 zn=\[z1,...,zn\]⊤∈Rn。

变形高斯过程可以看作是高斯过程的推广。实际上,它们通常是非高斯的,甚至在观测空间中是非对称的。

通过应用变量替换公式\[4 (https://arxiv.org/html/2609.16472#bib.bib2), Ch. 2\],任何 n 个观测 yn 的联合概率密度 p 可以用相应的潜在目标 zn 的密度 q 以及变形变换 g 和变形参数 θ 来表示。具体来说,

p⁡\(yn\|θ\)=q⁡\(g⁡\(yn,θ\)\)∏i=1n∂g⁡\(yi,θ\)∂yi,p\(\\bm\{y\}\_\{n\}\|\\bm\{\\theta\}\)=q\(\\bm\{g\}\(\\bm\{y\}\_\{n\};\\bm\{\\theta\}\)\)\\prod\_\{i=1\}^\{n\}\\frac\{\\partial g\(y\_\{i\};\\bm\{\\theta\}\)\}\{\\partial y\_\{i\}\},\(7\)其中 g 逐元素应用变形变换 g,潜在目标的联合概率遵循

q⁡\(z\)=\(\(2π\)n\|Ωn−1\|\)−12exp⁡\(−12zn⊤Ωnzn\)q\(\\bm\{z\}\)=\\left\(\(2\\pi\)^\{n\}\\left\|\\bm\{\\Omega\}\_\{n\}^\{\-1\}\\right\|\\right\)^\{\-\\frac\{1\}\{2\}\}\\exp\\left\(\-\\frac\{1\}\{2\}\\bm\{z\}\_\{n\}^\{\\top\}\\bm\{\\Omega\}\_\{n\}\\bm\{z\}\_\{n\}\\right\)\(8)基于 (6) 的构造。

变形高斯过程的最大优势之一在于变形参数 θ 可以直接从观测 yn 估计,而无需显式知道它们的联合概率密度 p。只要潜在密度 q 和变形变换 g 被定义,(7) 就提供了一个可优化的似然。

算法 1 提出的变形高斯过程在线方法。
1:% 带波浪号的变量用于区分稀疏化变量与其精确对应项。
2: 选择 g, Θ, κ, {σn},ALD 稀疏化阈值 ν,以及投影优化器 ΠΘ。
3: 初始化 θ0∈Θ, K~0−1=1/κ⁡\(x1,x1\), α~0=C~0=0, B~0=0r,并且字典 D0={x1}。
4: for n=1,2,... do
5: 观测 xn 和 yn
6: 计算 a^n=K~n−1−1k~n−1\(xt\) 和
7: δn=κ⁡\(xn,xn\)−k~n−1\(xn\)⊤a^n
8: 变形 zn=g⁡\(yn,θn−1\) 和 ẑn=∇θg\(yn,θn−1\)
9: 计算 ẽn=zn−k~n−1\(xn\)⊤α~n−1 和
10: b̃n=ẑn−B~n−1k~n−1\(xn\)
11: if δn>ν then
12: 更新 K~n−1=1δn\[δnK~n−1−1\+a^na^n⊤−a^n−a^n⊤1\]
13: 计算 c̃n=\[−C~n−1k~n−1\(xn\)1\] 和
14: s̃n=κ⁡\(xn,xn\)\+σn2−k~n−1\(xn\)⊤C~n−1k~n−1\(xn\)

相似文章

在线自适应核混合的高斯过程决策制定

arXiv cs.LG

本文介绍 HACK GPs,这是一种使用专家建议在线学习的方法,用于高斯过程中的核选择,增强在序贯决策任务(如贝叶斯优化和主动学习)中的鲁棒性。

耦合梯度下降中瞬态放大的伪谱界

arXiv cs.LG

本文针对耦合梯度下降中的块三角Jacobian矩阵建立了精确的伪谱理论,证明了Kreiss常数界并给出了迭代复杂度结果。研究揭示了与双层优化、双时间尺度随机逼近以及GAN训练相关的非渐近、实例相关的瞬态放大现象。

MGUP:一种用于随机优化的动量-梯度对齐更新策略

arXiv cs.LG

提出了一种用于随机优化的动量-梯度对齐更新策略MGUP,可实现层内选择性参数更新。该策略能与AdamW、Lion和Muon等优化器无缝集成,在提供理论收敛保证的同时,在大型模型训练任务中展现出卓越性能。