多任务贝叶斯优化的陷阱与补救措施
摘要
本文确定了两种结构机制,导致多任务高斯过程在贝叶斯优化迁移学习中错误估计跨任务相关性,即使对于仿射相关的任务也是如此。作者提出了三种保守的补救措施来缓解这些问题。
arXiv:2607.09073v1 公告类型:新
摘要:贝叶斯优化通常使用来自相关源任务的数据对目标实验进行热启动,而多任务高斯过程是这项工作的教科书式代理模型。我们在受控设置下重新审视这一默认做法,发现即使在最简单的非平凡情况(即仿射相关的源任务和目标任务)下,它也会错误估计跨任务相关性,而在这类情况下,有效的迁移学习方法显然应该成功。我们将失败归因于两个独立的结构机制。每任务标准化(解决仿射切片歧义的教科书式方法)将有限样本对齐误差传播到恢复的相关性中。边际似然本身仅以每个样本的速率识别相关性,而高斯过程在非重叠设计上进一步稀释了这种速率。我们提出了三种基于分析的保守补救措施:将每任务的均值和尺度提升为模型参数,限制任务协方差为非负相关,以及将部分源和目标设计共置。在合成多任务问题和基于代理的超参数调优迁移中,这些补救措施在简单实例上恢复了仅使用目标的基线,而在更难的实例上以及大多数基于排序和潜在上下文变体中,更广泛的失败仍然存在。
查看缓存全文
缓存时间: 2026/07/13 07:58
# 多任务贝叶斯优化的陷阱与补救措施
来源:https://arxiv.org/html/2607.09073
Carl Hvarfner Meta hvarfner@meta\.com & Sam Daulton Meta sdaulton@meta\.com & Max Balandat Meta balandat@meta\.com & Eytan Bakshy Meta ebakshy@meta\.com
###### 摘要
贝叶斯优化通常利用来自相关源任务的数据来热启动目标实验,而多任务高斯过程是完成这一任务的教科书式代理模型。我们在一个受控环境中重新审视这一默认做法,发现即使在最简单的非平凡情形下——即源任务与目标任务呈仿射相关,一个有效的迁移学习方法显然应该成功——它也会错误估计跨任务相关性。我们将这种失败追溯到两个独立的结构性机制。每个任务独立标准化(解决仿射切片模糊性的教科书式方法)会将有限样本下的对齐误差传播到恢复的相关性中。边际似然本身仅以每个样本的速率识别相关性,而非重叠设计上的高斯过程进一步稀释了这种识别能力。我们提出了三个基于分析的保守补救措施:将每个任务的均值和尺度提升为模型参数、将任务协方差限制为非负相关性、以及将源任务和目标任务的部分设计共置。在合成多任务问题和基于代理模型的超参数调优迁移中,这些补救措施在简单实例上恢复到了仅使用目标基线的水平,而在更困难的实例以及大多数基于排名和潜在上下文的变体中,更广泛的失败依然存在。
## 1 引言
贝叶斯优化[10 (https://arxiv.org/html/2607.09073#bib.bib10),12 (https://arxiv.org/html/2607.09073#bib.bib12),27 (https://arxiv.org/html/2607.09073#bib.bib27),28 (https://arxiv.org/html/2607.09073#bib.bib28)]是样本高效实验的核心工具,在生产环境中,目标实验很少孤立出现[13 (https://arxiv.org/html/2607.09073#bib.bib13),21 (https://arxiv.org/html/2607.09073#bib.bib21),9 (https://arxiv.org/html/2607.09073#bib.bib9)]。当目标实验存在相关的先前实验时,贝叶斯优化迁移学习(BOTL)的默认做法是:收集源数据,拟合多任务高斯过程(MTGP),并期望用更少的目标评估找到最优值。关于BOTL的报告往往强调在精选测试集上的积极结果[26 (https://arxiv.org/html/2607.09073#bib.bib26),4 (https://arxiv.org/html/2607.09073#bib.bib4),9 (https://arxiv.org/html/2607.09073#bib.bib9)],而库的默认设置[3 (https://arxiv.org/html/2607.09073#bib.bib3),11 (https://arxiv.org/html/2607.09073#bib.bib11)]将基于内在协同区域化模型(ICM)的MTGP作为首选代理模型。然而,与仅使用目标任务的BO[8 (https://arxiv.org/html/2607.09073#bib.bib8),22 (https://arxiv.org/html/2607.09073#bib.bib22)]进行受控比较,以及直接审计标准模型是否恢复正确的任务相关性,这些研究相对较少。
然而,在从标准基准函数中抽取的两个仿射相关任务上,教科书式的MTGP错误估计了跨任务相关性:它衰减了恢复的相关性,并且当存在多个源任务时,甚至可能翻转其符号。仿射相关任务是任何有效迁移学习方法必须处理的教科书式案例:源任务是目标任务的完美线性映像,因此每个标准MTGP变体都应该恢复接近完美的相关性,并且迁移显然应该有所帮助。我们发现了相反的情况:类似的病态不仅存在于教科书式的ICM中,而且几乎存在于所有常用的多任务和基于排名的变体中;在我们的多任务BO网格中,教科书式MTGP在大多数基础函数上输给了单任务高斯过程(GP)——这是*负迁移*的教科书式标志[19 (https://arxiv.org/html/2607.09073#bib.bib19),33 (https://arxiv.org/html/2607.09073#bib.bib33)]。一种在此处失败的方法是结构性失败,而不是因为任务困难;先前的BOTL基准测试报告了ICM-based MTGP在底层迁移性本身不确定的测试集上的表现,因此,在仿射相关任务上的明显失败具有诊断意义。我们将这种失败追溯到标准参数化中的一个结构性可辨识缺陷,而不是拟合意外。
失败有两个结构上不同且独立的原因:一个有限样本下的每个任务*标准化*误差,该误差借助仿射重参数化对称性传播到恢复的相关性中;以及一个信息论层面的*相关性推断*下限,而非重叠设计上的GP进一步稀释了这种推断能力。两者在BOTL实践实际拥有的预算下都会显现(图2 (https://arxiv.org/html/2607.09073#S4.F2));第4节 (https://arxiv.org/html/2607.09073#S4)将分别阐述每个原因。
#### 我们的贡献
如下:
- •教科书式MTGP的两个结构性陷阱,并附有理论分析。我们隔离了两个独立的机制,这些机制导致教科书式MTGP在仿射相关任务上错误估计任务相关性:一个有限样本下的每个任务标准化误差,以及一个信息论层面的相关性推断下限,而非重叠的GP进一步稀释了这种推断能力。
- •在简单实例上恢复仅使用目标基线的三个补救措施。我们将每个任务的均值和尺度作为模型参数、对ρ\\rho施加非负约束、以及共置源/目标查询,确定为将两个陷阱留下的推断方差最小化的配置(第4.3节 (https://arxiv.org/html/2607.09073#S4.SS3))。
- •实证演示。我们在简单的半合成仿射问题、基于代理模型的LCBench超参数优化(HPO)以及基于代理模型的深度学习(pd1)和LLM(ifeval[7 (https://arxiv.org/html/2607.09073#bib.bib7)])调优基准上,评估了教科书式ICM、几种MTGP变体以及提议的补救措施(第5节 (https://arxiv.org/html/2607.09073#S5))。
## 2 背景
#### 贝叶斯优化与迁移学习。
BO解决在有限查询预算下对带噪声目标函数f:X→Rf:\\mathcal\{X\}\\to\\mathbb\{R\}的序贯黑箱优化问题:每一步,一个概率代理模型(通常是GP)和一个采集函数根据过去观测Dt=\{\(xi,yi\)\}i=1Nt\\mathcal\{D\}\_\{t\}=\\\{\(\\bm\{x\}\_\{i\},y\_\{i\}\)\\\}\_\{i=1\}^\{N\_\{t\}\}决定下一个评估点x∈X\\bm\{x\}\\in\\mathcal\{X\}。BOTL在此基础上增加T−1T-1个来自过去或更便宜实验的、关于相关但非完全相同目标fsf\_\{s\}的源数据集\{D\(s\)\}s=1T−1\\{\\mathcal\{D\}^\{\(s\)\}\\\}\_\{s=1\}^\{T-1\};代理模型联合拟合源和目标,以便当底层任务相关时,源评估能锐化目标后验。其收益取决于代理模型是否能够(i)从有限的源预算中恢复跨任务相关性,并且(ii)将源和目标对齐到共同尺度;本文研究的失败模式正好出现在这两个步骤。
#### GP回归。
GP[24 (https://arxiv.org/html/2607.09073#bib.bib24),29 (https://arxiv.org/html/2607.09073#bib.bib29)]是关于f:X→Rf:\\mathcal\{X\}\\to\\mathbb\{R\}的一个分布,使得任意有限评估集联合高斯分布。给定观测y=f\(X\)\+ε\\bm\{y\}=f\(\\bm\{X\}\)\+\\bm\{\\varepsilon\},其中ε∼N\(0,σnoise2I\)\\bm\{\\varepsilon\}\\sim\\mathcal\{N\}\(0,\\sigma^\{2\}\_{\\mathrm\{noise\}}\\bm\{I\}\),以及一个正定核kxk\_\{x\},后验仍然是GP,在测试输入x∗\\bm\{x\}\_\{\*\}处的预测均值为k∗⊤\(K\+σnoise2I\)−1y\\bm\{k\}\_\{\*\}^\{\\top\}\(\\bm\{K\}\+\\sigma\_\{\\mathrm\{noise\}\}^\{2\}\\bm\{I\}\)^\{\-1\}\\bm\{y\},方差为kx\(x∗,x∗\)−k∗⊤\(K\+σnoise2I\)−1k∗k\_\{x\}\(\\bm\{x\}\_\{\*\},\\bm\{x\}\_\{\*\}\)\-\\bm\{k\}\_\{\*\}^\{\\top\}\(\\bm\{K\}\+\\sigma\_\{\\mathrm\{noise\}\}^\{2\}\\bm\{I\}\)^\{\-1\}\\bm\{k\}\_\{\*\},其中k∗=kx\(x∗,X\)\\bm\{k\}\_\{\*\}=k\_\{x\}\(\\bm\{x\}\_\{\*\},\\bm\{X\}\),K\\bm\{K\}是训练输入上的Gram矩阵。超参数通常通过最大化边际对数似然(MLL)来拟合。
#### MTGP与ICM。
MTGP[5 (https://arxiv.org/html/2607.09073#bib.bib5)]联合建模TT个相关函数\{ft\}t=1T\\\{f\_\{t\}\\\}\_\{t=1\}^\{T\}。在ICM参数化[14 (https://arxiv.org/html/2607.09073#bib.bib14)]中,跨任务协方差是T×TT\\times T任务协方差矩阵B\\bm\{B\}和共享输入核kxk\_\{x\}的Kronecker积:Cov\(ft\(x\),ft′\(x′\)\)=Btt′kx\(x,x′\)\\operatorname\{Cov\}\(f\_\{t\}\(\\bm\{x\}\),f\_\{t^\{\\prime\}\}\(\\bm\{x\}^\{\\prime\}\)\)=B\_\{tt^\{\\prime\}\}\\,k\_\{x\}\(\\bm\{x\},\\bm\{x\}^\{\\prime\}\),其中对角元BttB\_\{tt\}是每个任务的信号方差,非对角元Btt′B\_\{tt^\{\\prime\}\}是跨任务协方差;无量纲的任务相关矩阵为ρtt′=Btt′/BttBt′t′\\rho\_\{tt^\{\\prime\}\}=B\_\{tt^\{\\prime\}\}/\\sqrt\{B\_\{tt\}B\_\{t^\{\\prime\}t^\{\\prime\}\}\}。直观上,kxk\_\{x\}控制任务内部的平滑性,而B\\bm\{B\}控制任务之间信息共享的强度;该模型在输入和任务上是*可分离*的。MTGP还允许每个任务有独立的观测噪声σnoise,t2\\sigma\_\{\\mathrm\{noise\},t\}^\{2\}和每个任务有常数均值μt\\mu\_\{t\}——后者在原则上可行,但在实践中很少被讨论或实现。
#### 任务相关矩阵与标准化。
标准的B=LL⊤\+diag\(v\)\\bm\{B\}=\\bm\{L\}\\bm\{L\}^\{\\top\}\+\\mathrm\{diag\}\(\\bm\{v\}\)参数化[5 (https://arxiv.org/html/2607.09073#bib.bib5)]是主流库[3 (https://arxiv.org/html/2607.09073#bib.bib3),11 (https://arxiv.org/html/2607.09073#bib.bib11)]中的默认设置。输出通常要么全局标准化(对所有任务使用同一组\(μ^,σ^\)\(\\hat\{\\mu\},\\hat\{\\sigma\}\)),要么每个任务独立标准化(从每个任务的观测中计算\(μ^t,σ^t\)\(\\hat\{\\mu\}\_\{t\},\\hat\{\\sigma\}\_\{t\}\))。标准化将输出带入一个区域,使得GP的默认超参数先验(以单位信号方差为中心)具有信息量——这也是高维BO中先验和初始化被校准的相同归一化区域[16 (https://arxiv.org/html/2607.09073#bib.bib16),20 (https://arxiv.org/html/2607.09073#bib.bib20)]——并且对于在异质尺度的任务上稳定优化MLL是必不可少的。
#### 模型的白化空间。
标准化实际上是双层结构。第一层是通过结果变换\(mt,st\)\(m\_\{t\},s\_\{t\}\)对输出进行原始标准化,在每个任务独立标准化下,该变换设置为经验值\(μ^t,σ^t\)\(\\hat\{\\mu\}\_\{t\},\\hat\{\\sigma\}\_\{t\}\)。第二层是GP通过学习每个任务的均值常数ctc\_\{t\}和ICM对角元BttB\_\{tt\}进行的归一化。GP处理为零均值、每个任务单位方差的信号因此是*白化*信号zt\(x\)=\(\(yt−mt\)/st−ct\)/Bttz\_\{t\}\(\\bm\{x\}\)=\(\(y\_\{t\}\-m\_\{t\}\)/s\_\{t\}\-c\_\{t\}\)/\\sqrt\{B\_\{tt\}\}。学习每个任务的均值和信号并非与拟合其余超参数同时进行,但很自然地将相关参数和长度尺度视为在这个白化空间中学习:非对角元ρtt′\\rho\_\{tt^\{\\prime\}\}编码的是*白化信号之间*的相关性,而非原始输出。
## 3 相关工作
#### 基于Pearson(推断相关性)的MTGP。
协同区域化线性模型(LMC)/秩-1 ICM起源于地质统计学[17 (https://arxiv.org/html/2607.09073#bib.bib17),14 (https://arxiv.org/html/2607.09073#bib.bib14),31 (https://arxiv.org/html/2607.09073#bib.bib31)],并通过Bonilla等人[5 (https://arxiv.org/html/2607.09073#bib.bib5)]进入GP文献;多任务BO随后跟进[26 (https://arxiv.org/html/2607.09073#bib.bib26),23 (https://arxiv.org/html/2607.09073#bib.bib23),4 (https://arxiv.org/html/2607.09073#bib.bib4)]。该类包括自由和秩受限的B\\bm\{B\}、潜在上下文嵌入、池化单任务GP(B=11⊤\\bm\{B\}=\\bm\{1\}\\bm\{1\}^\{\\top\})以及B\\bm\{B\}上的层次先验——所有这些都通过成对Pearson协方差推断任务结构,并继承了Alvarez等人[1 (https://arxiv.org/html/2607.09073#bib.bib1)],Anderson和Rubin[2 (https://arxiv.org/html/2607.09073#bib.bib2)],Lopes和West[18 (https://arxiv.org/html/2607.09073#bib.bib18)]的仿射可辨识缺陷,我们将在下文进一步阐明。
#### 基于排名的集成。
通过排名一致性权重组合的每个任务GP集成,例如排名加权GP集成(RGPE)[9 (https://arxiv.org/html/2607.09073#bib.bib9),34 (https://arxiv.org/html/2607.09073#bib.bib34)],完全绕过了联合任务协方差,而是重新加权独立拟合的每个任务GP。
#### 分布匹配变换。
每个任务的copulaΦ−1∘F^t\\Phi^\{\-1\}\\\!\\circ\\hat\{F\}\_\{t\}吸收了任何单调的每个任务映射,并在zz空间中拟合共享模型[25 (https://arxiv.org/html/2607.09073#bib.bib25)];这是高斯Copula过程(GCP)的基础。
#### 其他范式。
离线元学习和摊销策略[32 (https://arxiv.org/html/2607.09073#bib.bib32),30 (https://arxiv.org/html/2607.09073#bib.bib30),21 (https://arxiv.org/html/2607.09073#bib.bib21)]以牺牲11到22个数量级更多的源数据为代价,避免了每个目标的拟合;预训练GP的工作将可辨识性问题转移到了元训练时间。
## 4 仿射MTGP的两个陷阱
我们在最简单的可想象迁移设置中呈现我们的两个结构性陷阱:仿射相关的源任务和目标任务。因为源任务是目标任务的完美线性映像——这是对迁移最有利的情况,真实任务相关性恰好为±1\\pm 1——此处无法恢复相关性是结构性缺陷,而非任务难度。
#### 设置:仿射源-目标族。
设f∼GP\(0,kx\)f\\sim\\mathcal\{GP\}\(0,k\_\{x\}\)为潜在函数,具有归一化的基核kx\(x,x\)=1k\_\{x\}\(\\bm\{x\},\\bm\{x\}\)=1,并定义TT个任务为yt\(x\)=atf\(x\)\+bt\+εty\_\{t\}\(\\bm\{x\}\)=a\_\{t\}\\,f\(\\bm\{x\}\)\+b\_\{t\}\+\\varepsilon\_\{t\},其中at\>0a\_\{t\}\>0,bt∈Rb\_\{t\}\\in\\mathbb\{R\},且εt∼N\(0,σnoise,t2\)\\varepsilon\_\{t\}\\sim\\mathcal\{N\}\(0,\\sigma\_\{\\mathrm\{noise\},t\}^\{2\}\)对t=1,...,Tt=1,\\ldots,T独立。假设高信噪比(SNR)区域:σnoise,t2≪at2\\sigma\_\{\\mathrm\{noise\},t\}^\{2\}\\ll a\_\{t\}^\{2\}。考虑一个ICM模型[14 (https://arxiv.org/html/2607.09073#bib.bib14)],其任务协方差为B∈RT×T\\bm\{B\}\\in\\mathbb\{R\}^\{T\\times T\},对角元BttB\_\{tt\}为每个任务的信号方差(真实情况下Btt=at2B\_\{tt\}=a\_\{t\}^\{2\}),每个任务的常数均值μt\\mu\_\{t\},以及共享的归一化基核kxk\_\{x\},因此联合协方差为
Cov\[yt\(x\),yt′\(x′\)\]=Btt′kx\(x,x′\)\+σnoise,t2δtt′δxx′\.\\operatorname\{Cov\}\\bigl\[y\_\{t\}\(\\bm\{x\}\),\\,y\_\{t^\{\\prime\}\}\(\\bm\{x\}^\{\\prime\}\)\\bigr\]=B\_\{tt^\{\\prime\}\}\\,k\_\{x\}\(\\bm\{x\},\\bm\{x\}^\{\\prime\}\)\+\\sigma\_\{\\mathrm\{noise\},t\}^\{2\}\\,\\delta\_\{tt^\{\\prime\}\}\\,\\delta\_\{\\bm\{x\}\\bm\{x\}^\{\\prime\}\}\.\(1\)目标是识别ρ\\rho,而不是B\\bm\{B\};固定Btarget,target=1B\_\{\\mathrm\{target,target\}\}=1消除了目标行/列中的残差尺度模糊性。虽然我们为了可处理性在仿射源-目标任务族上进行分析,但底层机制是模型无关的,并广泛适用于任何从有限样本中估计每个任务尺度和成对协方差的多任务代理模型。
正如我们将展示的,教科书式MTGP在仿射相关任务上失败有两个结构上不同且独立的原因。*对齐*源任务会带来一个有限样本下的每个任务标准化误差,这……(原文到此结束,翻译也截至此处)相似文章
通过预测梯度催化剂加速多目标贝叶斯优化
本文介绍了一种通用加速机制,用于多目标贝叶斯优化,该机制利用高斯过程预测梯度作为辅助信号来增强现有的采集函数,从而在有限的评估预算下更快地收敛到全局帕累托集。
高效条件化:伪观测批量贝叶斯优化为何有效及何时失效
本文为伪观测批量贝叶斯优化提供了一个统一的理论框架,证明了高斯过程(Gaussian processes)能产生不同的批量点,并且像Constant Liar和Kriging Believer这样的常见方法是一个单一条件化机制的实例。它引入了结构多样性诊断(SDD)来测试代理模型兼容性,并在多个基准函数和超参数调优中验证了预测结果。
分解大语言模型的基本能力:在多任务指令微调中缓解跨任务干扰
本文提出Badit方法,将大语言模型参数分解为正交的高奇异值LoRA专家,以在多任务指令微调中缓解跨任务干扰。
干扰感知的多任务机器遗忘
本文介绍了一种干扰感知的多任务机器遗忘框架,通过任务感知的梯度投影和实例级别的梯度正交化来解决任务级和实例级干扰,在多任务计算机视觉基准上实现了有效的遗忘。
贝叶斯模型合并
介绍贝叶斯模型合并(BMM),这是一个即插即用的双层优化框架,用于将多个任务特定的专家模型合并为一个单一模型,在视觉和语言基准测试上实现了最先进的性能。