在多尺度灰盒贝叶斯优化中利用可分离性

arXiv cs.LG 论文

摘要

本文提出了一种灰盒贝叶斯优化的双层重构方法,将黑盒变量和白盒变量分离,降低了代理模型的维度,并在基准问题上改善了遗憾值和墙钟时间。

arXiv:2608.03045v1 公告类型:新 摘要:我们考虑灰盒优化问题,其中决策变量自然划分为黑盒变量(作为昂贵黑盒函数的参数)和白盒变量,白盒变量由一组显式闭式方程控制,这些方程也依赖于黑盒函数的输出。我们通过双层重构来利用这种可分离性:外层贝叶斯优化(BO)仅将黑盒变量作为参数来优化标量目标,而内层问题通过全局优化求解白盒子问题。因此,贝叶斯优化中使用的高斯过程代理模型是定义在约简空间上的,并且只要内层优化器收敛到可行点,白盒约束就能被精确满足——无需罚函数、机会约束或矩近似。在13个基准问题的测试套件上,双层贝叶斯优化以更少的迭代次数和更短的墙钟时间实现了更低的遗憾值。这一优势对初始化集大小、探索参数和内层求解器的选择具有鲁棒性。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:44

# 利用多尺度灰盒贝叶斯优化中的可分离性

来源:https://arxiv.org/html/2608.03045
Tyler A\. Soderstrom2,Brian A\. Korgel1,3,Michael Baldea1,4
通讯作者:mbaldea@che\.utexas\.edu

###### 摘要

我们考虑一类灰盒优化问题,其中决策变量自然地分为黑盒变量`xBB`(作为昂贵黑盒函数的参数)和白盒变量`xWB`(由一组显式闭式方程支配,这些方程还依赖于黑盒函数的输出)。我们通过双层重构来利用这种可分离性:外层使用贝叶斯优化(BO)仅针对`xBB`的函数(即标量目标)进行优化,而内层问题通过全局优化求解白盒子问题。因此,BO 中使用的高斯过程代理定义在`RnBB`上,而非`RnWB+nBB`上,并且只要内层优化器收敛到可行点,白盒约束就能被精确满足——无需罚函数、机会约束或矩近似。在 13 个基准问题上,双层BO 以更少的迭代次数和更短的墙钟时间实现了更低的遗憾值。这一优势对初始化集大小、探索参数和内层求解器选择均具有鲁棒性。

1McKetta 化学工程系,德克萨斯大学奥斯汀分校,200 E\. Dean Keaton St\. Stop C0400, Austin, Texas 78712, USA
2ExxonMobil 技术与工程,22777 Springwoods Village Pkwy, Spring, Texas 77389, USA
3能源研究所,德克萨斯大学奥斯汀分校,2304 Whitis Ave\. Stop C2400, Austin, Texas 78712, USA
4计算工程与科学研究所,德克萨斯大学奥斯汀分校,201 E\. 24th Street, POB 4\.102, Stop C0200, Austin, Texas 78712, USA

*关键词*:贝叶斯优化⋅灰盒优化⋅双层优化⋅基于代理模型的优化⋅多尺度设计⋅降维

## 1 引言

基于代理模型的优化是处理昂贵黑盒函数的标准方法[1](https://arxiv.org/html/2608.03045#bib.bib1),然而许多问题包含已知的、可微的子结构,整体代理模型会浪费样本来学习这些结构。当一个模型可以很容易地分解为“昂贵的”黑盒组件和“廉价的”白盒组件时,在所有变量上构建单一代理模型会迫使代理模型同时学习未知和已知的组成部分。这种冗余的代价随维数增加而增长:随着组合变量空间`[xWB,xBB]`的扩大,维数灾难会给代理模型带来本不应由它去发现的结构负担。

这种情况在多尺度工程问题中自然出现,其中设计和运行被联合优化。例如,催化剂设计师使用密度泛函理论(DFT)模拟来预测动力学参数,然后将其用于已知的反应器质量和能量平衡方程中以评估反应产率。类似地,聚合物工程师使用分子模拟来估算膜传输性质,然后求解溶解-扩散方程来确定分离单元的尺寸。在每种情况下,总体目标都取决于两组决策变量。

*黑盒变量*`xBB`是昂贵模拟或实验的输入。相反,*白盒变量*`xWB`是出现在闭式宏观方程中的变量。模型的黑盒和白盒元素是*可分离的*:昂贵计算仅依赖于`xBB`,产生输出`y=fBB(xBB)`,这些输出对白盒模型进行参数化。关键的结构性质是,对于任意固定的`xBB`和`y`,剩余关于`xWB`的优化是一个标准的 NLP,只要`WB`方程连续且`xWB`全为实数,就可以用常规方法求解。

已有若干工作利用昂贵优化中的已知结构,从确定性灰盒求解器[2](https://arxiv.org/html/2608.03045#bib.bib2)、[3](https://arxiv.org/html/2608.03045#bib.bib3)、[4](https://arxiv.org/html/2608.03045#bib.bib4)到复合和结构化贝叶斯优化[5](https://arxiv.org/html/2608.03045#bib.bib5)、[6](https://arxiv.org/html/2608.03045#bib.bib6)、[7](https://arxiv.org/html/2608.03045#bib.bib7)再到数据驱动的双层方法[8](https://arxiv.org/html/2608.03045#bib.bib8)、[9](https://arxiv.org/html/2608.03045#bib.bib9)。我们将在第3节(https://arxiv.org/html/2608.03045#S3)回顾这些工作。共同的缺口在于,没有一种先前方法将仅对黑盒变量进行基于代理模型的全局搜索与对白盒子问题的精确 NLP 求解结合起来——这种配置能够充分利用变量可分离性来实现降维和精确约束满足。

我们通过双层重构来利用这种可分离性:外层循环使用贝叶斯优化(BO)仅搜索`xBB`,而内层优化器对每个候选点精确求解白盒子问题。因此,高斯过程(GP)代理定义在`RnBB`上,而不是`RnWB+nBB`上,并且只要内层优化器收敛到可行点,白盒约束就能被精确满足。该重构的细节见第4节(https://arxiv.org/html/2608.03045#S4)。我们做出三点贡献:

1. 1. 对可分离灰盒问题的双层重构,通过全局优化求解白盒子问题,将代理维数从`nWB+nBB`降至`nBB`,且只要内层优化器收敛到可行点,白盒约束就能被精确满足——无需罚函数、机会约束或矩近似。
2. 2. 包含13个可分离灰盒问题的基准测试集(共2–5个变量,0–3个约束),涵盖合成测试函数和原型工程应用——这是此类问题规模最大的基准测试集。
3. 3. 来自8,450次独立优化运行(8,190次BO + 130次NLP + 130次BH)的全面实证证据:所提出的双层策略在所有13个问题上的遗憾值比黑盒BO低11×–10^8×,且墙钟时间相等或更快,并对超参数(`ninit`、`ξ`)和内层求解器选择具有鲁棒性。

## 2 问题描述

我们考虑昂贵黑盒模型与已知、可微方程耦合的优化问题。这种设定出现在多尺度工程设计中——分子模拟输入过程模型——也出现在任何部分系统可解析求解而部分不可解析求解的领域。我们首先形式化一般问题,然后确定我们的方法所利用的结构性质。

### 2.1 问题设定与符号

决策变量包含两组:

- • `xWB∈RnWB`:*白盒变量*,由已知、可微的方程支配(例如工程中的温度、压力、流量;控制中的策略参数;结构优化中的设计尺寸)。这些变量进入白盒模型`fWB`、目标`J`和不等式约束`g`。
- • `xBB∈RnBB`:*黑盒变量*,参数化一个昂贵的、不可微的函数`fBB`(例如需要DFT的分子描述符、来自模拟的材料性质、昂贵模拟器的超参数)。这些变量直接进入`fBB`,也可能出现在`J`和`g`中。

黑盒模型
`y=fBB(xBB),fBB:RnBB→Rny,`  (1)

将`xBB`映射为中间参数向量`y∈Rny`,该向量耦合黑盒和白盒组件。我们假设`fBB`评估昂贵,且缺乏其闭式表达式或导数信息。注意,`y`专指黑盒函数的输出;白盒变量`xWB`在这个意义上并非“输出”,而是决策变量,其最优值通过针对给定`y`求解白盒子问题来确定。

白盒模型采用隐式形式
`fWB(xWB,y)=0,fWB:RnWB×Rny→RnWB,`  (2)

编码已知方程(例如质量与能量平衡),将白盒变量`xWB`与黑盒输出`y`联系起来。虽然`y`可能作为参数出现在白盒方程中,但对于任何给定的`xBB`它都是固定的;白盒优化仅搜索`xWB`。我们假设`fWB`足够光滑,且雅可比矩阵`∂fWB/∂xWB`可解析获得。

不等式约束
`g(xWB,y,xBB)≤0,g:RnWB×Rny×RnBB→Rng,`  (3)

编码`ng`个设计规范、安全限制或可行性要求,它们可能同时依赖于两组变量和黑盒输出。

完整的两组变量优化问题为

`min_{xWB,xBB}  J(xWB,y,xBB)`  (4a)
`s.t.  fWB(xWB,y)=0`  (4b)
`      y=fBB(xBB)`  (4c)
`      g(xWB,y,xBB)≤0`  (4d)
`      xWB∈XWB,  xBB∈XBB`  (4e)

目标`J(xWB,y,xBB)`和不等式约束`g(xWB,y,xBB)≤0`可能依赖于白盒变量、黑盒输出,并且在某些问题中直接依赖于黑盒变量`xBB`。

## 3 相关工作

问题(4)=https://arxiv.org/html/2608.03045#S2.E4)位于基于代理模型的全局优化、灰盒贝叶斯优化、双层规划和昂贵约束优化的交叉点。我们沿着直接源自假设1(https://arxiv.org/html/2608.03045#Thmassumption1)的两个轴组织先前工作:(i)方法是否区分`xBB`和`xWB`;(ii)白盒子系统`fWB`和约束`g`是被精确利用还是近似利用。沿轴(i)崩溃的方法在`nWB+nBB`维数上付出维数灾难代价;沿轴(ii)崩溃的方法则用精确性换取不确定性传播的通用性。

### 3.1 基于代理模型的全局优化

使用代理模型引导昂贵优化的历史可追溯到Jones等人的高效全局优化(EGO)算法[10](https://arxiv.org/html/2608.03045#bib.bib10),该算法将期望改进(EI)作为GP代理的采集函数引入。EGO将目标视为整体黑盒,并在完整决策空间`XWB×XBB⊂RnWB+nBB`上构建单一GP,这是大多数BO实现中的默认做法[11](https://arxiv.org/html/2608.03045#bib.bib11)、[1](https://arxiv.org/html/2608.03045#bib.bib1)。

在确定性代理领域,Boukouvala、Hasan和Floudas[2](https://arxiv.org/html/2608.03045#bib.bib2)开发了一种针对约束灰盒问题的方法论,该方法从多种函数形式中选取代理模型,并对由此产生的NLP进行全局优化。配套的ARGONAUT框架[3](https://arxiv.org/html/2608.03045#bib.bib3)将其形式化为迭代算法,包含变量选择、边界紧化和约束采样,适用于最多100个变量的问题;Kieslich等人[12](https://arxiv.org/html/2608.03045#bib.bib12)使用Smolyak网格和多项式代理扩展了该方法。这些方法与我们的理念一致,即利用已知方程,但它们在联合`(xWB,xBB)`空间上构建代理,而非如假设1(https://arxiv.org/html/2608.03045#Thmassumption1)所允许的那样将代理限制在`xBB`上;`fWB`仅用于生成训练数据或收紧`XWB`上的边界,而非将`xWB`从代理的定义域中消除。此外,它们所使用的确定性代理缺乏概率模型所具有的原则性探索-利用权衡,并且在严格评估预算下往往过早地过度开发早期样本。

Eason和Biegler的信任域过滤器算法[4](https://arxiv.org/html/2608.03045#bib.bib4)、[13](https://arxiv.org/html/2608.03045#bib.bib13)提供了一种互补的局部方法:它们将`fBB`的代理嵌入信任域中,并在每一步迭代中求解关于`xWB`的白盒NLP——在架构上与假设1(https://arxiv.org/html/2608.03045#Thmassumption1)(ii)中的内层子问题接近,但在`xBB`上仅具有局部收敛保证,而非全局探索机制。

### 3.2 灰盒贝叶斯优化

灰盒BO方法将已知结构并入代理模型,以减轻其建模负担。Astudillo和Frazier[5](https://arxiv.org/html/2608.03045#bib.bib5)引入了复合函数贝叶斯优化(BOCF),用我们的符号表示,它通过对`fBB`训练多输出GP并通过采样将不确定性传播到`J`中来建模`J(xWB,fBB(xBB),xBB)`;后来的扩展处理了函数网络[14](https://arxiv.org/html/2608.03045#bib.bib14)和部分评估[15](https://arxiv.org/html/2608.03045#bib.bib15)。Paulson和Lu[6](https://arxiv.org/html/2608.03045#bib.bib6)将其扩展到受约束的灰盒问题,方法是将多变量GP模型与约束期望效用函数相结合,使用样本平均近似和机会约束将GP不确定性传播通过已知方程。González和Zavala[16](https://arxiv.org/html/2608.03045#bib.bib16)提出了一个具有自适应线性化的互连系统BO框架,Winz等人[17](https://arxiv.org/html/2608.03045#bib.bib17)修改了上置信界以利用灰盒导数信息,Kudva和Paulson[

相似文章

多任务贝叶斯优化的陷阱与补救措施

arXiv cs.LG

本文确定了两种结构机制,导致多任务高斯过程在贝叶斯优化迁移学习中错误估计跨任务相关性,即使对于仿射相关的任务也是如此。作者提出了三种保守的补救措施来缓解这些问题。

循环外多保真贝叶斯优化

arXiv cs.LG

本文探讨了多保真贝叶斯优化问题,其中最高保真函数因代价过高而无法纳入优化循环,并提出了结合历史高保真数据与任务描述符的方法。该方法在合成函数、化学以及超参数优化任务上得到了验证。

低预算黑盒优化的生成式精炼

arXiv cs.LG

介绍 SPARROW,一种黑盒优化算法,它将生成先验与奖励信号解耦,从而在低预算下利用嘈杂或不可靠的反馈实现有效优化。