灰盒仿真模型的代理校准:一种LLM驱动的替代方案

arXiv cs.LG 论文

摘要

本文介绍了一种代理校准方法,该方法使用大型语言模型作为优化器,用于成本效益分析中灰盒仿真模型的校准。与Nelder-Mead和贝叶斯优化等传统方法相比,这种LLM驱动的方法在显著更少的模型评估次数下实现了具有竞争性的性能。

arXiv:2607.18308v1 公告类型:新 摘要:灰盒仿真模型的校准是一个约束优化问题,其中模型评估成本高昂,参数空间可能高维,并且搜索必须满足合理性约束。尽管分析人员可以完全访问仿真代码,但多个参数的联合效应仍然难以解析预测。经典优化器如Nelder-Mead (NM) 易于部署,但样本效率低,尤其是在约束条件下。现代贝叶斯优化方法以更少的评估次数实现竞争性解决方案,但需要复杂的建模机制来处理约束。我们引入了一种代理校准方法,其中大型语言模型充当优化器,约束作为系统提示中的自然语言部分纳入。我们在肛门癌仿真模型上评估了代理方法、NM和贝叶斯优化 (BO),包括无约束和临床约束校准。在无约束校准下,代理方法实现了比BO和NM更低的最佳误差,同时需要更少的模型评估。在约束校准下,代理方法达到了相当的误差水平,并且两者都优于NM。这些结果是以每次迭代推理时间增加为代价的。代理校准以显著更少的模型评估实现了竞争性性能,并且在建模者界面处通过简单的文本规范而不是额外的建模机制,约束处理几乎是免费的。主要权衡在于每次迭代推理成本的增加,这使得该方法在仿真时间占主导时特别适用。除了性能之外,每次迭代的原理使搜索可审计且可解释,因此其决策可以受到第三方的审查和论证。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:19

# 灰盒模拟模型的代理校准:一种LLM驱动的替代方案
来源:https://arxiv.org/html/2607.18308
Mireia Díaz¹,³, Josep Lluis Arcos⁴, Jesús Cerquides⁴

(¹感染与癌症信息与干预部门 (UNIC-I&I),癌症流行病学研究项目,加泰罗尼亚肿瘤研究所-IDIBELL,西班牙略夫雷加特河畔奥斯皮塔莱特;²巴塞罗那自治大学 (UAB),西班牙;³流行病学与公共卫生生物医学研究网络中心 (CIBERESP),科学、创新与大学部,西班牙马德里;⁴人工智能研究所,IIIA-CSIC,西班牙)

###### 摘要

**背景。** 用于成本效果分析 (CEA) 的模拟模型的校准是一个约束优化问题,其中模型评估成本高昂,参数空间可能维度较高,并且搜索必须尊重临床合理性约束。尽管分析人员可以完全访问模拟代码,使得模型是灰盒而非严格的黑盒,但多个参数对输出的联合效应仍然难以解析预测。经典的导数自由优化器,如 Nelder-Mead (NM),部署简单但样本效率低,尤其在约束条件下。现代贝叶斯优化 (BO) 方法,如 BAxUS,能以更少的评估次数获得有竞争力的解决方案,但在处理约束时需要非平凡的建模机制。

**方法。** 我们引入了一种代理校准方法,其中大型语言模型 (LLM) 充当优化器。在每次迭代中,LLM 获得参数猜测的历史、模拟输出、校准目标以及每组残差的详细分解,并建议下一个参数向量及其理由。约束作为系统提示中的纯文本部分纳入,不需要额外的代理模型或约束专用机制。与 GP 代理或单纯形方法的黑箱内部机制不同,生成的优化轨迹是人类可读的,并且可以在事后进行审计。我们在一个10维的肛门癌模拟模型上,在无约束和临床约束的校准下评估了代理方法、NM 和 BAxUS。

**结果。** 在无约束校准下,代理方法达到的中位最佳误差显著低于 BAxUS 和 NM,同时仅需 16 次模型评估,而 BAxUS 需要 110 次,NM 需要数百到数千次。在约束校准下,代理方法达到可比的误差水平,且两者均优于 NM,而代理方法不需要额外的实现来支持约束。这些结果是以每次迭代推理时间增加为代价获得的。

**结论。** 代理校准以显著更少的模型评估实现了有竞争力的性能,并且约束处理在建模者接口层面基本是免费的,只需简单的文本说明,而不是额外的建模机制。主要权衡在于每次迭代的推理成本增加,但被模拟次数的减少所平衡,这使得该方法在模拟时间占主导地位时特别适用,这在 CEA 中经常是这种情况。除了性能之外,每次迭代的理由使搜索成为可审计的,因此其决策可以被审查和证明,这对于受监管的健康技术评估环境来说是一个有吸引力的特性。

**关键词。** LLM 代理,贝叶斯优化,BAxUS,Nelder-Mead,模型校准,成本效果分析,模拟模型。

## 1 引言

健康经济决策建模,特别是成本效果分析 (CEA),依赖于基于模拟的模型,其参数仅部分可从观察数据中识别。校准此类模型,即找到能够再现一组流行病学或临床目标的参数向量,是成本效果分析中常见的瓶颈[1 (https://arxiv.org/html/2607.18308#bib.bib1); 2 (https://arxiv.org/html/2607.18308#bib.bib2)]。从优化的角度来看,校准具有三个挑战:每次评估都需要运行完整的模拟,目标曲面通常是非凸的,并且临床知识通常会施加优化器必须遵守的约束。

CEA 校准的一个重要特征是分析人员可以完全访问模拟代码。与优化文献中通常假设的严格黑盒设置[3 (https://arxiv.org/html/2607.18308#bib.bib3); 4 (https://arxiv.org/html/2607.18308#bib.bib4); 5 (https://arxiv.org/html/2607.18308#bib.bib5)]不同,CEA 校准更准确地描述为灰盒问题。在这种设置下,模型的结构(参数含义、转移概率、目标指标)是已知且可解释的,但多个参数对模拟输出的联合效应仍然难以解析预测。关于模型的可用知识可能很丰富:对于许多校准,领域专家可以根据残差模式定性地推断参数应调整的方向。这种特定于问题的推理正是黑盒优化器无法利用的信息。

经典的导数自由算法,如 Nelder-Mead (NM)[6 (https://arxiv.org/html/2607.18308#bib.bib6)] 和模拟退火,易于理解且部署简单,但它们的样本效率低,并且除了拒绝采样或惩罚项之外,没有原则性的方法来纳入软不等式约束。贝叶斯优化[3 (https://arxiv.org/html/2607.18308#bib.bib3); 4 (https://arxiv.org/html/2607.18308#bib.bib4)] 用概率代理(通常是高斯过程 (GP))和平衡探索与利用的采集函数取代直接搜索。现代高维 BO 变体,如 BAxUS[5 (https://arxiv.org/html/2607.18308#bib.bib5)] 和 SAASBO[7 (https://arxiv.org/html/2607.18308#bib.bib7)],连同约束感知扩展[8 (https://arxiv.org/html/2607.18308#bib.bib8)],目前代表了中等至高维昂贵黑盒优化的最先进水平。

第三种选择最近变得可行。在文本和代码上训练的大型语言模型 (LLM) 在作为上下文优化器[9 (https://arxiv.org/html/2607.18308#bib.bib9); 10 (https://arxiv.org/html/2607.18308#bib.bib10); 11 (https://arxiv.org/html/2607.18308#bib.bib11)] 方面表现出色,应用范围从提示优化到材料发现[12 (https://arxiv.org/html/2607.18308#bib.bib12); 13 (https://arxiv.org/html/2607.18308#bib.bib13)]。该方向现有工作主要针对严格的黑盒设置。而本文则将 LLM 驱动的优化器应用于灰盒校准问题,其中代码、参数语义和目标指标的临床解释都以自然语言形式提供给模型。三个特点使得这种方法在校准设置中特别相关。首先,LLM 可以吸收问题的完整自然语言描述,包括每个参数的含义、目标和约束,并利用这些信息推理哪些残差最相关,其方式类似于经验丰富的人类建模者。其次,面向分析师的接口保持紧凑:约束、目标调整和重新参数化都只是对提示的修改,而不是对代理或采集代码的修改。第三,该方法是可审计的:因为 LLM 为每个建议的参数向量提供书面理由,所以校准会产生人类可读的轨迹,说明搜索为何如此进行。这与经典方法的黑箱数值内部机制形成对比,后者的个别步骤不易用领域术语解释。分析师可以检查轨迹以验证搜索是否尊重目标和约束背后的临床推理,检测优化器是否陷入不可信的搜索区域,并向合作者或评审者记录和辩护建模选择。这种可追溯性在 CEA 模型提交的受监管健康技术评估背景下尤其有价值,因为建模决策必须透明且可辩护。

本文介绍并评估了一种基于这些思想构建的代理校准方法,并在一个10维的肛门癌模型上将其与作为经典基线的 Nelder-Mead 和作为代表性最新 BO 方法的 BAxUS 进行比较。我们的贡献有四个方面。首先,我们描述了一个 LLM 驱动的迭代循环,该循环具有明确、可审计的协议,适用于受监管的 CEA 工作流程,其中每次迭代都记录建议的参数向量和书面理由。其次,我们引入了一个约束变体,只需要约束的文本描述,不需要额外的代理。第三,我们在一个10维的肛门癌模型上报告了在无约束和约束校准下的头对头基准测试。最后,我们直接讨论了 LLM 引入的权衡,包括推理成本、可重复性以及缺乏正式收敛保证。

## 2 背景

本节回顾与我们的设置相关的主要组成部分:作为应用领域的成本效果分析,作为校准标准方法的贝叶斯优化及其高维和约束变体,以及关于大型语言模型作为潜在上下文优化器的最新工作。

### 2.1 成本效果分析

CEA 通过权衡增量成本与增量健康收益来比较竞争性健康干预措施,通常以增量成本效果比 (ICER) 总结,即每获得一个健康单位(如质量调整生命年 (QALY))的额外成本[14 (https://arxiv.org/html/2607.18308#bib.bib14); 15 (https://arxiv.org/html/2607.18308#bib.bib15)]。当相关临床事件在很长的时期内展开或无法在试验中直接观察时,这些量通过模拟模型估算,最常见的是状态转换马尔可夫队列模型或微观模拟,它们可以预测每种策略下的疾病进展、成本和结果[16 (https://arxiv.org/html/2607.18308#bib.bib16); 17 (https://arxiv.org/html/2607.18308#bib.bib17)]。

控制这些模型的参数,例如健康状态之间的转移概率,通常不是直接测量的,而是来自科学文献或专家来源,每个都带有其固有的不确定性。由于这些初始估计很少能再现观察到的真实世界结果,模型必须进行校准:调整自由参数直到模型的输出与一组观察到的目标(例如按年龄组划分的患病率或死亡率)相匹配[1 (https://arxiv.org/html/2607.18308#bib.bib1); 2 (https://arxiv.org/html/2607.18308#bib.bib2)]。由于每个候选参数向量都需要完整运行一次模拟,并且临床知识限制了合理的参数组合,校准自然被表述为一个昂贵的、有约束的优化问题。

### 2.2 贝叶斯优化

贝叶斯优化[3 (https://arxiv.org/html/2607.18308#bib.bib3); 4 (https://arxiv.org/html/2607.18308#bib.bib4)] 是优化昂贵黑盒目标的标准框架,其中每次评估成本高且没有梯度信息。它不是直接搜索参数空间,而是维护一个关于未知目标 \(f\) 的概率代理 \(p(f \mid \mathcal{D})\),基于迄今收集的证据 \(\mathcal{D}\)。代理通常是高斯过程 (GP),它在每个候选点返回预测均值和校准的不确定性。这个不确定性估计使得循环能够决定下一步在哪里采样。每一步,该方法选择查询 \(x_{t+1} = \arg\max_x \alpha(x; \mathcal{D})\),其中 \(\alpha\) 是采集函数,如期望改进 (EI) 或上置信界 (UCB)[3 (https://arxiv.org/html/2607.18308#bib.bib3)]。采集函数编码了明确的探索-利用权衡:高均值改进和高后验不确定性都会增加得分,因此循环平衡了细化当前最优区域与探索尚未探索的区域。选定的点被评估,代理被更新,然后循环重复直到评估预算耗尽。这种样本效率使得 BO 在每次评估计算成本高时具有吸引力。

### 2.3 高维 BO 和 BAxUS

标准 BO 随着维度增长而急剧退化,因为后验不确定性在搜索空间中变得几乎均匀,且采集曲面受边界效应主导[18 (https://arxiv.org/html/2607.18308#bib.bib18)]。几种可扩展的变体解决了这个问题。在 CEA 校准背景下,具有加性核的 BO 已被用于逐步校准模拟模型,利用参数子集如何影响模拟输出的结构[19 (https://arxiv.org/html/2607.18308#bib.bib19)]。SAASBO 在活跃维度上放置了稀疏的轴对齐先验[7 (https://arxiv.org/html/2607.18308#bib.bib7)]。另一条工作线使用局部置信域:TuRBO 将搜索限制在置信域内,其大小由 GP 的局部长度尺度调制[21 (https://arxiv.org/html/2607.18308#bib.bib21)],而 BAxUS[5 (https://arxiv.org/html/2607.18308#bib.bib5)] 通过将搜索自适应地嵌入到嵌套随机子空间中扩展了这一思想,仅在有证据表明当前嵌入已被耗尽时才增加其维度。

### 2.4 约束 BO

在约束设置下,标准方法是 [8 (https://arxiv.org/html/2607.18308#bib.bib8)] 的可行性概率 (PoF) 框架:每个约束 \(c_i(x) \leq 0\) 由其自身的 GP 建模,并且普通采集函数 \(\alpha(x)\) 乘以代理估计的每个约束在 \(x\) 处成立的概率,
\[
\alpha_{\text{c}}(x) = \alpha(x) \cdot \prod_i \underbrace{\Phi\left(\frac{-\mu_i(x)}{\sigma_i(x)}\right)}_{\Pr[\,c_i(x)\,\leq\,0\,]}.
\]
这里 \(\mu_i(x)\) 和 \(\sigma_i(x)\) 是第 \(i\) 个约束 GP 在 \(x\) 处的后验均值和标准差,\(\Phi\) 是标准正态 CDF,因此每个因子是约束 \(i\) 被满足的概率。这个乘积将可能不可行点的采集函数缩小到接近零。这个公式是有原则的,但引入了额外的机制:每个约束一个额外的 GP,在每个查询点上对每个约束函数进行一次额外评估,以及仔细优化联合采集函数。随着约束数量和维度的增加,该方法扩展性变差,因为每个额外的 GP 都面临同样的问题,即长度尺度估计和条件数问题,这些问题正是首先推动高维 BO 发展的原因;已经提出了专门的约束变体,例如 SCBO[22 (https://arxiv.org/html/2607.18308#bib.bib22)],以解决这些限制。尽管有这些发展,贝叶斯优化在此类设置中仍然需要越来越复杂的建模机制,这促使了对替代方法的探索。

### 2.5 大型语言模型

大型语言模型...

相似文章

多智能体LLM校准的反事实图

arXiv cs.CL

本文介绍了CAGE,一种基于反事实图的多智能体LLM系统校准方法,在TriviaQA和MMLU-Pro等基准测试上进行了评估,涵盖了多种通信拓扑结构。该方法优于现有的事后校准和LLM引导校准方法。

大型语言模型中的置信度校准

arXiv cs.AI

本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。