前沿大语言模型是高效的批量优化器:评估推理模型在连续和离散环境中的表现

arXiv cs.LG 论文

摘要

本文研究评估了前沿大语言模型在连续和离散环境中作为批量优化器的表现,发现它们在数值任务上具有竞争力,但在语义丰富的环境中比传统方法更有效。

arXiv:2609.03177v1 公告类型:新 摘要:前沿大语言模型(LLMs)由于其大规模预训练,使其能够导航各种优化环境,已成为优化的有吸引力的先验。然而,现代推理LLMs在批量优化环境中的有效性仍然未被充分探索。在此,我们研究了当前一代前沿LLMs作为批量优化器在连续和离散环境中的表现。我们发现,虽然LLMs在数值测试函数上是具有竞争力的零样本批量优化器,但与经典的非LLM优化方法相比,它们的表现较为脆弱。然而,LLM先验在语义丰富的环境中显著更好,表明当在与预训练数据结构最相似的离散空间中进行导航和推理时,它们的批量优化行为非常有效。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:22

# 前沿大语言模型是有效的批量优化器:在连续与离散场景中评估推理模型  
来源:https://arxiv.org/html/2609.03177  
作者:Shriram Chennakesavalu, David Graff  
所属机构:Prescient Design, Genentech  
地点:美国加利福尼亚州南旧金山  
邮箱:[[email protected]](mailto:[email protected])

###### 摘要  
前沿大语言模型(LLM)因其大规模预训练能适应多样优化任务,已成为优化领域备受关注的先验模型。然而,现代推理型LLM在批量优化场景中的有效性尚未得到充分探索。本文研究了当前一代前沿LLM在连续与离散场景中作为批量优化器的表现。我们发现,虽然LLM在数值测试函数上作为零样本批量优化器具有竞争力,但其性能相较于传统非LLM优化方法更为脆弱。不过,在语义丰富的场景中,LLM先验模型表现显著更优,表明当在结构最接近预训练数据的离散空间中进行导航与推理时,其批量优化行为极具效率。

## 1 引言  
前沿大语言模型(LLM)随着预训练语料库和强化学习协议的持续发展而日益强大,赋予这些模型卓越的推理能力,使其能处理更长、更复杂的任务。这使得它们在诸多应用中备受青睐,尤其是编程[1]、数学[2]以及最近的科学发现[3,4]领域。尽管LLM能力的持续进化令人瞩目,但这些模型在黑盒优化(BBO)[5,6]场景中的有效性仍不明确——在此类场景中,目标评估函数的计算成本高昂,使暴力优化难以实现。这种情况在科学领域(如小分子药物发现)中普遍存在,因为对小分子设计的候选评估需要投入大量时间和资源,意味着在组合复杂的设计空间中,评估预算极为有限[7,8]。  

针对连续与离散场景中的BBO问题,已有许多专用方法被开发,也有一些研究探讨了早期版本的LLM在类似问题上的表现[9,10,11,12],但当前一代推理型LLM在连续与离散场景批量优化上的表现仍不明朗。评估这些能力将有助于更好地刻画基于这些模型的策略优化行为,同时揭示失败模式和改进方向。本研究探讨了Anthropic系列模型(Sonnet 4.6[13]、Opus 4.8[14]、Opus 5[15])作为批量优化器在一系列连续与离散BBO任务中的表现。对于连续搜索空间,我们使用一组不同维度的经典优化函数,并通过伪装其定义域和值域以最小化模型的记忆利用。对于离散场景,我们选择基于实用分子优化(PMO)[16]基准中预言机集合的分子优化任务。分子优化通过使用SMILES[17]字符串作为表示,易于通过自然语言进行推理,且确定性预言机支持直接验证。  

总体而言,我们发现前沿推理型LLM可以是有效但脆弱的数值优化器,其性能可媲美采用高斯过程代理模型和期望改进采集函数的经典贝叶斯优化,但整体表现严重依赖任务变换、维度和批量大小。然而,我们证明在离散分子优化场景中,前沿推理型LLM既高性能又高效,通常仅用极小部分的预言机采样预算即可超越专用方法。

## 2 相关工作  
**贝叶斯优化**  
贝叶斯优化(BO)是一种针对黑盒优化的全局优化方法[18]。它是一种主动学习方法,采用概率代理模型$\hat{f}$描述输入域$\mathcal{H}$上目标的后验预测分布,并通过采集函数$\alpha(h; \hat{f}, \mathcal{D})$量化评估输入$h \in \mathcal{H}$的效用(条件于已拟合的代理模型$\hat{f}$和测量数据集$\mathcal{D}$),以指导下一点的选取。高斯过程(GP)[19]是常用的代理模型,因其通过核函数定义直观的先验分布且后验推断具有解析解[20]。常见的采集函数包括上置信界(UCB)和期望改进(EI),它们在探索空间与利用有希望区域之间取得平衡。BO是许多领域(如材料科学[21]、化学[22]、生物学[23]、机器人学[24])优化黑盒函数的热门选择。  

**用于优化的预训练模型**  
先前工作已探索将预训练模型应用于优化任务。这些工作大体可分为两类:(1)预训练Transformer模型以模仿合成任务中的分词优化轨迹[9,10];(2)利用预训练LLM增强BO循环的各个组件[11,25]。与我们工作最相似的是[12]和[26],两者均采用基于提示的方法作为完整优化策略的替代。但这些方法未探索将LLM批量优化策略应用于标准BO测试函数,也未将这些方法用于分子优化。最重要的是,自这些先前研究以来,LLM能力已大幅提升。因此,有必要使用能力显著更强的前沿模型重新审视这些方法论。  

**分子优化**  
优化分子特性是开发新型功能材料(如药物、光伏器件、电池)的关键挑战。提高目标特性主要有两种策略:(1)在预定义库中进行正向搜索,根据特性本身(或其某种代理)*筛选*分子;(2)逆向设计,根据目标特性规范*生成*分子[27]。LLM已以多种方式用于分子优化:作为优化特性的分子生成器[28,29,30,31]、用于特性预测的分子表示学习器[32,33]、特性预测器本身,以及闭环优化协议中各组件的增强工具[25,34,35]。

## 3 背景  
### 3.1 黑盒优化  
我们考虑黑盒优化场景,其中给定目标函数$f:\mathcal{H} \rightarrow \mathbb{R}$,$\mathcal{H}$为搜索空间(可呈现不同形式,例如$d$维搜索空间$\mathcal{H} \subset \mathbb{R}^d$,或如语言建模中的离散空间)。我们旨在通过寻找最优$h^* \in \mathcal{H}$($h^* = \arg\max_{h \in \mathcal{H}} f(h)$)来最大化目标函数。若特定问题的最优值已知,则可通过瞬时遗憾$r_i = f(h^*) - f(h_i)$衡量提议点与最优解的接近程度。本文关注迭代优化$f$,具体优化策略在$N/q$轮预算内生成点轨迹($N$为目标函数总预算,每轮策略可提议单个$h \in \mathcal{H}$或一批点$\{h_i\}_{i=1}^q \subset \mathcal{H}$进行目标函数评估)。在此场景中,还可考虑轨迹上的简单遗憾$r = \min_i r_i$(即瞬时遗憾的最小值),遗憾值越低越好。

### 3.2 用于黑盒优化的LLM  
本研究聚焦于Anthropic前沿自回归LLM系列,比较Sonnet 4.6、Opus 4.8和Opus 5的性能演进。自回归LLM可视为策略$\pi$,我们可根据提示$x \in \mathcal{X}$采样响应$y \in \mathcal{Y}$($\mathcal{X}$和$\mathcal{Y}$均为离散空间)。对于BBO,提示$x \in \mathcal{X}$包含与优化问题相关的信息(如先前选择的点、目标函数下的值、剩余轮数预算)。我们采样的响应$y \sim \pi(\cdot \mid x)$自然呈现为个体响应的轨迹,每个响应包含一个待评估的提议点或一批点。我们还评估了LLM在单轮与多轮设置中的效果:在单轮设置中,第$i$轮的提示$x_i$包含先前选择的点、目标函数$f$下的值,响应采样为$y_i \sim \pi(\cdot \mid x_i)$;在多轮设置中,模型保持一次对话,允许反思优化过程中生成的先前推理。虽然先前工作已探讨LLM在不同优化场景中的效能[11,12,25],但我们关注当前前沿推理型LLM在这些优化场景中的有效性。

## 4 实验设计  
### 4.1 合成优化任务  
我们首先使用已知最优解的经典测试函数(Branin、Hartmann-3、Hartmann-6、Ackley、Rastrigin)在合成优化任务上评估前沿LLM的表现。关于这些合成测试函数及其最优解的总结,请参考附录A.1。对于每个函数,我们将定义域归一化至$[0,1]^d$并执行必要的取反操作,使每个任务均可表述为最大化问题。随后,我们在单轮与多轮设置中评估每个LLM,批量大小$q=1,2,4$,模型在每步轨迹上生成点集$\{h_i\}_{i=1}^q \subset [0,1]^d$。为确保整体优化预算匹配,我们固定总运行预算为$N=120$,初始点数为$2d$(基于问题维度),每个批量大小下的轨迹长度计算为$N/q$。除在这些函数原始版本上测试外,我们还通过应用定义域双射变换$\mathcal{T}:[0,1]^d \rightarrow [0,1]^d$测试其伪装变体。具体而言,该双射定义为三个逐轴变换的复合:  

$$
\mathcal{T} = \mathcal{P} \circ \mathcal{F} \circ \mathcal{W}
$$  

其中$\mathcal{P}$为轴的置换($\mathcal{P}(h) = \sigma(h)$);$\mathcal{F}$为轴的独立伯努利翻转($\mathcal{F}(h_i) = (1-B)h_i + B(1-h_i)$,$B \sim \operatorname{Bern}(0.5)$);$\mathcal{W}$为轴的幂变换($\mathcal{W}(h_i) = h_i^a$,$a \sim \mathcal{U}(0.5,2.0)$)。此定义域双射改变了每个测试函数的景观并将最优点$h^*$移位,但未改变目标函数值$f(h^*)$。我们进一步对每个函数的输出$y=f(h)$应用仿射变换$\mathcal{S}$:$\mathcal{S}(y) = ay + b$($a \sim \operatorname{LogUniform}(1/3,3)$,$b \sim \mathcal{U}(-10,10)$)。我们将基于LLM的优化策略与采用GP代理和EI采集函数的BO策略(“GP-EI”)及随机基线进行比较。所有方法使用相同的批量大小和总样本预算进行评估,并基于五个随机种子下最佳提议点的简单遗憾(作为轮数的函数)和获得的最低遗憾值进行评估。

### 4.2 分子优化任务  
对于语义更丰富的优化任务,我们在PMO[16]描述的分子优化任务套件上评估LLM,该套件测试不同方法以样本高效方式最大化小分子预言机的能力。与合成测试函数不同,这些优化问题通过SMILES[17]字符串自然呈现离散的自然语言表示,且这些预言机没有解析最优解。我们选择此分子优化任务(而非其他自然语言基准)是因为其具备廉价且确定性的预言机函数,意味着在评估特定任务改进或特定预言机性能时没有歧义。我们在所有23个PMO预言机上评估所有三个前沿LLM(再次测试单轮与多轮设置)。

相似文章

LLM推理的有效前沿

Hacker News Top

本文解释了LLM推理中的有效前沿概念,涵盖了延迟、吞吐量和成本之间的权衡,并概述了在部署中管理或提高效率的技术。

量化并缓解前沿大语言模型中的过早闭合

arXiv cs.CL

本文定义并衡量了前沿大语言模型中的过早闭合现象,发现即使正确选项被移除或需要澄清时,模型仍频繁给出自信的回答,凸显了医疗应用中的一个关键安全问题。