LLMs作为有限池材料优化的采集策略:一项控制研究
摘要
这项控制研究探讨了开源权重LLM是否能够作为有限池材料优化的采集策略,并在多个任务中将其性能与随机选择和传统高斯过程方法进行比较。
arXiv:2608.19790v1 公告类型:新
摘要:发现具有理想特性的材料通常需要在大型候选空间中搜索,而实验或计算评估仍然成本高昂。主动学习通过使用先前的观测来选择下一个评估的候选者来应对这一挑战,通常通过概率替代模型。我们研究在这一场景中,开源权重大语言模型(LLMs)是否可以作为独立的采集策略。我们在四个回顾性有限池材料优化任务中评估了五个LLMs,采用不同的候选呈现策略,并将其与随机选择和传统高斯过程方法进行比较。LLM策略通常比随机选择更少迭代次数就能达到全局最优,这表明它们无需特定任务训练就能提供有用的采集信号。它们与高斯过程方法相比的性能是混合的:传统方法在大多数任务上表现更好,而LLMs在某些设置中匹配或优于它。性能在任务、模型、初始化和候选呈现上差异显著,没有LLM方法在所有任务上都表现最佳。总体而言,开源权重LLMs作为有限池材料搜索的采集策略显示出潜力,尽管它们的可靠性仍对任务以及候选者和科学背景的呈现方式敏感。
查看缓存全文
缓存时间: 2026/08/21 10:03
# 有限池材料优化中作为获取策略的大语言模型:一项对照研究
来源:https://arxiv.org/html/2608.19790
###### 摘要
发现具有理想特性的材料通常需要在庞大的候选空间中进行搜索,而实验或计算评估的成本依然高昂。主动学习通过利用先前观测结果来选择下一个待评估的候选者以应对这一挑战,通常采用概率代理模型。我们研究了开源权重的大语言模型是否可以在此情境下充当独立的获取策略。我们在四种回顾性有限池材料优化任务中,评估了五种大语言模型在不同候选者呈现策略下的表现,并将其与随机选择和常规高斯过程方法进行比较。大语言模型策略通常比随机选择在更少的迭代次数内达到全局最优,表明它们无需针对特定任务进行训练即可提供有用的获取信号。它们相对于高斯过程方法的表现则优劣参半:常规获取方法在大多数任务上表现更好,而大语言模型在某些设置下能与之匹配或超越。性能在不同任务、模型、初始化和候选者呈现方式之间差异显著,没有任何大语言模型方法在所有任务上都表现最佳。总体而言,开源权重大语言模型在有限池材料搜索中作为获取策略显示出潜力,尽管其可靠性仍对任务以及候选者和科学背景的呈现方式较为敏感。
## 1 引言
材料科学长期是一个蓬勃发展的研究领域,新材料的发现是技术进步的关键驱动力(de Pablo et al. 2019 (https://arxiv.org/html/2608.19790#bib.bib10); Jain et al. 2013 (https://arxiv.org/html/2608.19790#bib.bib15))。然而,传统的实验和计算筛选仍然成本高昂且耗时(Schmidt et al. 2019 (https://arxiv.org/html/2608.19790#bib.bib28); Pyzer-Knapp et al. 2022 (https://arxiv.org/html/2608.19790#bib.bib24))。过去十年,机器学习通过预测材料特性并指导新材料搜索,已成为应对这些挑战的一种有前景的方法(Butler et al. 2018 (https://arxiv.org/html/2608.19790#bib.bib4); Ramprasad et al. 2017 (https://arxiv.org/html/2608.19790#bib.bib26))。在这项工作中,我们评估预训练的大语言模型能否将其学到的先验知识转化为有用的获取策略用于AI指导的材料发现,并研究其相对于已建立的材料主动学习方法的可靠性。
当实验或计算标签昂贵时,主动学习和贝叶斯优化是材料发现的标准工具(Lookman et al. 2019 (https://arxiv.org/html/2608.19790#bib.bib20))。在典型的基于代理模型的闭环实验中,优化器观察一小部分已标记的候选者,拟合一个预测模型,并通过最大化一个获取函数来选择下一个待评估的候选者,该函数捕捉了候选池中探索与利用之间的权衡。高斯过程(GPs)与预期改进(EI)或置信上界(UCB)等获取函数一起,仍然是贝叶斯优化中的有力基线,因为它们明确建模了预测性能和认知不确定性(Kushner 1964 (https://arxiv.org/html/2608.19790#bib.bib18); Srinivas et al. 2010 (https://arxiv.org/html/2608.19790#bib.bib29); Murphy 2022 (https://arxiv.org/html/2608.19790#bib.bib21))。
大语言模型提供了候选选择的不同途径。最近专注于推理的大语言模型在科学推理基准测试中表现出色(OpenAI 2024 (https://arxiv.org/html/2608.19790#bib.bib22); Guo et al. 2025 (https://arxiv.org/html/2608.19790#bib.bib14))。它们的知识范围、推理能力以及在材料科学中的适用性仍在探索中。这些能力使得大语言模型在序列化候选选择中具有吸引力,但它们在各类材料问题上的可靠性仍不明确。
我们在受控的回顾性材料主动学习基准上进行此评估,其中通过提示向大语言模型提供观测历史、候选列表和科学目标的自然语言描述。在每次迭代中,大语言模型策略从有限的候选池中恰好选择一个未观测的组成,从数据集中获取相应的属性值,并重复此过程直到选择全局最优候选者。该协议允许在相同实验条件下直接比较经典GP获取函数、独立的大语言模型选择和大语言模型获取变体。
我们将研究围绕三个问题展开:
- • 大语言模型获取策略与GP-EI相比竞争力和可靠性如何?
- • 候选者呈现方式和材料特定的语义上下文如何影响大语言模型的选择?
- • 大语言模型选择的候选者与基于GP的贝叶斯优化选择的候选者相比如何?
我们通过评估五种开源权重的大语言模型在四种材料优化任务和一系列实验条件下来回答这些问题。在这些实验中,我们观察到一个有用但不稳定的获取信号,并研究其可靠性如何受到任务、候选者呈现方式和语义上下文的影响。
## 2 相关工作
##### 用于材料发现的主动学习。
材料发现成本依然高昂,这促使人们采用机器学习方法来预测特性并指导候选者选择(de Pablo et al. 2019 (https://arxiv.org/html/2608.19790#bib.bib10); Schmidt et al. 2019 (https://arxiv.org/html/2608.19790#bib.bib28); Butler et al. 2018 (https://arxiv.org/html/2608.19790#bib.bib4))。回顾性材料基准通过将标记数据集视为预言机,为评估主动学习方法提供了一个受控环境(Wang et al. 2022 (https://arxiv.org/html/2608.19790#bib.bib30))。虽然它们不能完全复现实验部署,但允许从不同初始化进行多次试验,并在获取策略之间进行直接比较。这使它们特别适合我们的目标:隔离基于大语言模型的候选选择相对于已建立获取策略的行为,而无需考虑运行间的实验变化或候选池的改变。
##### 用于主动学习和优化的大语言模型。
大语言模型已被纳入主动学习和优化流程中,扮演多种角色。在机器学习中,大语言模型已被用于为训练下游模型选择样本(Bayer et al. 2026 (https://arxiv.org/html/2608.19790#bib.bib2); Parkar et al. 2024 (https://arxiv.org/html/2608.19790#bib.bib23)),以及在标准主动学习获取之前修剪未标记池(Azeemi et al. 2026 (https://arxiv.org/html/2608.19790#bib.bib1));Xia et al. 2025 (https://arxiv.org/html/2608.19790#bib.bib33)综述了这一更广泛的文献。在黑盒贝叶斯优化中,Chang et al. 2025 (https://arxiv.org/html/2608.19790#bib.bib5)引入了LLINBO,这是一个将大语言模型建议的查询点与统计代理模型相结合的混合框架。这些研究说明了大语言模型如何支持数据获取,无论是通过识别有用的训练样本还是通过补充传统优化器。然而,它们主要针对语言任务或一般的黑盒优化,而非专门针对材料发现。
##### 用于材料优化的大语言模型。
之前在化学和材料优化中的工作将大语言模型与概率代理模型结合(Kristiadi et al. 2024 (https://arxiv.org/html/2608.19790#bib.bib17); Ranković and Schwaller 2025 (https://arxiv.org/html/2608.19790#bib.bib27)),并使用大语言模型生成的假设或启用了工具的代理来探索大型隐式设计空间,无论是否使用贝叶斯优化(Cissé et al. 2025 (https://arxiv.org/html/2608.19790#bib.bib6); Cissé et al. 2026 (https://arxiv.org/html/2608.19790#bib.bib7))。与这些方法不同,我们专注于从显式有限候选池中进行独立的大语言模型获取。最相关的研究是Wang et al. 2026 (https://arxiv.org/html/2608.19790#bib.bib31),它在包含73到323个点的小候选池中使用生成-匹配方法(参见第C.1节 (https://arxiv.org/html/2608.19790#A3.SS1))并使用闭源权重的大语言模型。我们评估该协议在开源权重大语言模型上的表现,并将其与其他大语言模型策略进行比较。
## 3 背景
##### 基于池的主动学习协议。
设 \(X=\{x_i\}_{i=1}^N\) 是一个有限的候选材料池,具有已知标签 \(\{y_i\}_{i=1}^N\),在策略查询之前对策略隐藏。对于每个数据集和获取策略配置,候选者 \(x_i \in \mathbb{R}^d\) 表示提供给策略的表示,其中 \(d\) 取决于数据集和输入表示,\(y_i \in \mathbb{R}\) 是其标量标签。目标是在 \(\{y_i\}_{i=1}^N\) 中最大化目标值 \(y\)。在第 \(t\) 次迭代时,策略观测到
\[\mathcal{D}_t = \{(x_j, y_j) : j \in \mathcal{I}_t\},\]
其中 \(\mathcal{I}_t\) 是先前查询索引的集合,并选择一个未观测的候选者
\[i_t \in \{1, \ldots, N\} \setminus \mathcal{I}_t.\]
预言机返回 \(y_{i_t}\),观测集更新为 \(\mathcal{D}_{t+1} = \mathcal{D}_t \cup \{(x_{i_t}, y_{i_t})\}\)(且 \(\mathcal{I}_{t+1} = \mathcal{I}_t \cup \{i_t\}\))。在固定的种子下,所有方法都从相同的单个初始点开始。此外,后续每次获取恰好向 \(\mathcal{I}_t\) 添加一个新查询索引,并向 \(\mathcal{D}_t\) 添加相应的候选者-标签对。
##### 高斯过程基线。
我们与基于GP的贝叶斯优化基线进行比较。在每次迭代中,GP在观测数据 \(\mathcal{D}_t\) 上拟合,为每个未观测的候选者生成后验均值 \(\mu_t(x)\) 和后验标准差 \(\sigma_t(x)\)。我们使用预期改进(EI)获取函数(Jones et al. 1998 (https://arxiv.org/html/2608.19790#bib.bib16))。它选择:
\[i_t^{\mathrm{EI}} \in \operatorname*{arg\,max}_{i \in \{1, \ldots, N\} \setminus \mathcal{I}_t} \mathrm{EI}_t(x_i),\]
其中
\[\mathrm{EI}_t(x) = (\mu_t(x) - b_t) \Phi(z_t(x)) + \sigma_t(x) \phi(z_t(x)), \quad z_t(x) = \frac{\mu_t(x) - b_t}{\sigma_t(x)}, \quad b_t = \max_{j \in \mathcal{I}_t} y_j,\]
当 \(\sigma_t(x) = 0\) 时,我们设置 \(\mathrm{EI}_t(x) = (\mu_t(x) - b_t)_+\)。这里 \(\Phi\) 和 \(\phi\) 分别表示标准正态累积分布函数和概率密度函数。EI结合了相对于当前最佳值的预测改进和后验不确定性。在本文使用的形式中,它不需要显式的探索系数,例如GP-UCB中的 \(\beta\) 参数。
##### 随机基线。
我们还将获取策略与随机基线进行比较,其中点从未标记的剩余数据中随机采样:
\[i_t^{\mathrm{Random}} \sim \mathcal{U}(\{1, \ldots, N\} \setminus \mathcal{I}_t).\]
## 4 基于大语言模型的候选选择
##### 大语言模型获取策略。
一个大语言模型获取策略 \(\pi_{\mathrm{LLM}}\) 接收观测历史、候选列表和任务指令,然后返回下一个待评估的候选者的索引。与GP-EI在拟合代理模型后为每个剩余候选者分配显式获取分数不同,此处考虑的大语言模型策略进行直接、可能依赖列表的选择,不构建池范围的获取分数向量。为每个候选者获取单独的大语言模型评估需要与池大小成比例的额外推理,此处并非必要。它选择:
\[i_t^{\mathrm{LLM}} \sim \pi_{\mathrm{LLM}}\left(\cdot \mid \mathcal{D}_t, \mathcal{C}_t, p\right),\]
其中 \(\mathcal{C}_t\) 是呈现给大语言模型的未标记数据的有序列表,\(i_t^{\mathrm{LLM}}\) 表示其最终选择的候选者索引而非单次大语言模型调用的输出,\(p\) 是提示和解码配置。除非另有说明,我们使用材料感知提示:候选者使用语义上有意义的特征标签(如元素名称和目标属性名称)进行表示,并附带特定于材料的任务描述。这些系统提示依赖于数据集和优化目标;示例见附录B.4 (https://arxiv.org/html/2608.19790#A2.SS4)。
##### 候选者选择协议。
每个候选者选择协议在剩余池上诱导出一个基于大语言模型的获取策略。我们的主要协议是全池选择:它将所有剩余候选者以单个随机排序的列表呈现给模型,并要求模型返回它认为最有前景的候选者的显示索引。协议也可能涉及多次嵌套的大语言模型调用,但它总是为评估产生一个候选者索引。我们在第7节 (https://arxiv.org/html/2608.19790#S7) 介绍批量锦标赛协议及其分析;两种协议的实现细节见附录B (https://arxiv.org/html/2608.19790#A2)。
## 5 实验设置
##### 数据集。
我们在涵盖三个材料数据集的四个优化任务上评估我们的方法。每个任务由一个有限候选池定义,其中每个候选者都有一个向量表示和一个要最大化的标量目标。
##### Fe-Co-Ni。
Wang et al. 2022 (https://arxiv.org/html/2608.19790#bib.bib30) 引入的Fe-Co-Ni组合薄膜基准包含921个实验测量的三元组成,即 \(\mathrm{Fe}_x\mathrm{Co}_y\mathrm{Ni}_{1-x-y}\)。虽然原始库还包括X射线衍射数据和测量的磁特性,但我们仅使用组成输入。我们考虑两个目标特性:以 \(\mathrm{mrad}\) 为单位的克尔旋转和以 \(\mathrm{mT}\) 为单位的磁矫顽力。它们定义了两个单独的优化任务,分别称为**克尔旋转**和**矫顽力**。原始基准将矫顽力描述为更具挑战性的目标,因为其目标景观更复杂。
##### Matbench钢材。
Dunn et al. 2020 (https://arxiv.org/html/2608.19790#bib.bib12) 在Matbench v0.1基准中作为 `matbench_steels` 引入,该数据集被定义为一个监督回归任务,以 \(\mathrm{MPa}\) 为单位的屈服强度作为目标属性。它包含312个仅组成的条目,具有14个特征。我们遵循Wang et al. 2026 (https://arxiv.org/html/2608.19790#bib.bib31) 也为Matbench钢材使用的回顾性池优化框架,将标记数据集视为有限预言机,并要求每个获取策略最大化屈服强度。
##### Electrostrain。
此数据集源自Yuan et al. 2018 (https://arxiv.org/...) 基于BaTiO3的压电主动学习研究。相似文章
选择大语言模型擅长与不擅长的任务
该文章强调,大语言模型在处理模糊判断任务方面表现卓越,但在执行一致性计算时表现平平,因此主张在多智能体系统中实现任务专门化。
什么让大模型成为优秀优化器?——LLM引导演化搜索的轨迹分析
对15个大模型在8项任务上的大规模研究表明,优化成功的关键在于保持局部化搜索轨迹,而非初始解题能力或解的新颖性。
本地LLM推理优化:完整指南
一份关于在消费级硬件上优化本地LLM推理的全面指南,涵盖llama.cpp、vLLM和LM Studio等工具,并提供关于内存层次结构、层放置和常见故障模式的实用建议。
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
我们比较了不同LLM在IMO 2026上的表现 [R]
本研究评估了前沿和开放权重LLM在IMO 2026题目上的表现,证明像AutoFyn这样的专用工具链能显著提升次前沿模型的性能,不过在最难的题目上仍然存在幻觉问题。