BBOWP-Bench:评估LLM在黑盒优化文字问题上的性能

arXiv cs.CL 论文

摘要

介绍了BBOWP-Bench,一个用于评估LLM在黑盒优化文字问题上的基准测试套件。在这些问题中,系统必须从自然语言描述中推断搜索空间和优化算法。初步结果显示,LLM能够选择合适算法,但在搜索空间设计方面存在困难。

arXiv:2608.02612v1 公告类型:新 摘要:优化问题的表述方式会强烈影响最终解的质量,但好的表述通常需要大量专业知识。因此,近期研究探讨了如何从自然语言描述中自动推导优化问题,但现有基准侧重于目标函数和约束可以明确写成数学表达式的场景。许多实际重要的问题天然适合作为黑盒优化(BBO)问题来处理,其中只能观测到目标值,而函数形式无法获取。在BBO中,搜索空间设计(问题表述的一部分)以及优化算法的选择对问题求解至关重要。使用大型语言模型(LLM)来自动化这些过程是一项重大挑战。本文提出了黑盒优化文字问题(BBOWP),这是一种新颖的问题设定,系统必须从黑盒优化任务的自然语言描述中同时推断出搜索空间和优化算法。为支持该设定下的研究,我们建立了BBOWP基准测试套件(BBOWP-Bench),这是一个用于BBOWP的数据集和评估框架。每个实例结合了自然语言问题描述、可执行的评估环境和人工设计的基线表述,从而能够同时评估搜索空间设计和算法选择。利用该基准,我们首次对LLM进行了评估,并表明当前LLM能够根据给定的评估预算选择合适的算法。然而,它们有时在搜索空间设计上存在困难,尤其是在问题描述信息较少或搜索空间高度依赖具体问题的情况下,难以识别重要变量并平衡其取值范围。我们的代码和数据集可在 https://github.com/shiralab/bbowp-bench 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:40

# BBOWP-Bench:评估LLM在黑盒优化文字问题上的表现
Source: https://arxiv.org/html/2608.02612

Yutaro Yamada, Kei Hiroshima\(^1\), Nozomu Yoshinari\(^1\), Kento Uchida, Shinichi Shirakawa

Yokohama National University

\{yamada\-yutaro\-dw,hiroshima\-kei\-st,yoshinari\-nozomu\-ry\}@ynu\.jp  
\{uchida\-kento\-fz,shirakawa\-shinichi\-bg\}@ynu\.ac\.jp

###### 摘要

优化问题的形式化表述对最终解的质量有很大影响,然而良好的形式化通常需要大量专业知识。因此,近期研究开始探讨如何从自然语言描述中自动推导优化问题,但现有基准主要关注目标函数和约束能够显式写成数学表达式的场景。许多实际重要问题,包括机器学习中的超参数优化,天然地被建模为黑盒优化(BBO)问题,其中只能观测到目标值,而函数形式不可得。在 BBO 中,搜索空间设计(问题形式化的一部分)以及优化算法的选择对问题求解至关重要。利用大型语言模型(LLM)自动化这些过程是一项重大挑战。本文提出了黑盒优化文字问题(BBOWP),这是一种新颖的问题设置:系统必须从黑盒优化任务的自然语言描述中推断出搜索空间和优化算法。为了支持该设置的研究,我们建立了 BBOWP Benchmark Suite(BBOWP-Bench),这是一个面向 BBOWP 的数据集和评估框架。每个实例都包含自然语言问题描述、可执行的评估环境以及人工设计的基线形式化,从而能够同时评估搜索空间设计和算法选择。该基准涵盖来自四个不同应用领域的 23 个实例,并通过实际黑盒优化运行支持可复现的评估。利用这一基准,我们首次对 LLM 进行了评估,结果表明当前 LLM 能够根据给定的评估预算选择合适的算法。然而,当问题描述信息较少或搜索空间高度特定于问题时,它们有时在搜索空间设计上存在困难,特别是在识别重要变量和平衡其取值范围方面。我们的代码和数据集可在 https://github.com/shiralab/bbowp-bench 获取。

图1:(左)BBOWP 中考虑的典型场景。用户请元求解器为其任务形式化一个 BBO 问题,但用户在描述任务时可能尚未实现目标函数。(右)BBOWP 基准套件概览。给定包含最大函数评估次数 $N_{\mathrm{max}}$ 等问题描述 $d$,元求解器确定合适的优化算法 $a$ 和搜索空间 $S$。然后,通过实际优化运行,使用经标识符映射的内置目标函数来评估该形式化。

## 1 引言

优化问题的形式化表述对解质量有重大影响。然而,确定问题的关键要素(如设计变量和目标)并将其表达为求解器可直接使用的形式,通常需要大量专业知识。因此,已有工作研究了如何从自然语言描述中自动形式化优化问题。近期的数据集和基准覆盖了多种优化类别,从线性规划设置(如 NL4Opt (ramamonjison2022nl4opt))到更近期的非线性优化资源 (huang2025mamo; yang2024optibench; huang2025orlm; lu2025optmath),并支持对从文本中提取变量、目标和约束等任务进行评估。这一系列工作产生了有用的数据集和评估设置,但现有基准仍主要针对目标函数和约束可以显式写为数学表达式的问题类别。相比之下,许多重要的现实世界任务,包括超参数优化、分子设计和结构形状优化,更自然地建模为黑盒优化(BBO)问题。在 BBO 中,只能观测到目标值,底层函数形式未知或难以处理。因此,BBO 自动形式化的进展不仅需要新方法,还需要能够度量形式化质量和下游优化性能的基准数据集。

与此同时,已有观点认为需要包含丰富元数据的 BBO 基准 (song2024position)。现有的 BBO 基准(如 COCO (coco))包含的问题上下文元数据很少。然而,在实践中,利用先验知识对于实现高效优化至关重要,而利用大型语言模型(LLM)挖掘此类信息可以是一个关键方向。这一观点也推动了开发带有自然语言任务信息的 BBO 基准。

在这些研究的基础上,我们提出了黑盒优化文字问题(BBOWP),一种面向 BBO 领域自动形式化的新颖问题设置。在 BBOWP 中,系统接收自然语言问题描述,必须推断出合适的搜索空间和优化算法。为了加速 BBOWP 研究,我们开发了 BBOWP Benchmark Suite(BBOWP-Bench),将自然语言问题描述与设计变量域定义、可执行评估环境以及人工设计的参考形式化配对。我们还设计了一种评估协议,既支持与人工基线进行比较,也支持通过实际 BBO 运行进行评估。利用这一框架,我们对多个 LLM 进行了首次基准研究,发现当前 LLM 在提供详细问题描述时能够根据评估预算选择合适的算法。然而,当问题描述信息较少时,它们往往难以识别重要变量并设置合适的取值范围。

我们的贡献总结如下:(1)我们提出了 BBOWP,这是一种新的问题设置,要求系统从自然语言描述中推断出 BBO 任务的搜索空间和合适的优化算法。(2)我们推出了 BBOWP-Bench,一个为 BBOWP 设计的数据集,将自然语言问题描述与可执行评估环境和人工设计的基线形式化配对。(3)我们设计了一种评估协议,

相似文章

InferenceBench:面向AI代理的开放式LLM推理优化基准测试

arXiv cs.AI

InferenceBench是一个基准测试,用于评估AI代理在多个瓶颈场景下使用H100 GPU优化LLM推理速度的表现。结果显示,代理虽然优于简单基线,但常常收敛于单一框架,且性能不及简单的超参数搜索,表明需要更好的探索策略。

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。

MA-ProofBench:一种用于数学分析中定理证明的LLMs两级评估

arXiv cs.AI

MA-ProofBench是一个新的形式化基准,用于评估LLMs在数学分析中的定理证明能力,包含200个问题,分为两个难度级别。最佳模型GPT-5.5在Level I上仅达到16%,在Level II上为5%,突显了非形式化推理与形式化推理之间的显著差距。