ORAgentBench:LLM代理能否端到端解决具有挑战性的运筹学任务?
摘要
本文介绍ORAgentBench,一个用于评估LLM代理在端到端运筹学任务中表现的执行基准,包含107个经过人工审查的任务。实验表明,当前最佳代理仅通过35.51%的任务,揭示了在可靠决策制定方面的重大不足。
arXiv:2606.19787v1 公告类型: 新论文
摘要:大型语言模型越来越多地被部署为可执行环境中执行多步骤任务的自主代理,但它们执行实际运筹学工作的能力仍不明确。现有的运筹学评估通常将建模与求解分离,依赖于预形式化或纯文本实例,很少测试从操作工件到已验证决策的完整工作流程。在这项工作中,我们引入了ORAgentBench,一个基于执行的基准,用于评估自主代理在具有挑战性的端到端运筹学任务上的表现。它包含107个经过人工审查的任务,涵盖多种操作场景,每个任务都封装在一个独立的环境中,包括自然语言简介、多文件数据、配置工件以及所需的提交模式。代理必须编写并运行解决方案代码,其提交内容由隐藏验证器进行模式有效性、硬约束可行性以及归一化目标质量的评估。使用14种前沿代理模型配置进行的实验表明,当前代理远未能达到可靠的运筹学实践水平。最佳代理仅通过35.51%的所有任务和20.59%的困难任务,许多可行的提交仍低于所需的质量阈值。失败分析进一步表明,错误主要由策略性弱点主导,包括遗漏操作规则、脆弱的公式化、弱的可行解构建以及不足的解改进。运筹学特定的程序性技能提高了困难任务的可行性,但未能可靠地提高解质量或通过率。这些结果表明,运筹学代理的进展需要超越可实现的优化代码,转向可靠、高质量的操作决策制定。
查看缓存全文
缓存时间: 2026/06/20 14:33
# ORAgentBench:LLM 代理能否端到端解决具有挑战性的运筹学任务?来源:https://arxiv.org/html/2606.19787
李佳俊¹ 蔡明树² 李怡萱³ 丁宇¹,⁴ 侯然¹ 聂冠宇⁴ 韩雄伟⁴ 王万元¹
¹东南大学计算机科学与工程学院
²早稻田大学
³南洋理工大学
⁴华为诺亚方舟实验室
###### 摘要
大型语言模型越来越多地被部署为在可执行环境中执行多步任务的自主代理,但其执行现实运筹学(OR)工作的能力仍不明确。现有的运筹学评估通常将建模与求解解耦,依赖于预先形式化或纯文本的实例,并且很少测试从操作工件到经过验证的决策的完整工作流程。在这项工作中,我们介绍了ORAgentBench,一个基于执行的可信基准测试,用于评估自主代理在具有挑战性的端到端运筹学任务上的表现。它包含107个人工审核的任务,涵盖多种运营场景,每个任务都打包在一个隔离环境中,包含自然语言简介、多文件数据、配置文件工件和所需的提交模式。代理必须编写并运行解决方案代码,然后通过隐藏的验证器对其提交结果进行模式有效性、硬约束可行性和归一化目标质量评估。对十四个前沿代理模型配置的实验表明,当前的代理远未达到可靠的运筹学实践水平。表现最好的代理仅通过所有任务的35.51%和困难任务的20.59%,并且许多可行的提交结果仍低于所需的质量阈值。故障分析进一步表明,错误主要由策略性弱点主导,包括遗漏操作规则、脆弱的公式化、薄弱的可行解构造以及不足的解改进。特定于运筹学的程序性技能提高了困难任务的可行性,但并未可靠地改善解质量或通过率。这些结果表明,运筹学代理的进步需要超越生成看似合理的优化代码,转向可靠、高质量的运营决策制定。代码可在ORAgentBench (https://github.com/ORAgentBench/ORAgentBench)获取。
## 1 引言
运筹学(OR)支撑着货运路线规划(Toth and Vigo,2014 (https://arxiv.org/html/2606.19787#bib.bib37))、员工排班(Pinedo,2016 (https://arxiv.org/html/2606.19787#bib.bib29))、生产计划(Pochet and Wolsey,2006 (https://arxiv.org/html/2606.19787#bib.bib30))、能源调度(Conejo et al.,2010 (https://arxiv.org/html/2606.19787#bib.bib7))、库存控制(Zipkin,2000 (https://arxiv.org/html/2606.19787#bib.bib50))和公共服务分配(Daskin,2013 (https://arxiv.org/html/2606.19787#bib.bib8))等高价值运营决策。即使在可行性、利用率、延迟、成本或服务可靠性方面的微小改进,也能产生显著的经济和社会影响。然而,现实的运筹学工作很少仅通过公式化就能解决。实际的数学规划是一个端到端的工程工作流程,它通过迭代的数据核对、模型设计、实现、验证以及针对操作约束的修订(Williams,2013 (https://arxiv.org/html/2606.19787#bib.bib39)),将模糊的操作需求转化为可执行或可审计的决策工件。该工作流程通常需要领域专家、数据专家、建模与求解专家以及软件工程师的协同专业知识,这使得实际的运筹学项目成本高昂、耗时且容易出错。
参见图注
图1:ORAgentBench 的动机。现实的运筹学工作依赖于协同的多专家工作流程;现有基准测试测试孤立的阶段,而 ORAgentBench 则评估完整的可执行运筹学工作流程。
近期基础模型的进展显著扩展了 AI 代理的操作范围。代理在基于执行的领域已显示出早期进展,包括软件工程(Jimenez et al.,2024 (https://arxiv.org/html/2606.19787#bib.bib18); Yang et al.,2026 (https://arxiv.org/html/2606.19787#bib.bib43); Zhang et al.,2026 (https://arxiv.org/html/2606.19787#bib.bib47))、网页与计算机使用\{NoHyper\}(Zhou et al.,2024 (https://arxiv.org/html/2606.19787#bib.bib49); Xie et al.,2024 (https://arxiv.org/html/2606.19787#bib.bib41))、自动化科学及研究工作流程(Gottweis et al.,2026 (https://arxiv.org/html/2606.19787#bib.bib13); Schmidgall et al.,2025 (https://arxiv.org/html/2606.19787#bib.bib32)),以及更广泛的现实世界代理设置(Tang et al.,2026 (https://arxiv.org/html/2606.19787#bib.bib36); Ye et al.,2026 (https://arxiv.org/html/2606.19787#bib.bib45))。然而,它们在运筹学领域的能力仍不明确,特别是在现实的端到端运筹学任务方面。如图1 (https://arxiv.org/html/2606.19787#S1.F1)所示,这种不确定性反映了现有运筹学代理评估与现实运筹学工作流程之间的不匹配。当前的运筹学基准测试捕获了该工作流程的重要部分,但并非完整的端到端过程。以求解器为中心的基准测试在已经形式化的优化实例上评估算法(Gleixner et al.,2021 (https://arxiv.org/html/2606.19787#bib.bib11); Stuckey et al.,2014 (https://arxiv.org/html/2606.19787#bib.bib34)),将基于操作工件的建模排除在评估之外。以建模为导向的基准测试测试模型能否从问题描述中生成公式、求解器代码或数值答案(Ramamonjison et al.,2023 (https://arxiv.org/html/2606.19787#bib.bib31); Huang et al.,2024a (https://arxiv.org/html/2606.19787#bib.bib14); AhmadiTeshnizi et al.,2024 (https://arxiv.org/html/2606.19787#bib.bib2)),但通常不评估代理能否核对数据、执行和修复代码,并在运行时约束下生成经过验证的决策。最近的代理运筹学系统突显了工作流程级优化代理的前景(Zhang et al.,2025 (https://arxiv.org/html/2606.19787#bib.bib46); Song et al.,2026 (https://arxiv.org/html/2606.19787#bib.bib33)),但仍未确定代理能否完成从操作工件到最终决策工件的现实运筹学工作。
这些差距暴露了一个更深层次的问题:现有的评估通常将建模与求解分开,而现实的运筹学需要联合设计。一个运筹学代理必须选择一种建模策略 φθ,τ,该策略能准确捕获需求而不产生过度庞大或脆弱的公式化表达,同时选择一种求解策略 ψθ,τ,该策略能在时间限制内通过精确方法、启发式方法、基于修复的方法或混合方法获得良好的可行解。因此,仅限于公式或预形式化实例的基准测试无法区分能写出看似合理方程的代理与能完成实际运筹学工作的代理。
为了填补这一空白,我们引入了ORAgentBench,这是一个包含107个可执行任务的基准测试,用于评估代理在现实运筹学工作流程中的表现。任务来源于运筹学论文、真实工业场景和基准测试种子实例,并被打包成隔离环境。代理的评估标准是其在这些约束条件下生成可行、高质量决策工件的能力。总结来说,我们的贡献如下:
- •ORAgentBench。我们引入了首个用于评估现实端到端运筹学代理的基准测试,涵盖107个可执行任务。
- •全面的基准评估。我们评估了前沿模型与工具链的组合,结果表明当前代理仍难以可靠地完成现实的端到端运筹学任务。
- •技能增强型运筹学代理的分析。我们研究了领域特定技能指导如何影响代理性能。结果表明,技能塑造了故障分布,而非统一提升性能:它们提高了困难任务的可行性,但未能可靠地提高质量或通过率。
表1:与现有运筹学和代理基准测试在多个维度上的比较:Multi-files表示多个输入工件;Multi-turns表示模拟用户交互;Long-horizon表示扩展的任务轨迹;Model表示优化建模;Execution表示代码或求解器执行;Quality Eval.表示解质量评估;Isolated env.表示沙箱执行环境。✓ = 完全支持;△ = 部分支持;× = 不支持。
| 基准测试 | Multi-files | Multi-turns | Long-horizon | Model | Execution | Quality Eval. | Isolated env. |
| :--- | :---: | :---: | :---: | :---: | :---: | :---: | :---: |
| NL4Opt(Ramamonjison et al.,2023) | × | × | × | ✓ | ✓ | × | × |
| IndustryOR(Huang et al.,2024a) | × | × | × | ✓ | ✓ | × | × |
| MIPLIB-NL(Li et al.,2026) | ✓ | × | × | ✓ | ✓ | × | × |
| MIPLIB(Gleixner et al.,2021) | △ | × | × | × | ✓ | ✓ | × |
| CVRPLIB(Uchoa et al.,2017) | △ | × | × | × | ✓ | ✓ | × |
| CO-Bench(Sun et al.,2025) | △ | × | ✓ | × | ✓ | ✓ | △ |
| MLE-Bench(Chan et al.,2025) | ✓ | × | ✓ | × | ✓ | ✓ | ✓ |
| Terminal-Bench(Merrill et al.,2026) | ✓ | × | ✓ | × | ✓ | △ | ✓ |
| SWE-Bench(Jimenez et al.,2024) | ✓ | × | ✓ | × | ✓ | × | ✓ |
| ORAgentBench (Ours) | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
## 2 相关工作
### 2.1 用于优化建模的大语言模型
用于优化建模的大语言模型已从方程生成发展到可执行的建模工作流程。先前的工作通过领域训练和合成数据改进了公式化和求解器代码的生成(Huang et al.,2024a (https://arxiv.org/html/2606.19787#bib.bib14); Lu et al.,2025 (https://arxiv.org/html/2606.19787#bib.bib22)),并将建模扩展到迭代执行、修复、调试和编码代理工作流程(AhmadiTeshnizi et al.,2024 (https://arxiv.org/html/2606.19787#bib.bib2); Zhang et al.,2025 (https://arxiv.org/html/2606.19787#bib.bib46); Song et al.,2026 (https://arxiv.org/html/2606.19787#bib.bib33))。然而,这些工作主要测试模型是否能生成看似合理的公式或求解器代码,而非代理能否选择强大且有效的抽象和公式化表达。ORAgentBench 通过执行解决方案和经过验证的决策质量,在现实的运筹学工作流程中评估建模选择,从而针对这一缺失的能力。
### 2.2 运筹学与代理基准测试
现有的基准测试评估了运筹学代理能力的重要部分,但并非现实运筹学工作所需的完整工件到决策工作流程。经典的运筹学基准测试(如 MIPLIB 和 CVRPLIB(Gleixner et al.,2021 (https://arxiv.org/html/2606.19787#bib.bib11); Uchoa et al.,2017 (https://arxiv.org/html/2606.19787#bib.bib38)))在已形式化的实例上严格评估求解器或算法,将操作工件的建模排除在评估之外。面向大语言模型的运筹学基准测试将评估推向更接近基于语言的建模和求解器辅助的决策生成。NL4Opt 和 Mamo 通过求解器支持的检查评估自然语言数学建模(Ramamonjison et al.,2023 (https://arxiv.org/html/2606.19787#bib.bib31); Huang et al.,2025 (https://arxiv.org/html/2606.19787#bib.bib16));IndustryOR、OptiBench、OptMATH 和 MIPLIB-NL 将这一方向扩展到实际运筹学、求解器辅助的端到端求解、可扩展的合成构造以及工业规模混合整数规划(Huang et al.,2024a (https://arxiv.org/html/2606.19787#bib.bib14); Yang et al.,2025b (https://arxiv.org/html/2606.19787#bib.bib44); Lu et al.,2025 (https://arxiv.org/html/2606.19787#bib.bib22); Li et al.,2026 (https://arxiv.org/html/2606.19787#bib.bib20))。对于组合优化,CO-Bench 评估代理算法搜索(Sun et al.,2025 (https://arxiv.org/html/2606.19787#bib.bib35)),而 NLCO 研究 CO 问题上的直接自然语言推理(Jiang et al.,2026 (https://arxiv.org/html/2606.19787#bib.bib17))。这些基准测试共同涵盖了关键的语言到建模、求解器辅助求解和 CO 推理能力,但未涵盖从操作工件到验证决策的完整工作流程。
通用的代理基准测试评估软件工程(Jimenez et al.,2024 (https://arxiv.org/html/2606.19787#bib.bib18); Yang et al.,2025a (https://arxiv.org/html/2606.19787#bib.bib42))、机器学习工程(Chan et al.,2025 (https://arxiv.org/html/2606.19787#bib.bib6); Huang et al.,2024b (https://arxiv.org/html/2606.19787#bib.bib15))、网页交互(Zhou et al.,2024 (https://arxiv.org/html/2606.19787#bib.bib49); Koh et al.,2024 (https://arxiv.org/html/2606.19787#bib.bib19))、桌面控制(Xie et al.,2024 (https://arxiv.org/html/2606.19787#bib.bib41); Bonatti et al.,2024 (https://arxiv.org/html/2606.19787#bib.bib5))以及更广泛的异构设置(Liu et al.,2024 (https://arxiv.org/html/2606.19787#bib.bib21); Froger et al.,2026 (https://arxiv.org/html/2606.19787#bib.bib10))中的基于执行的任务。然而,它们的输出通常是补丁、动作、报告或任务完成,而不是经过可行性和目标质量评估的受约束的运营决策。
ORAgentBench 通过将真实的多文件执行环境与运筹学风格的验证(针对受约束、目标驱动的决策工件)相结合来填补这一空白,如表1 (https://arxiv.org/html/2606.19787#S1.T1)所示。
## 3 ORAgentBench
### 3.1 问题定义
为了弥合简化的文本到公式化评估与现实部署操作严谨性之间的差距,我们形式化定义了一个端到端运筹学(OR)任务为:
τ = (D, C, q, E, V), (1)
其中 D 和 C 表示输入数据和配置,q 是一个自然语言操作简报,E 表示一个隔离的沙箱执行环境,V 是一个隐藏的任务特定验证器。给定公开的任务包 Iτ = (D, C, q),一个由参数 θ 参数化的自主运筹学代理 Aθ 生成一个可执行程序:
pθ = Aθ(Iτ). (2)
在环境 E 中运行 pθ 得到一个具体的决策工件:
s = ExecE(pθ; D, C), (3)
该工件随后由验证器 V 通过目标分数进行量化:
Score(θ, τ) = V(s). (4)
验证器 V 在三个渐进的维度上严格评估 s:输出模式有效性、硬约束可行性和目标质量。具体来说,我们将程序 pθ 视为由两个耦合的内部决策驱动的一个可观察实现:一个潜在建模策略 (φθ,τ ∈ Φ) 和一个潜在求解策略 (ψθ,τ ∈ Ψ)。这个双策略生成过程可以概念性地表示为:
pθ = Aθ(Iτ | φθ,τ, ψθ,τ), (5)
其中 φθ,τ 和 ψθ,τ 表示隐含的认知选择,而非需要外部提交的内容。这一形式化从根本上将 ORAgentBench 与传统的自然语言到公式化基准测试区分开来。先前的评估范式主要测试模型的翻译能力。相比之下,现实的运筹学应用呈现出一个双相似文章
MerchantBench:评测LLM智能体在电子商务运营中的长期连贯性
MerchantBench是一个新的基准测试,用于评估LLM智能体在电子商务运营中的长期连贯性,采用包含98,843条真实商品记录和26种工具的365天订单级模拟。结果显示,最佳LLM的最终净资产仅达到人类参与者平均值的27.3%,凸显了巨大的能力差距。
Business Arena:在现实市场中对LLM智能体进行基准测试
Business Arena 是一个新的基准测试,在真实的跨境店铺环境中评估 LLM 智能体,揭示了与人类策略之间的巨大性能差距,并能够对商业决策进行详细归因。
智能体基准决策需要多少任务?对公开LLM智能体基准的重放分析
本文分析了在LLM智能体基准的部分评估中,需要多少任务才能得出与完整基准相同的两两对比结论。研究发现所需任务比例在不同基准间差异很大,并提出了部分评估的报告标准。
扮演真正的研究者:一套评估前沿大语言模型及代理系统在研究生命周期中的基准测试集
本文介绍了AARR(扮演真正的研究者)基准系列,旨在评估前沿大语言模型和代理系统在细粒度研究场景中的表现。首个基准AARRI-Bench显示,即使表现最佳的代理成功率也仅为68.3%,凸显了其在领域敏感性和细微推理能力方面的不足。
工具增强型LLM代理在实际能源分析任务中的表现如何?
本文介绍了一项实证研究和基准测试,用于评估工具增强型LLM代理在实际能源分析任务上的表现,包含243个由专家策划的问题,涵盖市场数据检索、知识解读和定量建模。