ToolGate:用于工具依赖型科学基准构建的可执行验收流程
摘要
ToolGate是一个用于构建科学基准的可执行流程,它通过可执行脚本、随机无工具筛选和工具使用代理来验证生成的任务,减少人工劳动并提高可审计性。
arXiv:2609.02067v1 公告类型:新
摘要:科学基准通常由领域专家构建,他们编写任务并相互交叉检查工作,或从教科书、已发表论文和在线资源中调整现有材料。这些方法可以产生强有力的评估,但需要大量的人工劳动。语言模型可以通过快速提出候选方案来减少这种重复工作。剩余的问题是验收。我们的目标是科学问题,这些问题的答案需要使用专业软件进行计算,而不仅仅是依靠自身推理。如果候选方案的脚本失败或返回不同答案,则被视为无效;如果模型无需软件即可回答,则被视为简单。我们提出ToolGate,它将每个生成的项目视为提案,只有通过三个门控才保留。首先,可执行的解决方案脚本必须在运行科学软件时复现提出的答案。其次,随机无工具筛选拒绝那些模型仅从提示中就能解决的候选方案。第三,工具使用代理必须在固定时间内解决每个幸存者。我们在FEniCSx中实例化ToolGate,进行500次生成尝试。本地验证门控保留了478个候选方案。为了最终报告,我们在生成后重新筛选此池:两次随机无工具筛选排除了222个候选方案,直接GPT-5.5 API调用(中等推理,API默认设置)排除了另外121个。在剩余的135个中,具有FEniCSx访问权限的GPT-5.5 Codex CLI代理解决了130个;精确去重后剩下128个唯一的协议幸存者。ToolGate将重复的答案检查和难度筛选转化为一个可审计的过程,同时将领域设计和最终审查留给专家。
查看缓存全文
缓存时间: 2026/09/03 06:00
# ToolGate:一种用于构建依赖工具的科学基准的可执行验收流程 来源:https://arxiv.org/html/2609.02067 ###### 摘要 科学基准通常由领域专家构建,他们编写任务并相互交叉检查工作,或改编教科书、已发表论文和在线资源中的现有材料。这些方法可以产生高质量的评估,但每项任务都需要大量的逐项劳动。语言模型可以通过快速提出候选内容来减少这种重复性工作。剩下的问题是验收。我们关注的是那些答案需要借助专业软件进行计算,而不能仅靠独立推理的科学问题。如果其脚本执行失败或返回不同的答案,则该候选内容无效;如果模型无需软件就能回答该问题,则该问题过于简单。我们提出 ToolGate,它将每个生成的候选项视为一个提案,只有在通过三个“关卡”时才保留它。首先,可执行的解答脚本必须在运行时与科学软件重现所提出的答案。其次,随机化的无工具筛选会拒绝那些仅凭提示就能被模型解决的候选项。第三,使用工具的代理必须在固定时间限制内解决每个存活下来的候选项。我们在 FEniCSx 中实例化了 ToolGate,进行了 500 次生成尝试。本地验证关卡保留了 478 个候选项。为了最终报告,我们在生成后重新筛选了此候选项池:两个随机的无工具筛选从报告池中排除了 222 个,使用中等推理水平(API 默认值)的直接 GPT-5.5 API 调用又排除了 121 个。在剩余的 135 个中,一个有权访问 FEniCSx 的 GPT-5.5 Codex CLI 代理解决了 130 个;精确去重后剩下 128 个独特的协议存活项。ToolGate 将重复的答案检查和难度筛选转变为一个可审计的过程,同时将领域设计和最终审查留给专家。 加州大学河滨分校 美国加利福尼亚州河滨市 [email protected], [email protected], [email protected], [email protected] ## 引言 科学基准通常由领域专家构建,他们编写任务并相互交叉检查工作,或改编现有材料。GPQA 要求领域专家编写问题,其他专家求解并验证它们(Rein 等,2024 (https://arxiv.org/html/2609.02067#bib.bib1))。科学代理基准(包括 ScienceAgentBench、SciCode 和 CORE-Bench)改编自已发表研究的任务、数据和代码,并由专家进行整理和审查(Chen 等,2025 (https://arxiv.org/html/2609.02067#bib.bib6);Tian 等,2024 (https://arxiv.org/html/2609.02067#bib.bib7);Siegel 等,2024 (https://arxiv.org/html/2609.02067#bib.bib8))。这些方法可以产生高质量的评估,但它们为每一项任务重复了昂贵的工作:编写或提取任务、求解它并独立检查结果。 语言模型可以通过快速提出问题、答案和尝试的解决方案来减少这种工作量。这些输出仍然需要被检查。尝试的解决方案可能会失败或返回不同的答案。问题也可能太容易:模型可能仅从措辞、先验知识或推理中就能回答它。这样的问题对于评估模型是否能使用科学软件没有用处。先前的工作在其他环境中解决了相关问题。APIGen 和 AutoCodeBench 执行并过滤生成的数据以检查正确性,而 AutoBencher 测量和优化问题难度(Liu 等,2024 (https://arxiv.org/html/2609.02067#bib.bib5);Chou 等,2025 (https://arxiv.org/html/2609.02067#bib.bib4);Li 等,2025 (https://arxiv.org/html/2609.02067#bib.bib3))。因此,快速生成候选内容并不能解决主要问题:我们仍然需要检查每一个并决定是否保留它。 我们提出 ToolGate,这是一个在接受每个生成的候选项之前对其进行检查的流程。在我们的研究中,每个候选项包含一个问题、四个答案选项、一个提出的答案以及一个调用科学软件的解决方案脚本。多选题格式让每个阶段都能自动将其结果与相同的提出答案进行比较。ToolGate 使用三个“关卡”(图 1 (https://arxiv.org/html/2609.02067#Sx2.F1))。首先,它运行脚本并要求其结果与提出的答案一致。其次,它要求模型仅使用问题和选项(无科学软件访问权限)进行回答,并拒绝模型能够解决的候选项。第三,它将剩余的候选项交给一个能够编写和运行软件代码的代理,并保留它能解决的候选项。一个候选项只有在满足所有三个条件时才算通过。 当科学软件可以从代码中调用并产生可自动检查的输出时,可以使用 ToolGate。我们使用 FEniCSx 有限元软件栈进行了测试(Baratta 等,2023 (https://arxiv.org/html/2609.02067#bib.bib15))。FEniCSx 是一个广泛使用的开源平台,用于通过有限元方法求解偏微分方程。用户在 Python 中描述网格、函数空间和变分形式,FEniCSx 组装并求解生成的数值系统。我们的问题要求从多步 FEniCSx 计算中获取精确输出,因此预期的解决方案是编写并运行代码。 在生成的 500 个候选项中,有 478 个脚本重现了它们提出的答案。为了最终报告,我们在生成后重新筛选这些候选项。两个随机的无工具筛选从报告池中排除了 222 个,剩下 256 个。使用中等推理水平(API 默认值)且无 FEniCSx 访问权限的直接 GPT-5.5 API 调用又排除了 121 个。在剩余的 135 个中,一个有权访问 FEniCSx 的 GPT-5.5 Codex CLI 代理在报告的测试设置下解决了 130 个。这些结果表明,要求 LLM 生成一个依赖工具的问题是不够的。我们必须测试指定的模型在没有软件的情况下是否失败,以及启用工具的代理在有软件的情况下是否成功。 只有当筛选协议合理时,这些测量结果才是可靠的。我们表明,固定的选项顺序会让模型的字母偏好伪装成问题难度,而无约束的生成会重复产生几个经常通过的模板;因此报告的筛选随机化了选项顺序,并按答案值评分,在发布前会删除完全重复的问题。 我们的贡献是: - •ToolGate,仅当其脚本重现提出的答案、所有指定的无工具筛选均未通过多数答案回答该问题、并且指定的启用工具的代理成功时,才接受生成的候选项; - •一项 500 次尝试的 FEniCSx 研究,其中 478 个候选项通过了本地验证,随后是生成后的重新筛选,两个随机的无工具筛选从报告池中排除了 222 个,一个使用中等推理水平的 GPT-5.5 无工具 API 筛选又排除了 121 个,一个有权访问 FEniCSx 的 GPT-5.5 Codex CLI 代理解决了剩余 135 个中的 130 个,在精确去重后剩下 128 个独特的协议存活项;以及 - •一项分析,展示了筛选模型和答案呈现方式如何影响哪些候选项得以存活,同时将随机化值评分和精确去重作为实用的保障措施。 ## ToolGate ToolGate 将每个模型输出视为一个候选项,而非一个已接受的基准项。每个候选项包含一个问题、四个答案选项、生成器提出的答案以及一个使用目标科学软件的解决方案脚本。一个生成器提出候选项,三个关卡对其进行测试,结果被保存用于下一轮生成(图 1 (https://arxiv.org/html/2609.02067#Sx2.F1))。 图 1:ToolGate 循环。一个生成器提出一个完整的候选项——问题、选项、提出的答案和解决方案脚本——三个关卡决定是否保留它。每个关卡留下一个机器可读的记录,每个结果都追加到运行数据库中。 ### 候选项生成 生成器在一个包含目标软件的环境中工作,因此它可以在构建候选项的同时编写和测试代码。其提示词提供了一个领域指南、一小部分专家编写的种子示例以及最近的关卡结果。它必须以固定的文件格式返回问题、选项、提出的答案和可运行的解决方案。提示词还要求基于现实的建模或实现错误提供干扰项。保存的解决方案被独立检查;生成器自身的执行不被视为候选项正确的证据。 ### 验收关卡 #### 本地验证。 验证器在目标环境中针对省略了提出答案的输入副本运行提交的解决方案。只有当脚本完成运行、恰好打印一个答案且该答案与生成器的提案匹配时,候选项才通过。此关卡检查保存的计算是否重现了提出的答案;它不判断问题是否困难。 #### 无工具筛选。 无工具筛选是指一个模型在一个推理设置下。它只接收问题和选项,没有文件、代码执行、检索、提交的解决方案或目标软件。模型回答三个独立随机化的候选项呈现形式,评分将每个选择的值映射回原始选项。如果模型在至少两次调用中回答正确,则该候选项被拒绝,因为在此筛选下它太容易了。一个候选项只有在通过所有指定的筛选时,才能通过无工具关卡。 #### 启用工具求解。 剩余的候选项被送入一个在包含目标软件和代码执行的新工作区中的代理。代理看到公开的问题和选项,但看不到提出的答案或生成器的解决方案。它必须在固定时间限制内实现自己的解决方案并返回一个选项。它能解决的候选项被接受;其余的被标记以供审查。这个最终关卡区分了那些没有软件就很难的问题和那些仅仅是规范不足、损坏或超出被测代理预算范围的问题。 ### 反馈和记录的证据 每一次尝试,包括每一次拒绝,都会追加到运行数据库中。在下一轮之前,生成器会收到最近的结果以及重复的本地验证失败摘要,并在失败再次发生时被要求改变方法。只有这些循环内的结果会进入生成器的提示词;事后审计不会影响生成。 通过与否相对于报告的测试条件。一个更强的无工具模型可能解决保留的候选项,而不同的工具代理或时间预算可能会改变最终结果。因此,ToolGate 为每次调用保存模型、推理设置、选项呈现方式、时间限制和结果。保留的项目与此记录一起发布。 ## FEniCSx 实验设置 ### 任务和种子示例 我们研究 FEniCSx 生态系统(Baratta 等,2023 (https://arxiv.org/html/2609.02067#bib.bib15)):用于有限元求解的 DOLFINx、用于变分形式的 UFL(Alnæs 等,2014 (https://arxiv.org/html/2609.02067#bib.bib16))以及用于单元定义和制表的 Basix(Scroggs 等,2022 (https://arxiv.org/html/2609.02067#bib.bib18))。其工作流结合了网格构建、有限元空间、数值组装和后处理。它们产生的精确答案难以手工获得,但可以通过运行适度的程序来检查。 生成器接收五个专家编写的种子项。所有五个都是一个穿孔正方形上非线性泊松问题的变体,具有不同的强迫项、边界条件和感兴趣的量。生成器不限于这些模板。它生成涉及变形网格、变分问题、积分和 Basix 单元操作的任务。 ### 模型和执行设置 表 1 (https://arxiv.org/html/2609.02067#Sx3.T1) 列出了在构建循环中使用的模型。生成器、提交的解决方案脚本和工具求解器可以访问 FEniCSx 环境。无工具筛选使用直接 API 调用,仅接收公开的问题和选项。 表 1:原始 FEniCSx 构建循环中的模型角色。生成器和工具求解器可以执行代码并访问 FEniCSx;无工具筛选不能。 无工具筛选进行三次调用,当至少两次正确时拒绝候选项。生成器、每个提交的解决方案和每个工具求解器运行都有 300 秒的挂钟时间限制。求解器在新工作区中工作,并通过单个答案文件返回其答案。生成器接收结果计数、数据库中最近的 20 条记录以及重复本地失败的摘要。 ### 端到端示例 以下是一个生成的候选项(项 0023)的完整公开问题: > 在 DOLFINx 中,创建一个带右对角线的 17×14 三角形单位正方形网格。在移动任何坐标之前,将原始左边界 x=0 和顶部边界 y=1 标记为 Dirichlet 面,将原始右边界 x=1 和底部边界 y=0 标记为 Neumann 面。将每个原始坐标 (x, y) 移动到 (X, Y),其中 X = x + 0.041 sin(2πy) + 0.017xy - 0.009y² + 0.004x²y,Y = y + 0.027 sin(πx) sin(2πy) + 0.019x² - 0.014xy + 0.006y²。在移动后的网格上,在连续一次 Lagrange 空间中求解满足 ∫ a ∇u_h · ∇v dx = ∫ fv dx + ∫ gv ds 的 u_h,其中在标记的 Neumann 面上,在标记的 Dirichlet 面上 u_h = u_D。在所有系数函数中使用移动后的坐标:a = 0.88 + 0.24X - 0.13Y + 0.05XY + 0.031X² + 0.017Y²,f = 1.07 - 0.36X + 0.29Y + 0.18XY - 0.11X² + 0.07Y² + 0.05X²Y,g = -0.09 + 0.14X + 0.06Y - 0.035XY + 0.022Y²,u_D = 0.16 + 0.31X - 0.27Y + 0.05XY + 0.028X² - 0.034Y²。求解后,计算 J = ∫_Ω_h [ (0.71 - 0.12X + 0.18Y + 0.064XY + 0.027X² - 0.021Y²) u_h² + 0.042 |∇u_h|² + 0.018 u_h (X - 0.52Y + 0.13XY) ] dx。对体积和边界形式使用 5 阶积分。将 J 报告为精确到小数点后六位的数值。(A) 0.058996 (B) 0.060723 (C) 0.060074 (D) 0.061291 数据库记录了该候选项的完整循环内路径: - •本地验证运行提交的脚本并返回 (B),与提出的答案匹配; - •原始的 GPT-5.4 无工具筛选在所有三次固定顺序调用中回答 (C),正确数为零;以及 - •独立的 GPT-5.5 Codex CLI 求解器使用 FEniCSx 并返回 (B),因此该候选项被构建循环接受。 ## 结果 ### 构建运行 我们对一个全新的 FEniCSx 数据库运行了生成器 500 轮。本地验证拒绝了 22 个脚本失败或未重现其提出答案的候选项,剩下 478 个(95.6%)。原始的循环内无工具筛选使用推理禁用的 GPT-5.4。它将 478 个候选项中的 260 个标记为简单并拒绝。剩余的 218 个进入工具关卡,其中 GPT-5.5 Codex CLI 代理使用 FEniCSx 解决了 212 个,失败了 6 个。 图 2:在...
相似文章
GTA-2:从原子工具使用到开放式工作流的通用工具Agent基准测试
GTA-2 引入了一个分层基准,用于评估通用工具Agent在原子工具使用和开放式工作流中的表现,揭示了显著的能力鸿沟:前沿模型在复杂任务上仅取得14.39%的成功率,尽管在原子任务上表现尚可。
ToolGate:面向工具增强型视觉语言代理的令牌高效预调用控制
ToolGate 是一个轻量级的外部控制器,能够预测在视觉语言代理中是否执行或跳过感知工具调用,从而将令牌成本降至基线的64%-69%,同时保持跨域设置下的准确性。
超越函数调用:在工具环境不可靠性下对工具使用代理进行基准测试
介绍ToolBench-X,这是一个基准测试,用于评估各种工具环境可靠性隐患下的大语言模型代理,揭示了与干净环境相比性能上的显著差距。
ClawForge:为命令行智能体生成可执行的交互式基准测试
ClawForge 是一个基于生成器的基准测试框架,用于在状态冲突下生成可执行的命令行工作流,通过在17个场景中评估LLM智能体处理预先存在的部分、过时或冲突工件的能力。
@SoHarshhh: 非常高兴地分享,“ToolFailBench” 已被两个 ICML 2026 研讨会(FAGEN 和 AIWILD)接收。大多数基准测试…
ToolFailBench,一个用于评估工具使用型代理的诊断基准,已被两个 ICML 2026 研讨会(FAGEN 和 AIWILD)接收。