PHREEQC-MCQ-200:面向工具增强的科学模拟器代理的诊断基准
摘要
介绍了PHREEQC-MCQ-200,这是一个用于评估工具增强的LLM代理在确定性水地球化学模拟中的诊断基准,揭示了模拟器访问提高了准确率,但也导致在没有工具时正确回答的问题出现性能倒退。
arXiv:2607.00436v1 公告类型:新
摘要:大型语言模型代理越来越多地与科学软件连接,但尚不清楚在何种情况下工具访问能使科学计算更可靠,而不仅仅是更复杂。我们引入了PHREEQC-MCQ-200,这是一个用于评估工具增强代理在确定性水地球化学模拟中的基准。该基准包含200道多项选择题,源自21个经过验证的PHREEQC场景,要求代理构建模拟器输入、执行PHREEQC、检查结构化输出并提交最终答案。
在多个前沿和中端模型系列中,模拟器访问显著提高了总体准确率,证实了基础执行对于许多科学计算任务是必要的。然而,这种提升并非单调递增:工具增强的代理也会丢失那些在没有工具时正确回答的问题,揭示了仅靠平均准确率无法发现的性能倒退。我们进一步表明,输出访问协议很重要。目录接口可以降低令牌成本,同时保持或提高更强模型的准确率,但会降低中端模型的性能,因为这些模型无法可靠地浏览结构化模拟器输出。
因此,PHREEQC-MCQ-200将科学工具使用视为一个端到端的诊断问题,而不仅仅是简单的工具调用能力。我们认为,对科学代理的评估不仅应报告准确率,还应报告项目级别的保留率、输出访问敏感性、轨迹失败以及计算链中断的位置。
查看缓存全文
缓存时间: 2026/07/02 05:40
# PHREEQC-MCQ-200:面向工具增强型科学模拟器智能体的诊断基准 来源:https://arxiv.org/html/2607.00436 Ke Zhang University of California, Riverside kzhan153@ucr\.edu Sahchit Chundur University of California, Irvine smchundu@uci\.edu Mohammad Javad Qomi University of California, Irvine mjaq@uci\.edu Maziar Raissi11footnotemark:1 University of California, Riverside maziar\.raissi1@ucr\.edu ###### 摘要 大型语言模型智能体正越来越多地与科学软件集成,然而,工具访问何时能使科学计算更可靠、而非仅仅增加复杂性,这一点仍不明确。我们提出了 PHREEQC-MCQ-200,这是一个用于评估工具增强型智能体在确定性水-地球化学模拟中表现的基准。该基准包含200道源自21个经过验证的PHREEQC场景的多选题,要求智能体构建模拟器输入、执行PHREEQC、检查结构化输出,并提交最终答案。在多个前沿和中端模型系列中,模拟器访问显著提高了整体准确率,证实了对于许多科学计算任务而言,基于实际执行的推理是必要的。然而,这些提升并非单调的:工具增强型智能体也会在它们无工具时能正确回答的题目上出错,这揭示了单纯平均准确率所隐藏的性能退化。我们进一步表明,输出访问协议至关重要。一个目录式界面可以降低 token 成本,同时保持或提高较强模型的准确率,但对于无法可靠导航结构化模拟器输出的中端模型,则会降低性能。因此,PHREEQC-MCQ-200 将科学工具的使用视为一个端到端的诊断问题,而非简单的工具调用能力。我们认为,对科学智能体的评估不仅应报告准确率,还应报告题目级别的保持率、输出访问敏感性、轨迹失败情况以及计算链中断的位置。 ## 1 引言 构建工具增强型 LLM 智能体已成为常规操作;然而,评估这些工具是否真正使它们在真实的科学工作中更可靠,却尚未实现。LLM 智能体正日益与外部工具连接,包括计算器、数据库、代码解释器和科学软件。ReAct(Yao et al., 2023 (https://arxiv.org/html/2607.00436#bib.bib2))和 Toolformer(Schick et al., 2023 (https://arxiv.org/html/2607.00436#bib.bib3))等框架帮助确立了工具使用作为核心语言模型能力,而诸如 ChemCrow(Bran et al., 2024 (https://arxiv.org/html/2607.00436#bib.bib4))和自主化学智能体(Boiko et al., 2023 (https://arxiv.org/html/2607.00436#bib.bib5))等科学系统表明,工具可以将模型行为扩展到纯文本预测之外。然而,对于科学计算而言,核心评估问题不仅仅在于模型能否调用工具。关键在于,工具增强何时能提升模型操作确定性科学工作流的能力,以及工具循环本身何时会成为错误源(Zhang et al., 2026 (https://arxiv.org/html/2607.00436#bib.bib17))。我们在一个确定性科学模拟器上研究这个问题,并发现了一个跨供应商的能力层级 × 工具使用交互。 确定性科学模拟器使这个问题变得可测试:模拟器任务提供了可执行的证据和可复现的基准真相。我们通过 PHREEQC 来研究这一问题,这是一个广泛被研究人员和环境顾问使用的开源水-地球化学模拟器(Parkhurst and Appelo, 2013 (https://arxiv.org/html/2607.00436#bib.bib13))。PHREEQC 支持平衡物种分布、矿物饱和度、表面络合、动力学反应以及一维反应性运移(Parkhurst and Appelo, 2013 (https://arxiv.org/html/2607.00436#bib.bib13))。其应用范围涵盖地下水和污染研究(Appelo and Postma, 2004 (https://arxiv.org/html/2607.00436#bib.bib11))、地热井结垢与腐蚀(Bozau et al., 2015 (https://arxiv.org/html/2607.00436#bib.bib14)),以及反应性运移工作流(Parkhurst and Appelo, 2013 (https://arxiv.org/html/2607.00436#bib.bib13))。地热背景使实际利害关系更加具体:市场估计预计到2030年全球地热收入将接近100亿美元(Grand View Research, 2024 (https://arxiv.org/html/2607.00436#bib.bib15)),而 PHREEQC 已被用于模拟影响地下能源工作流可操作性的盐水化学、矿物结垢和腐蚀风险(Bozau et al., 2015 (https://arxiv.org/html/2607.00436#bib.bib14))。对于固定输入和热力学数据库,PHREEQC 是确定性的,这是领先的商业地球化学建模替代方案无法满足的可复现基准的前提条件。其按章节结构化的文本输出,与许多命令行科学工具(电子结构、分子模拟、地下流动)共享,使其成为研究科学工具使用的现实案例,而无需评估者评估地球化学领域的新颖性。 我们提出了 PHREEQC-MCQ-200,这是一个高置信度的基准,包含200道源自21个经过验证的模拟场景的多选题。每个题目都可以通过构建并执行 PHREEQC 模拟,并提取特定的计算量来回答。该基准使用多选题,因为它提供了确定性的可扩展评分,但每一道题都基于唯一的模拟器导出目标值。因此,我们将该基准用作为评估科学智能体的诊断工具,而非地球化学的冷知识集。 实证中的意外之处在于,模拟器访问并非一个单调的干预手段:它同时带来提升和损失(第5.1节 (https://arxiv.org/html/2607.00436#S5.SS1))。我们通过一个保持/增益/损失分解来衡量这一点——将模型版本比较工作中题目级别的增益/损失核算(Cacioli, 2026 (https://arxiv.org/html/2607.00436#bib.bib19))与工具 vs. 无工具评估相结合——并将其与思维链控制、输出访问消融、轨迹指标和失败分析一起用作基准的核心诊断手段。 本文提出五个评估问题: 1. 1. 扩展思维链推理能否替代基于实际执行的模拟器运行?工具访问是否是必不可少的? 2. 2. 当工具使用提升整体准确率时,智能体默默损失了哪些题目作为交换? 3. 3. 元数据引导的界面能否让智能体以更少的输入 token 成本导航大型模拟器输出,且不损失准确率? 4. 4. 输出访问权衡和工具引发的退化是否与模型能力层级或供应商身份相关? 5. 5. 外部可观察的计算链在哪里中断:输入构建、执行、输出导航,还是最终答案映射? 我们的贡献在于提供了一个评估基准和分析方法,而非一个新的地球化学模型或一个新的智能体架构。我们提供了一个基准和五个发现,与上述五个评估问题一一对应: 1. 1. 我们提供了 PHREEQC-MCQ-200,一个经过专家验证的基准和工件包,用于在确定性、唯一答案的科学软件环境中评估 LLM 智能体。 2. 2. (问题1)扩展推理 token 无法替代工具访问:思维链在 29–140 倍输出 token 扩展下带来 ±8 个百分点的变化,而模拟器访问在最佳无工具基线之上,为顶级和中端智能体增加了 15.0–41.5 个百分点。 3. 3. (问题2)一种增益/损失/保持分解显示,工具增强从来不是纯粹的叠加:顶级和中端智能体损失了 10–32 个它们在没有工具时正确回答的题目,同时获得了 62–110 个新正确的题目,得到 56.4–86.5% 的保持率。这将模型版本比较工作中题目级别的增益/损失核算(Cacioli, 2026 (https://arxiv.org/html/2607.00436#bib.bib19))与工具 vs. 无工具评估相结合。 4. 4. (问题3)一个族内输出访问协议比较(目录索引 vs. 截断的原始输出),显示顶级模型在输入 token 减少 11–57% 的同时,准确率匹配或超过原始输出 0.5–2.5 个百分点,该比较通过在所有五个顶级和中端智能体上对每个模型进行3次独立的 TOC 重运行验证(顶级重运行标准差 0.6–2.8 个百分点;GPT-5.1 最大 4.1 个百分点)。这实例化了针对科学模拟器输出的工具输出格式消融(Kate et al., 2025 (https://arxiv.org/html/2607.00436#bib.bib18))。 5. 5. (问题4)我们的核心实证发现:输出访问权衡按模型能力层级聚类,跨越供应商边界——在输出访问维度上,GPT-5.4 与 Claude Opus 4.6 和 Sonnet 4.6 模式一致(在输入 token 减少 11–57% 下,TOC 匹配或超过 Raw100k 0.5–2.5 个百分点),而同供应商的 GPT-5.1 和 GPT-5.2 在 TOC 下损失 7.5–9.5 个百分点。GPT-5.4 的保持率居中(64.8%,介于 Sonnet 的 86.5% 与中端 GPT 的 56–59% 之间),因此跨供应商效应是维度特定的——集中在输出访问脚手架与能力交互的地方。据我们所知,这是在受控的科学模拟器环境中的首个此类发现。 6. 6. (问题5)我们报告了一个领域专家失败分类和一个外部工具比较(Claude Code CLI, Codex CLI,匹配的 50 题目子样本),显示我们的自定义工具在每个正确答案的 token 数上好 2.7–3.3 倍(附录 H (https://arxiv.org/html/2607.00436#A8))。 ## 2 相关工作 ##### 工具增强型语言模型。 先前的工作研究了将语言模型推理与动作或外部调用交织的智能体(Yao et al., 2023 (https://arxiv.org/html/2607.00436#bib.bib2); Schick et al., 2023 (https://arxiv.org/html/2607.00436#bib.bib3))。科学工具使用系统展示了将 LLM 与化学工具以及实验室或模拟工作流(Bran et al., 2024 (https://arxiv.org/html/2607.00436#bib.bib4); Boiko et al., 2023 (https://arxiv.org/html/2607.00436#bib.bib5))连接的潜力。我们的关注点更窄且更具诊断性:我们不提出通用的自主科学家,而是评估在受控评分下,模拟器访问何时提升或降低性能。 ##### 智能体系统的基准。 LLM 评估已从静态的 QA 基准转向对可执行工件和工具使用进行评分的智能体基准(Rein et al., 2024 (https://arxiv.org/html/2607.00436#bib.bib8); Jimenez et al., 2024 (https://arxiv.org/html/2607.00436#bib.bib7))。在科学人工智能领域,同样的转变正在进行:ChemBench 针对专家化学家探测化学知识(Mirza et al., 2025 (https://arxiv.org/html/2607.00436#bib.bib9)),而 ScienceAgentBench 评估生成的程序和针对数据驱动发现的执行结果(Chen et al., 2025 (https://arxiv.org/html/2607.00436#bib.bib10))。PHREEQC-MCQ-200 填补了这两者之间的空白:它对操作一个真实的确定性科学模拟器端到端(输入合成、执行、输出导航和最终答案提交)的智能体进行评分,使用模拟器导出的基准真相,而非程序输出等价性或专家偏好。其独特贡献在于一个 PHREEQC 特有的基准和工件包,包含模拟器输入、输出、轨迹、输出访问消融和失败分析队列。 ##### 工具使用成本与输出访问消融。 最近的一系列工作将工具增强推理的成本分解为协议和执行层面,并表明工具调用并非无错(Zhang et al., 2026 (https://arxiv.org/html/2607.00436#bib.bib17)),评估了 LLM 如何处理不同返回格式下的结构化工具输出(Kate et al., 2025 (https://arxiv.org/html/2607.00436#bib.bib18)),并应用题目级别的可靠变化检测来揭示被整体准确率掩盖的双向变动(Cacioli, 2026 (https://arxiv.org/html/2607.00436#bib.bib19))。PHREEQC-MCQ-200 将这些方法集成到一个确定性科学模拟器上:我们消融了输出访问协议(TOC vs. 截断的原始输出),将增益/损失/保持核算应用于工具 vs. 无工具比较,并报告每个模型的成本与准确率。 ## 3 基准与智能体工具 ### 3.1 数据集与任务 PHREEQC-MCQ-200 包含 200 道四选一的多选题,源自 21 个经过验证的 PHREEQC 模拟场景,由水地球化学领域的专家撰写和审核,题目灵感来源于官方的 PHREEQC 示例和 phreeqcusers 社区论坛。每个题目都有一个唯一的模拟器导出的目标答案;智能体必须编写一个 PHREEQC 输入文件,执行模拟器(PHREEQC 3.8.6,使用作者提供且经过验证的 phreeqc.dat 热力学数据库),检查生成的输出文件,并通过编写一个仅包含字母(A, B, C, 或 D)的文件来提交其最终答案;缺失或无法解析的最终答案文件将被计为错误。我们平衡了真值标签分布,使其大致均匀(A=31.5%, B=23.5%, C=24.0%, D=21.0%);即便如此,LLM 在单次提示下仍表现出答案标签偏好(例如,Claude Sonnet 4.6 偏好 C,GPT-5.4 偏好 B;附录 A (https://arxiv.org/html/2607.00436#A1))。对于按场景聚类的分析(附录 E (https://arxiv.org/html/2607.00436#A5)),场景主干在空白规范化后被操作性地定义为问题陈述的第一段。 ### 3.2 智能体工具 参考图注图 1:PHREEQC-MCQ-200 智能体工具在 Agent-TOC 协议下。 智能体工作流如图 1 (https://arxiv.org/html/2607.00436#S3.F1) 所示。自定义智能体被赋予四个工具——write_file、read_file、list_file 和 execute_phreeqc——并在一个隔离的工作区中运行每个问题,最大智能体步骤固定为 24 步。对于给定的输入文件和冻结的基准数据库,PHREEQC 执行是确定性的;输出天然是分章结构的(Solution composition、Distribution of species、Saturation indices, ...),并且可能达到 846.8k,这促使使用结构化检索接口,而非总是在行内包含完整负载。我们评估两种输出访问协议,它们仅在 execute_phreeqc 返回的内容上有所不同。在 Agent-TOC 下,工具将模拟器输出写入工作区文件,并返回一个章节级别的概要(章节名称与起始行号配对),以便智能体可以通过 read_file 使用显式行范围按需获取证据;大小阈值设置为 MAX_FULL_CHARS=10M 字符(更多细节见附录 C.2 (https://arxiv.org/html/2607.00436#A3.SS2) 和 C.3 (https://arxiv.org/html/2607.00436#A3.SS3))。在 Agent-Raw100k 下,输出被内联,头部/尾部截断至 100,000 个字符。 ## 4 主要结果 表 1 (https://arxiv.org/html/2607.00436#S4.T1) 报告了在 PHREEQC-MCQ-200 上,不同模型系列的直接、思维链(CoT)、TOC-智能体和 Raw100k-智能体的准确率。直接基线在 27.0%–42.0% 范围内,略高于 31.5% 的大多数标签下限;在没有工具访问的情况下,模型表现出强烈的答案位置偏好(附录 A (https://arxiv.org/html/2607.00436#A1))。所有百分比均使用 200 道题目的分母,未评分的答案计为错误。我们沿着以下三个维度解读该表:心智推理能否替代工具扎根(§4.1 (https://arxiv.org/html/2607.00436#S4.SS1)),工具访问为有能力的模型增加了什么(§4.2 (https://arxiv.org/html/2607.00436#S4.SS2)),以及工具增强何时会适得其反(§4.3 (https://arxiv.org/html/2607.00436#S4.SS3))。 表 1:PHREEQC-MCQ-200 的主要结果。所有百分比均使用全部 200 道题目作为分母;无法解析或缺失的最终答案计为错误。CI 是 95% Wilson 二项式。Raw100k d
相似文章
超越函数调用:在工具环境不可靠性下对工具使用代理进行基准测试
介绍ToolBench-X,这是一个基准测试,用于评估各种工具环境可靠性隐患下的大语言模型代理,揭示了与干净环境相比性能上的显著差距。
MCP-Persona:通过环境模拟对LLM智能体在实际个人应用中的基准测试
MCP-Persona是一种基准测试,用于评估LLM智能体在与个人账户和本地数据库交互的个性化工具上的表现。实验表明,最先进的智能体在个性化工具使用方面面临显著挑战。
Onnes:一种基于物理的多智能体LLM模拟器,用于量子计算基础设施的低温故障诊断
介绍了Onnes,一种基于物理的多智能体LLM模拟器,用于量子计算基础设施的低温故障诊断。通过精心策划的少样本演示和自一致性投票,零样本LLM智能体面板实现了0.990的故障分类准确率,与监督式分类器相当,且无需参数更新。
Backtrader-Bench:基于自生成多选题的算法交易LLM智能体基准测试
介绍了Backtrader-Bench,这是一个用于评估算法交易中LLM编码智能体的基准,采用自生成的多选题和生成器-求解器过滤流程,展示了工具增强型智能体达到90%的准确率。
当工具失灵:LLM智能体动态重新规划与异常恢复的基准测试
ToolMaze基准测试评估了LLM智能体处理真实世界工具故障的能力,揭示了隐式语义故障导致的性能下降最为显著,而动态重新规划仍是模型扩展或提示工程无法解决的关键瓶颈。