Collider-Bench: 以粒子物理分析复现基准测试AI代理
摘要
Collider-Bench是一个新基准,评估LLM代理仅使用公开论文和开源软件复现大型强子对撞机粒子物理分析的能力,需要物理推理来填补缺失的实现细节。
arXiv:2605.13950v1 公告类型:新提交
摘要:自主语言模型代理在长期工具使用任务上的评估日益增多,但现有基准很少能捕捉真实科学工作的复杂性和细微差别。为弥补这一空白,我们引入了Collider-Bench,这是一个用于评估LLM代理是否能够仅使用公开论文和开源科学软件复现大型强子对撞机(LHC)实验分析的基准。这类分析往往难以复现,因为公开工具链仅近似于实验合作组内部使用的软件,而已发表的论文不可避免地遗漏了忠实重建所需的实现细节。因此,代理必须依赖物理推理、领域知识和反复试验来填补这些空白。每个任务要求代理将已发表的分析转化为可执行的模拟与选择流水线,并在指定的信号区域提交预测的碰撞事件产额。这些预测通过标准直方图指标进行评估,无需人工编写的评分标准即可提供连续的保真度分数。我们还报告了每个代理每项任务所产生的计算成本。最后,我们使用LLM裁判评估代码库和完整会话跟踪,以捕捉诸如伪造、幻觉和重复等定性失败模式。我们发布了一组初始任务,取自LHC搜索,以及容器化的沙盒和事件模拟工具。我们在通用编码代理的能力阶梯上进行了评估。结果表明,平均而言,没有代理能够可靠地超越物理学家参与循环的解决方案。
查看缓存全文
缓存时间: 2026/05/15 06:25
# 使用粒子物理分析复现来基准测试AI智能体 来源:https://arxiv.org/html/2605.13950 Darius A\. Faroughy 新高能理论中心 物理与天文系 罗格斯大学 darius\.faroughy@rutgers\.edu &Sofia Palacios Schweitzer 新高能理论中心 物理与天文系 罗格斯大学 spalacios@physics\.rutgers\.edu &Ian Pang 新高能理论中心 物理与天文系 罗格斯大学 ian\.pang@physics\.rutgers\.edu &Siddharth Mishra\-Sharma 计算与数据科学学院 波士顿大学 smishras@bu\.edu &David Shih 新高能理论中心 物理与天文系 罗格斯大学 shih@physics\.rutgers\.edu
###### 摘要
自主语言模型智能体越来越多地被用于评估长期工具使用任务,但现有基准很少能捕捉到真实科学工作的复杂性和细微差别。为弥补这一差距,我们引入了**Collider-Bench**,这是一个用于评估LLM智能体能否仅使用公开论文和开放科学软件复现大型强子对撞机(LHC)实验分析的基准。这类分析通常难以复现,因为公开工具链只能近似实验合作组内部使用的软件,而已发表的论文不可避免地遗漏了忠实重建所需的实现细节。因此,智能体必须依赖物理推理、领域知识和试错来填补这些空白。每个任务要求智能体将已发表的分析转化为可执行的模拟与选择流水线,并在指定的信号区域提交预测的对撞事件产额。这些预测使用标准直方图指标进行评估,提供连续的保真度评分,无需手工编写的评分标准。我们还报告每个智能体在每个任务上产生的计算成本。最后,我们使用LLM评判器评估代码库和完整的会话轨迹,以捕获定性失败模式,如虚构、幻觉和重复。我们发布了从LHC搜索中提取的初始任务集,以及容器化的沙盒和事件模拟工具。我们在通用编码智能体的能力阶梯上进行评估。我们的结果表明,平均而言,没有一个智能体能可靠地击败物理学家在环的解决方案。
## 1 引言
大型语言模型智能体现已能够承担科学工作流程中的大部分工作,这引发了如何严格评估它们的问题。尽管一旦配置确定,科学工作的许多部分是机械性的,但确定该配置的选择——即使用哪些输入,哪些近似是合理的,如何协调来源材料中的不一致——依赖于推理和判断,而不仅仅是执行。越来越多的科学智能体基准测试评估智能体在单个分析步骤、根据作者代码进行复现、或根据专家编写的评分标准对端到端论文复现进行评分。我们引入了**Collider-Bench**,这是一个新的基准,用于在一个新颖的设定——大型强子对撞机(LHC)的分析——中评估自主LLM智能体在长期、真实世界科学任务上的表现。智能体必须针对定量目标对已发表的分析进行端到端复现。尽管存在缺失或未明确说明的信息(通常由实验合作组内部掌握)以及仅能近似原始实验设置的公开工具链,此任务仍须完成。在每个**Collider-Bench**任务中,智能体会收到一个结构化提示,指定要复现的预测、目标出版物、一组固定的CLI工具(封装了公开模拟软件)以及一个容器化的沙盒(将该运行与其他任务隔离)。智能体必须阅读出版物以填写简要说明中省略的细节,并定位相关的公开输入。然后,它通过一个多工具生成和探测器响应流水线模拟指定新物理模型的事件,并通过实现出版物选择逻辑的分析脚本来运行模拟事件。最后,它必须生成预测计数的分箱直方图,以及产生该结果的代码和配置。对于**Collider-Bench**的首次发布,我们发布了从四个LHC分析中提取的10个初始任务。还有更多任务和分析(至少多一个数量级)可用,并将在未来版本中添加。四篇源论文的难度各异,其分析是否使用标准或非标准的事件选择特征,以及预测产额对出版物未完全指定的模拟选择的敏感程度各不相同。每个任务首先由领域专家使用相同工具链与智能体一起解决,从而确定公开栈可以复现已发布的目标。我们使用物理驱动的定量指标评估每个提交。每个智能体自主运行,在单次会话中无人干预,使用现成的供应商CLI和模型的最大推理努力,并设有2.5小时的实际时间预算。为控制智能体行为运行间的随机性,每个智能体在每个任务上评估三次。由于已发布的参考值在源出版物或辅助材料中可用,我们通过一个LLM评判器(Zheng等人,2023 (https://arxiv.org/html/2605.13950#bib.bib35))补充定量评分,该评判器检查智能体的完整工作空间,并验证提交的值是否源于执行的模拟,而非从文献中复制的虚构缩放因子或值。我们报告了前沿模型的结果,包括来自(Anthropic,2026 (https://arxiv.org/html/2605.13950#bib.bib42))、(OpenAI,2026a (https://arxiv.org/html/2605.13950#bib.bib44),b (https://arxiv.org/html/2605.13950#bib.bib43))和(DeepSeek-AI,2026 (https://arxiv.org/html/2605.13950#bib.bib45))的模型,并进一步探测了Anthropic和OpenAI系列中的能力阶梯,以研究性能如何随模型能力扩展。**Collider-Bench**提供了包含隐藏参考值的任务语料库、容器化的执行环境、与多个前沿智能体CLI兼容的轻量级智能体适配框架、LLM溯源评判器以及单会话基线智能体。代码、容器镜像和任务发布于此:
## 2 相关工作
#### 科学领域的LLM基准测试
越来越多的基准测试通过自包含的问答问题来评估LLM的科学知识和推理。ChemBench(Mirza and others,2025 (https://arxiv.org/html/2605.13950#bib.bib13))和LAB-Bench(Laurent et al.,2024 (https://arxiv.org/html/2605.13950#bib.bib14))通过针对专家策划答案评分的策划问题集来探究化学和生物学知识。FrontierScience(Wang et al.,2026 (https://arxiv.org/html/2605.13950#bib.bib15))将其扩展到物理、化学和生物学中的奥林匹克级和博士级研究问题,评分依据最终答案的精确匹配或专家设计的评分标准。CURIE(Cui and others,2025 (https://arxiv.org/html/2605.13950#bib.bib30))测试跨科学文档的长上下文理解。SciCode(Tian and others,2024 (https://arxiv.org/html/2605.13950#bib.bib31))根据科学家策划的测试用例评估科学代码生成,而TPBench(Chung et al.,2025 (https://arxiv.org/html/2605.13950#bib.bib16))使用自动检查答案评估理论物理学推导。这些基准在自包含问题的层面上捕捉了LLM的科学推理,但与**Collider-Bench**不同,它们不测试模型是否能构建和执行通常产生真实科学结果的多步骤计算流水线。
#### 多步骤工作流的智能体基准测试
第二类基准测试评估智能体,即配备工具和执行环境的LLM,在多步骤工作流中的表现。通用智能体基准测试评估代码修改、终端使用和端到端机器学习工程(Jimenez et al.,2024 (https://arxiv.org/html/2605.13950#bib.bib17); Merrill and others,2026 (https://arxiv.org/html/2605.13950#bib.bib18); Chan and others,2025 (https://arxiv.org/html/2605.13950#bib.bib19); Wijk and others,2025 (https://arxiv.org/html/2605.13950#bib.bib21))。迄今为止,科学基准测试正在评估孤立分析步骤(Chen and others,2025 (https://arxiv.org/html/2605.13950#bib.bib22))、从作者代码复现(Siegel et al.,2024 (https://arxiv.org/html/2605.13950#bib.bib23))、根据专家编写的评分标准复制ML研究(Starace et al.,2025 (https://arxiv.org/html/2605.13950#bib.bib24))、端到端复制天体物理学论文(Ye et al.,2025 (https://arxiv.org/html/2605.13950#bib.bib29))、生物医学ML工作流(Miller et al.,2025 (https://arxiv.org/html/2605.13950#bib.bib26))、或物理模拟器中的定律发现(Zheng et al.,2025 (https://arxiv.org/html/2605.13950#bib.bib27); Koblischke et al.,2025 (https://arxiv.org/html/2605.13950#bib.bib28))。**Collider-Bench**针对跨多个新物理分析的自主动管线构建,与已发布目标进行定量比较,这是现有基准未涵盖的组合。
#### 粒子物理中的重铸与AI智能体
复现已发表的实验分析是粒子物理学中的长期实践,已在重铸计划(Abdallah and others,2020 (https://arxiv.org/html/2605.13950#bib.bib8))中正式化。最近的几项工作展示了LLM智能体在邻近的模拟和分析任务中的应用(Gendreau-Distler and others,2025 (https://arxiv.org/html/2605.13950#bib.bib32); Menzo et al.,2025 (https://arxiv.org/html/2605.13950#bib.bib33); Moreno et al.,2026 (https://arxiv.org/html/2605.13950#bib.bib34); Plehn et al.,2026 (https://arxiv.org/html/2605.13950#bib.bib1); Qiu et al.,2026 (https://arxiv.org/html/2605.13950#bib.bib2); Agrawal et al.,2026 (https://arxiv.org/html/2605.13950#bib.bib3))。这些工作贡献了架构设计和原理验证演示,但它们不是基准测试。它们评估执行成功,而不是针对定量参考的正确性,并且不评估其架构是否比直接在相同任务上运行现成的前沿智能体更有价值。**Collider-Bench**通过提供定量评估基础设施来填补这一空白,使得此类比较成为可能,并且是在一组精心挑选的真实已发表分析上进行,运行过程中无需人工干预。
## 3 Collider-Bench
基准架构的示意图,包括论文、输出模板、工具、沙盒、智能体和评估器,如图1所示。附录A提供了LHC物理和模拟工具的简要介绍,以及定义文中使用的领域特定术语的词汇表。

### 3.1 问题形式化
对撞机分析可以看作是对碰撞事件的统计查询。**Collider-Bench**策划的对撞机分析是寻找新物理的搜索。这些搜索是针对标准模型粒子物理学之外假设的新基本粒子和相互作用的搜索。假设的新物理构成了“信号”的基础,而标准模型预测的普通物理则是“本底”。每次搜索都是对标准模型有效性的严格统计检验,在任何搜索中发现新物理(排除标准模型仅为本底的零假设)都将是范式转变的事件,值得获得诺贝尔物理学奖。LHC上的绝大多数搜索都是事件计数实验。从重建的事件记录开始,分析定义物理对象,如光子、电子、缪子和准直强子喷注,然后应用运动学选择标准来隔离感兴趣的事件。存留的事件被分组到**信号区域**,在这些区域中,假设的新物理预计会比本底更丰富。每个分析报告在用于测试新物理假设的信号区域中的事件产额或分箱分布。
**重铸**是重用已发表的搜索来约束不同于原始分析中明确考虑的信号模型的过程。由于LHC实验合作组外部的研究人员通常无法访问完整的探测器重建、官方信号模拟和内部分析代码,重铸必须使用公开信息来近似分析。这通常涉及使用标准蒙特卡洛工具生成信号事件,应用快速探测器模拟,实现已发表的选择,并估计已发表区域中的预测信号产额。**Collider-Bench**专注于针对原始出版物中已考虑的信号模型验证重铸流水线。这是工作流中最困难的步骤,因为它需要公开工具链在缺少实验内部信息的情况下复现已知目标。一旦验证通过,替换新信号模型就相对简单。完整的重铸工作流随后会在此验证过的流水线上,对信号模型参数点网格重复运行,以设定新物理的限制。这最后一步成倍增加了计算量,但并未测试新的智能体能力,因此不在基准测试范围之内。
**Collider-Bench**将此工作流形式化为一个智能体基准测试。每个任务都锚定在一篇LHC搜索论文上,并指定一个目标信号模型、一个基准参数点、一个目标可观测量或信号区域,以及一个固定的输出模板。给定论文、任务规范、公开文档以及容器化的高能物理软件环境,智能体必须构建一个可执行的模拟和分析流水线,并返回其重铸的预测信号产额。因此,该基准测试评估了一个完整的科学工作流:将模糊的公开分析描述转化为代码、模拟选择、事件选择和数值预测。
#### 任务定义
形式上,一个**Collider-Bench**任务定义一个问题实例x=\(P, s, O, B, T\), 其中P是目标搜索论文,s是指定的信号基准,O是目标可观测量或信号区域,B=\(b_1, ..., b_K\)是指定的直方图分箱或计数区域的集合,T表示可用的工具环境。智能体必须产生一个非负的产额向量
\[
\hat{y} = (\hat{y}_1, ..., \hat{y}_K) \in \mathbb{R}_{\geq 0}^K,
\]
其中\(\hat{y}_k\)是箱或区域\(b_k\)中的预测信号产额,K是箱的总数。除了这个数值输出,智能体还需要提供产生该输出的可执行工件,包括分析代码、模拟卡片或脚本、相关的中间数据产品,以及一份简要报告,记录方法选择。基准测试将\(\hat{y}\)与参考产额\(y^\star\)进行比较,参考产额根据任务从精心策划的参考重铸或公开验证记录中获得。参考值和评估代码不会暴露给智能体。相似文章
跨尺度科学挑战的AI智能体基准测试
介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。
物理科学中的深度研究:一个多智能体框架与全面基准
本文介绍了PhySciBench——一个包含200个专家精心策划的物理科学问题的基准,以及DelveAgent——一个多智能体框架,与Gemini Deep Research等基线相比,该框架提高了准确性并降低了推理成本。
AgentCollabBench:诊断优秀智能体为何成为糟糕的协作者
本文介绍了 AgentCollabBench,这是一个针对多智能体系统的诊断性基准,用于评估四大主流大语言模型(LLM)中的指令衰减和上下文泄漏等行为风险。文章认为,通信拓扑结构是多智能体可靠性的关键因素,其重要性往往超越了模型的原始能力。
PACE-Bench:动态环境中通过代码演化进行物理适应的基准测试
PACE-Bench 引入了一个基于模拟器的基准,用于评估在物理适应任务中,经过环境突变后需要迭代重新设计代码的自进化智能体,并揭示了相比参数推断,机制重新设计是一个主要瓶颈。
ProgramBench(5分钟阅读)
ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。