PHITSBench:基于执行得分的基准测试,用于评估AI通过自然语言生成PHITS辐射输运输入文件

arXiv cs.AI 论文

摘要

PHITSBench是一个基于执行得分的基准测试,用于评估AI模型从自然语言生成PHITS辐射输运输入文件的能力,涵盖编辑、修复和完整生成任务。使用GPT-5.4进行的实验表明,虽然领域知识能提升性能,但在正确配置物理可观测量方面仍存在显著挑战。

arXiv:2607.09789v1 公告类型:新 摘要:我们引入了PHITSBench,一个针对蒙特卡罗粒子与重离子输运代码系统(PHITS)的基于执行得分的基准测试。PHITSBench包含282个可输运评分的任务,涵盖三个常见工作流类别:参数编辑(编辑)、语法修复(修复)以及从自然语言描述完整生成模拟(复现)。每个任务使用复合度量分数进行评估,该分数结合了执行成功率与生成的和参考的输运可观测量的吻合度。利用PHITSBench,我们评估了五种基于GPT-5.4的配置,范围从零样本提示到知识增强和代理工作流。在没有领域特定知识的情况下,模型在编辑和修复任务上表现良好(成功率分别为95%和70%),但无法从零开始生成正确的模拟(复现跟踪的成功率为0%)。一个结构化的、机器可读的PHITS知识目录,与用户手册一起提供,将单次复现任务的成功率提升至57%。代理执行进一步将成功率提升至66-73%,但计算成本增加。失败分析表明,剩余错误主要源于物理可观测量的错误选择和配置,而非语法生成。这些结果表明,AI辅助辐射输运建模的未来进展将与基础模型的进步一样,依赖于机器可读的知识库、精心策划的领域训练数据集以及基于执行的评估环境。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:17

# PHITSBench:一个用于AI辅助PHITS辐射输运输入生成的执行评分基准
来源:https://arxiv.org/html/2607.09789

###### 摘要

我们提出了PHITSBench,这是一个针对蒙特卡罗粒子与重离子输运代码系统(PHITS)的执行评分基准。PHITSBench包含282个可输运评分的任务,涵盖三种常见工作流类别:参数编辑(*Edit*)、语法修复(*Repair*)以及从自然语言描述生成完整模拟(*Reproduce*)。每个任务使用一个复合度量分数进行评估,该分数结合了执行成功性与生成结果与参考输运可观测量之间的一致性。利用PHITSBench,我们评估了五种基于GPT-5.4的配置,范围从零样本提示到知识增强和智能体工作流。在没有领域特定知识的情况下,模型在编辑和修复任务上表现良好(成功率分别为95%和70%),但在从头生成正确模拟方面失败(*Reproduce*任务成功率为0%)。一个结构化的、机器可读的PHITS知识目录(与用户手册一同提供)将单次*Reproduce*任务成功率提升至57%。智能体执行进一步将成功率提升至66-73%,但计算成本更高。失败分析表明,剩余的误差主要源于对物理可观测量的错误选择和配置,而非语法生成。这些结果表明,AI辅助辐射输运建模的未来进展将同样依赖于机器可读的知识库、精心策划的领域训练数据集以及基于执行的评估环境,而不仅仅是基础模型本身的进步。

###### 关键词:
PHITS;蒙特卡罗辐射输运;大语言模型;基准测试;输入文件生成;智能体系统

††文章类型:文章

## 1 引言

精确的辐射输运建模对于核能与聚变工程、粒子加速器运行、医学物理、外太空探索以及先进制造等领域至关重要,这些领域通常需要分析和设计运行在强辐射环境中的系统。蒙特卡罗(MC)辐射输运代码,如PHITS[33 (https://arxiv.org/html/2607.09789#bib.bib1)]、MCNP[40 (https://arxiv.org/html/2607.09789#bib.bib7)]、GEANT4[2 (https://arxiv.org/html/2607.09789#bib.bib8)]和FLUKA[12 (https://arxiv.org/html/2607.09789#bib.bib9)],是预测中子、光子、电子和离子在任意三维(3D)几何中与材料相互作用的最先进工具。这些平台编码了数十年来经过验证的物理知识,但它们的模拟设置、执行和结果验证即使对有经验的设计者来说也仍然具有挑战性。构建一个有效的模拟需要在辐射物理、几何建模、材料、源特征描述以及代码特定的输入语言方面具备广泛的领域专业知识。在实践中,与辐射输运研究相关的大部分工作并非在于执行模拟,而在于构建、调试、验证和维护复杂的模拟输入文件。这造成了显著的生产力障碍,限制了大型设计空间的快速探索,并将高级建模能力的访问限制在相对较小的专家社区内。

请参考图注

图1:PHITS概览。(a) PHITS输入文件由一系列命名的关键字段落组成,定义了模拟参数、粒子源、材料、几何以及计数请求。(b) 在执行过程中,粒子从指定的源发射,穿过几何,并根据用户定义的[T-*]计数定义进行评分。在所示示例中,中子源发射中子,中子穿过几何并与材料区域M1(橙色)相互作用,在相互作用点产生次级粒子(橙色点);模拟返回由[T-Track]计数记录的中子径迹长度通量。(c) 相同的辐射输运框架支撑着不同的应用领域;面板展示了本研究中三个代表性的PHITS模拟——医学物理(水中的质子束)、屏蔽与设施设计(铅中的光子束)以及辐射探测与能谱学(Cs-137源和NaI(Tl)探测器)。

大语言模型(LLMs)和智能体AI系统的最新进展为自动化科学计算工作流创造了新的机会。LLMs现在在许多传统的代码生成基准测试中表现出色,并且在工程设计、科学编程和计算建模中越来越显示出其实用性[9 (https://arxiv.org/html/2607.09789#bib.bib10),19 (https://arxiv.org/html/2607.09789#bib.bib12),21 (https://arxiv.org/html/2607.09789#bib.bib13),22 (https://arxiv.org/html/2607.09789#bib.bib14),46 (https://arxiv.org/html/2607.09789#bib.bib16),39 (https://arxiv.org/html/2607.09789#bib.bib15)]。越来越多的研究开始将这些能力扩展到科学模拟环境中。在辐射输运领域,AutoFLUKA展示了通过领域知识增强的智能体进行AI辅助的MC模拟生成[24 (https://arxiv.org/html/2607.09789#bib.bib18)]。在有限元分析中,MCP-SIM引入了一个用于基于FEniCS的模拟的自校正多智能体框架[29 (https://arxiv.org/html/2607.09789#bib.bib21)],而Shafiq等人评估了LLM在Gmsh和Elmer工作流中用于几何生成和求解器设置的表现[35 (https://arxiv.org/html/2607.09789#bib.bib22)]。在计算流体动力学领域,OpenFOAMGPT采用了检索增强生成以进行基于OpenFOAM的模拟[28 (https://arxiv.org/html/2607.09789#bib.bib23)],而MetaOpenFOAM开发了一个专门的CFD工作流多智能体框架[10 (https://arxiv.org/html/2607.09789#bib.bib24)],进而催生了CFDLLMBench基准测试套件[37 (https://arxiv.org/html/2607.09789#bib.bib25)]。类似的工作最近也出现在通用多物理场模拟领域,包括用于基于MOOSE的工作流的MooseAgent[44 (https://arxiv.org/html/2607.09789#bib.bib40)],以及核工程应用方面,包括用于生成SAM反应堆热工-水力代码输入文件的AutoSAM[1 (https://arxiv.org/html/2607.09789#bib.bib41)]。相关的基准测试工作也在相邻的模拟领域出现,包括网络模拟[3 (https://arxiv.org/html/2607.09789#bib.bib42)]、分子动力学[15 (https://arxiv.org/html/2607.09789#bib.bib43)]、粒子物理实验设计与模拟[14 (https://arxiv.org/html/2607.09789#bib.bib19)]以及核能应用[4 (https://arxiv.org/html/2607.09789#bib.bib20)]。

LLM在科学计算方面的表现往往受限于领域特定知识的可访问性,而不是推理能力。为了解决这一挑战,近期的研究表明,检索增强生成(RAG)和直接注入文档可以通过提供对技术信息的结构化访问,显著改善代码生成和模拟设置,这些信息要么在预训练数据中缺失,要么难以从长文档中检索[28 (https://arxiv.org/html/2607.09789#bib.bib23),45 (https://arxiv.org/html/2607.09789#bib.bib38),30 (https://arxiv.org/html/2607.09789#bib.bib39)]。与此同时,当静态知识单独不足时,智能体工作流已成为一种补充策略。现代多智能体系统将复杂任务分解为专门的子角色,包括规划、执行、验证和修复,正如MetaGPT[16 (https://arxiv.org/html/2607.09789#bib.bib34)]、AutoGen[41 (https://arxiv.org/html/2607.09789#bib.bib35)]、SciAgents[13 (https://arxiv.org/html/2607.09789#bib.bib26)]和SWE-agent[42 (https://arxiv.org/html/2607.09789#bib.bib33)]等框架所展示的那样。这些系统建立在迭代推理和自我校正范式之上,如ReAct[43 (https://arxiv.org/html/2607.09789#bib.bib27)]、Self-Refine[23 (https://arxiv.org/html/2607.09789#bib.bib29)]和Reflexion[36 (https://arxiv.org/html/2607.09789#bib.bib28)],使模型能够整合执行反馈并逐步改进生成的输出。然而,其他研究表明,自我校正并非万能。Huang等人[17 (https://arxiv.org/html/2607.09789#bib.bib30)]和Olausson等人[25 (https://arxiv.org/html/2607.09789#bib.bib31)]表明,自我修复的有效性从根本上受限于外部反馈的质量和信息量,而Kamoi等人[20 (https://arxiv.org/html/2607.09789#bib.bib32)]则对自校正LLM系统的局限性和机遇进行了全面综述。

总体而言,科学计算社区正在形成一种共识:LLM可以协助模拟设置和执行,特别是在配备检索机制、结构化文档和迭代自校正的情况下。然而,现有的努力存在几个重要的局限性。大多数目标软件生态系统在网上有广泛的文档记录,出现在公共训练语料库中,并依赖于现代脚本语言和API。因此,很难确定观察到的性能反映了对物理系统的真正推理,还是对先前见过示例的检索[18 (https://arxiv.org/html/2607.09789#bib.bib17)]。此外,许多现有的基准测试主要关注语法正确性,而对结果的物理有效性关注较少。

辐射输运模拟为评估AI辅助的科学计算提供了一个令人信服的试验台。成功生成一个有效的模拟需要对几何、材料、源定义、物理模型、计数规范和代码特定语法同时进行推理。微小的错误可能导致执行失败、静默错误的输出或物理上无效的结果。因此,辐射输运工作流提供了一个现实的衡量标准,用于判断AI系统是否能弥合自然语言科学意图与可执行、物理上有意义的模拟之间的鸿沟。

粒子与重离子输运代码系统(PHITS)提供了一个特别具有挑战性和信息性的案例研究。PHITS是最广泛使用的通用MC软件包之一,通常应用于反应堆屏蔽分析、加速器设计、探测器建模、质子治疗、医学物理和空间辐射评估。与许多现代软件环境不同,PHITS依赖于一种源自传统科学计算工作流的专门输入语言;其带括号的段落、列敏感的代码行以及临时性的子段落语法让人联想到20世纪80年代的Fortran卡片输入。此外,其代码、文档和示例库在公共网络上并不广泛可用,这使得PHITS在训练当代基础模型的数据中代表性不足。

重要的是,PHITS输入生成需要的不仅仅是代码合成。一个有效的模拟结合了多个相互依赖的组件,包括几何定义、材料规范、源描述、输运参数和计数请求。输入以自由格式的文本文件指定,由命名的关键字段落组成,包括[Parameters]、[Source]、[Material]、[Surface]、[Cell]、[T-Track]、[T-Deposit]等(图1 (https://arxiv.org/html/2607.09789#S1.F1))。尽管该语言的格式相对宽松,但在物理上却是毫不留情的。一个外空腔未能包围模拟区域的几何体可能触发致命错误;一个配置了错误能量区间定义的计数可能成功执行,但产生物理上无意义的结果;而不同段落中看似相似的关键字可能具有不同的数值含义。因此,生成PHITS输入需要同时理解辐射物理和解析器特定的约束。

为了系统评估LLM生成此类输入的能力,我们引入了PHITSBench,这是一个用于AI辅助PHITS输入生成的执行评分基准。PHITSBench包含282个可输运评分的任务,涵盖三个类别,反映了常见的PHITS工作流:参数编辑、语法修复以及从自然语言描述重建完整模拟。与通过文本相似度度量(如CodeBLEU[31 (https://arxiv.org/html/2607.09789#bib.bib11)])评分的基准不同,PHITSBench通过执行PHITS模拟并将结果输运可观测量与参考解决方案进行比较来评估生成的输入。这种基于执行的框架能够直接评估语法正确性和物理保真度。

利用PHITSBench,我们研究了三个核心问题。首先,在没有领域特定知识的情况下,LLM在多大程度上能够生成有效的辐射输运模拟?其次,通过结构化知识注入和检索机制可以恢复多少性能?第三,专门的智能体架构能否在生成和修复复杂科学模拟方面优于通用编码智能体?这些答案不仅为AI辅助辐射输运建模的未来提供了见解,而且更广泛地揭示了智能体AI系统在科学计算、核工程和基于物理的设计中的作用。

## 2 材料与方法

### 2.1 基准设计

PHITSBench旨在评估AI辅助生成辐射输运模拟的能力,覆盖常见的PHITS用户工作流范围。该基准包含282个任务,源自官方PHITS 3.34示例库,这些任务被组织成三个任务类别:*Edit*、*Repair*和*Reproduce*(图2 (https://arxiv.org/html/2607.09789#S2.F2))。

请参考图注

图2:每个基准任务类别中的代表性示例。*Edit*(左):模型接收到一个有效的PHITS输入文件以及一个自然语言修改请求,必须生成一个更新后的输入文件,其输运结果与修改后的参考模拟相匹配。*Repair*(中):模型接收到一个故意损坏的PHITS输入文件以及相应的PHITS错误消息,必须生成一个修正后的模拟输入。*Reproduce*(右):模型仅接收到物理问题的自然语言描述,必须从头生成一个完整的PHITS输入文件。

*Edit*任务类别包含65个任务(n=65),评估对现有参考模拟的受控修改。模型会收到一个有效的PHITS输入文件以及一条自然语言指令,请求对模拟设置进行一项或多项更改,例如修改源能量、材料成分、几何尺寸或计数参数。手工制作的修改指令范围从单一参数更改到同时涉及源能量、材料成分和几何结构的复合编辑。生成的输出预期再现一个参考模拟的行为,其中相同的修改已手动应用。此任务反映了PHITS用户通常进行的参数研究和设计空间探索。

*Repair*任务类别(n=131)评估错误诊断和修正。每个任务包含一个故意损坏的PHITS输入文件以及相应的系统生成的错误消息。损坏的输入文件在随机选择的合法位置包含一个单一故障——拼写错误的关键字、缺失的必需参数、损坏或重复的段落头

相似文章

介绍 BenchBench(5分钟阅读)

TLDR AI

介绍 BenchBench,这是一个评估 AI 模型为其他模型创建有效基准能力的基准测试。目前 GPT 5.2 是唯一成功的胜者,而 GPT 5.5 和 Opus 4.6 等前沿模型则表现不佳。

ProgramBench(5分钟阅读)

TLDR AI

ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。

介绍 HealthBench

OpenAI Blog

OpenAI 推出了 HealthBench,这是一个用于评估医疗保健环境中人工智能系统的新基准。该基准由来自 60 个国家的 262 名医生共同创建,包含 5,000 个逼真的健康对话和医生编写的评分标准,用于评估模型在有意义、可信和可改进的指标上的性能。