标签
PHITSBench是一个基于执行得分的基准测试,用于评估AI模型从自然语言生成PHITS辐射输运输入文件的能力,涵盖编辑、修复和完整生成任务。使用GPT-5.4进行的实验表明,虽然领域知识能提升性能,但在正确配置物理可观测量方面仍存在显著挑战。