PRL-Bench:评估大语言模型在尖端物理研究中能力的全面基准

Hugging Face Daily Papers 论文

摘要

PRL-Bench是一个全面基准,用于评估大语言模型在尖端物理研究中的能力,基于从五个物理子领域精选的100篇《物理评论快报》论文构建。该基准揭示了当前大语言模型性能的重大差距(最佳得分低于50%),旨在测试端到端研究流程、复杂推理和自主探索。

自主科学范式要求AI系统进行稳健推理并从事长周期、自主的探索。然而,当前的科学基准仍局限于领域知识理解和复杂推理,未能评估真实研究的探索性质和流程复杂性。在这项工作中,我们提出了针对理论物理和计算物理的研究导向评估——一个自然测试平台,具备全面的领域知识、复杂推理以及不依赖实验的可验证端到端工作流。在此,我们介绍PRL-Bench(物理研究大语言模型基准),这是一个旨在系统描绘大语言模型在执行端到端物理研究中能力边界的基准。PRL-Bench基于2025年8月以来最新《物理评论快报》中精选的100篇论文构建,并经领域专家验证,涵盖现代物理中五个以理论与计算为主的子领域:天体物理学、凝聚态物理学、高能物理学、量子信息学和统计物理学。基准中的每个任务都旨在复现真实科学研究的核心属性,包括探索导向的构建、长周期工作流以及客观可验证性,从而重构真实物理研究的本质推理过程和研究流程。对前沿模型的评估表明,其性能仍然有限,最佳总得分低于50,揭示出当前大语言模型能力与真实科学研究需求之间的显著差距。PRL-Bench为评估下一代AI科学家——推动AI系统走向自主科学发现——提供了一个可靠的测试平台。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:27

论文页面 - PRL-Bench:评估大语言模型在前沿物理研究中能力的综合性基准

来源: https://huggingface.co/papers/2604.15411 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

当前AI系统在执行端到端物理研究方面的能力有限,凸显了现有语言模型与现实科学发现需求之间的显著差距。

智能体科学 (https://huggingface.co/papers?q=agentic%20science)的范式要求AI系统能够进行稳健的推理,并开展长时跨度的自主探索 (https://huggingface.co/papers?q=autonomous%20exploration)。然而,当前的科学基准 (https://huggingface.co/papers?q=scientific%20benchmarks)仍然局限于领域知识 (https://huggingface.co/papers?q=domain%20knowledge)理解与复杂推理,未能评估真实研究中的探索性质与流程复杂性。在这项工作中,我们提出了理论物理与计算物理 (https://huggingface.co/papers?q=computational%20physics)领域的研究导向评估——一个天然的测试平台,包含全面的领域知识 (https://huggingface.co/papers?q=domain%20knowledge)、复杂推理以及可验证的端到端工作流 (https://huggingface.co/papers?q=end-to-end%20workflows),无需依赖实验。这里我们引入了PRL-Bench (https://huggingface.co/papers?q=PRL-Bench)(大语言模型物理研究 (https://huggingface.co/papers?q=LLMs)基准),旨在系统性地映射大语言模型 (https://huggingface.co/papers?q=LLMs)在执行端到端物理研究时的能力边界。该基准基于2025年8月以来《物理评论快报》最新期次中精选的100篇论文构建,并经领域专家验证,覆盖现代物理学的五个主要理论与计算密集型子领域:天体物理学、凝聚态物理学、高能物理学、量子信息与统计物理学。基准中的每个任务都旨在复现真实科学研究 (https://huggingface.co/papers?q=scientific%20research)的核心特性,包括探索导向的公式化、长时跨度工作流以及客观可验证性,从而重构真实物理研究中关键的推理过程与研究流程。对前沿模型的评估显示,性能仍有限,最佳总分低于50,揭示了当前大语言模型能力与现实科学研究 (https://huggingface.co/papers?q=scientific%20research)要求之间存在的显著差距。PRL-Bench (https://huggingface.co/papers?q=PRL-Bench)可作为评估下一代AI科学家的可靠测试平台,推动AI系统向自主科学发现迈进。

查看arXiv页面 (https://arxiv.org/abs/2604.15411)查看PDF (https://arxiv.org/pdf/2604.15411)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.15411)

在您的智能体中获取此论文:

hf papers read 2604.15411

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2604.15411以从本页链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2604.15411以从本页链接。

引用此论文的Space0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2604.15411以从本页链接。

包含此论文的收藏集1

相似文章

PRISM:评估LLM审稿人的多维度基准

arXiv cs.CL

介绍PRISM,一个用于评估基于大语言模型的同行评审员的多维度基准,涵盖分析深度、新颖性评估、缺陷识别和建设性。研究结果表明,大语言模型在单个维度上能与人类评审员匹敌甚至超越,但缺乏跨所有维度的平衡表现,因此最适合作为人类评审的补充工具。

BenchMIRT:LLM 基准测试实际在测量什么?

Hugging Face Blog

BenchMIRT 介绍了一种方法,使用多维项目反应理论在单个提示词级别审计 LLM 基准测试,分离安全性和一般推理等底层能力,以揭示基准测试实际测量的内容。