PRL-Bench:评估大语言模型在尖端物理研究中能力的全面基准
摘要
PRL-Bench是一个全面基准,用于评估大语言模型在尖端物理研究中的能力,基于从五个物理子领域精选的100篇《物理评论快报》论文构建。该基准揭示了当前大语言模型性能的重大差距(最佳得分低于50%),旨在测试端到端研究流程、复杂推理和自主探索。
查看缓存全文
缓存时间: 2026/04/20 08:27
论文页面 - PRL-Bench:评估大语言模型在前沿物理研究中能力的综合性基准
来源: https://huggingface.co/papers/2604.15411 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
当前AI系统在执行端到端物理研究方面的能力有限,凸显了现有语言模型与现实科学发现需求之间的显著差距。
智能体科学 (https://huggingface.co/papers?q=agentic%20science)的范式要求AI系统能够进行稳健的推理,并开展长时跨度的自主探索 (https://huggingface.co/papers?q=autonomous%20exploration)。然而,当前的科学基准 (https://huggingface.co/papers?q=scientific%20benchmarks)仍然局限于领域知识 (https://huggingface.co/papers?q=domain%20knowledge)理解与复杂推理,未能评估真实研究中的探索性质与流程复杂性。在这项工作中,我们提出了理论物理与计算物理 (https://huggingface.co/papers?q=computational%20physics)领域的研究导向评估——一个天然的测试平台,包含全面的领域知识 (https://huggingface.co/papers?q=domain%20knowledge)、复杂推理以及可验证的端到端工作流 (https://huggingface.co/papers?q=end-to-end%20workflows),无需依赖实验。这里我们引入了PRL-Bench (https://huggingface.co/papers?q=PRL-Bench)(大语言模型物理研究 (https://huggingface.co/papers?q=LLMs)基准),旨在系统性地映射大语言模型 (https://huggingface.co/papers?q=LLMs)在执行端到端物理研究时的能力边界。该基准基于2025年8月以来《物理评论快报》最新期次中精选的100篇论文构建,并经领域专家验证,覆盖现代物理学的五个主要理论与计算密集型子领域:天体物理学、凝聚态物理学、高能物理学、量子信息与统计物理学。基准中的每个任务都旨在复现真实科学研究 (https://huggingface.co/papers?q=scientific%20research)的核心特性,包括探索导向的公式化、长时跨度工作流以及客观可验证性,从而重构真实物理研究中关键的推理过程与研究流程。对前沿模型的评估显示,性能仍有限,最佳总分低于50,揭示了当前大语言模型能力与现实科学研究 (https://huggingface.co/papers?q=scientific%20research)要求之间存在的显著差距。PRL-Bench (https://huggingface.co/papers?q=PRL-Bench)可作为评估下一代AI科学家的可靠测试平台,推动AI系统向自主科学发现迈进。
查看arXiv页面 (https://arxiv.org/abs/2604.15411)查看PDF (https://arxiv.org/pdf/2604.15411)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.15411)
在您的智能体中获取此论文:
hf papers read 2604.15411
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2604.15411以从本页链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2604.15411以从本页链接。
引用此论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2604.15411以从本页链接。
包含此论文的收藏集1
相似文章
PRISM:评估LLM审稿人的多维度基准
介绍PRISM,一个用于评估基于大语言模型的同行评审员的多维度基准,涵盖分析深度、新颖性评估、缺陷识别和建设性。研究结果表明,大语言模型在单个维度上能与人类评审员匹敌甚至超越,但缺乏跨所有维度的平衡表现,因此最适合作为人类评审的补充工具。
BenchMIRT:LLM 基准测试实际在测量什么?
BenchMIRT 介绍了一种方法,使用多维项目反应理论在单个提示词级别审计 LLM 基准测试,分离安全性和一般推理等底层能力,以揭示基准测试实际测量的内容。
RepBench:将基准测试编译为大语言模型的能力表示
RepBench是一个基于基准测试的表示探测数据层,由13,427篇基准测试论文和353个公共数据集构建,生成涵盖94种能力的46,149条探测文本。它评估了能力向量在模型和读出方法之间的迁移。
测试前沿大语言模型在平行物理世界中的物理素养
本文介绍了一种四阶段诊断法,用于测试大语言模型能否在不熟悉的物理框架中进行推理。研究发现,前沿模型的通过率较低,并表现出定性分析与定量分析之间的不对称性。
@ms_aifrontiers: 大多数LLM基准测试得分在运行之前即可预测。MS AI Frontiers团队新作:BenchPress。……
MS AI Frontiers团队推出了BenchPress,该方法利用矩阵补全技术,仅通过五个探针即可预测LLM基准测试得分,表明得分矩阵实际上为秩2。