论LLM作为裁判在科学新颖性评估中的局限性
摘要
本文介绍了RQ-Bench,一个用于评估LLM判断科学研究问题新颖性的基准。研究发现,LLM裁判一致认为生成的问题比人类专家认为的更新颖,这引发了对使用LLM进行科学新颖性评估可靠性的担忧。
查看缓存全文
缓存时间: 2026/06/11 13:41
论文页面 - 论LLM作为评审在评估科学新颖性方面的局限
来源:https://huggingface.co/papers/2606.12071
摘要
大型语言模型生成的研究问题在与人类专家进行新颖性评估时表现出不一致的结果,这凸显了依赖LLM进行科学新颖性评估的隐忧。
LLM越来越多地被用于生成和评判科学想法。这使得新颖性评估 (https://huggingface.co/papers?q=novelty%20evaluation) 成为一个核心问题。完整的想法评估之所以困难,是因为它通常需要判断一个方法、其可行性以及其实验前景。因此,我们研究了一个更清晰的上游对象:研究问题(RQ)。RQ生成是科学构思的先决条件,并且RQ可以与真实论文中探索的问题进行比较。我们引入了RQ-Bench,一个基于近期arXiv论文 (https://huggingface.co/papers?q=arXiv%20papers) 构建的基准测试 (https://huggingface.co/papers?q=benchmark)。对于每篇论文,我们从其引用的背景、空白和贡献中重构出作者锚定的RQ。这些RQ并不是针对同一背景的唯一有效问题。它们是用于测试新颖性判断的作者锚定的参考点 (https://huggingface.co/papers?q=author-anchored%20reference%20points)。我们通过独立的LLM评审、比较性的LLM评审以及人类专家评估 (https://huggingface.co/papers?q=human%20expert%20evaluation) 来评估模型生成的RQ。LLM评审一致性地将模型生成的RQ评为高度新颖,从而产生了新颖性幻象;在比较评估 (https://huggingface.co/papers?q=comparative%20evaluation) 中,这种偏好变得更为强烈。然而,领域专家得出了相反的结论,更喜欢作者锚定的参考问题。我们进一步发现,许多生成的RQ范围狭窄或受源限制,这是LLM评审除非明确测试否则常会忽略的一个维度。总体而言,LLM评审与人类专家之间相互矛盾的新颖性评估 (https://huggingface.co/papers?q=novelty%20evaluation) 引发了关于使用LLM评估研究问题 (https://huggingface.co/papers?q=research%20questions) 科学新颖性的可靠性的严重担忧。
查看 arXiv 页面 (https://arxiv.org/abs/2606.12071) 查看 PDF (https://arxiv.org/pdf/2606.12071) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.12071)
引用该论文的模型 0
没有模型链接此论文
请在一个模型的 README.md 中引用 arxiv.org/abs/2606.12071 以从此页面链接。
引用该论文的数据集 1
declare-lab/rq-bench 更新于约12小时前 • 1.31k (https://huggingface.co/datasets/declare-lab/rq-bench)
引用该论文的空间 0
没有 Space 链接此论文
请在一个 Space 的 README.md 中引用 arxiv.org/abs/2606.12071 以从此页面链接。
包含该论文的收藏 0
没有收藏包含此论文
请将此论文添加到一个收藏 (https://huggingface.co/new-collection) 中以从此页面链接。
相似文章
判断、检索或放弃:具有可证明风险保证的不确定性防护LLM判断
本文提出一个风险控制框架,用于在事实评估中将LLM作为判断器。该框架校准不确定性阈值以维持用户指定的错误率,并在必要时路由到检索增强模式,从而实现具有可证明可靠性保证的更高覆盖率。
基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测
本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。
评估LLM作为共同科学家的研究诚信的诊断基础
本文介绍了IntegrityBench,一个用于评估LLM在机构压力下作为共同科学家时是否维护研究诚信的基准。研究发现,在峰值压力下,前沿模型在约三分之一的诚信关键决策中失败,且道德行为并不需要准确的不当行为分类。
LLMs是否已准备好进行科学发现?面向AI科学家的能力导向基准
介绍了SDABench,一个评估LLMs在五个领域六种科学分析能力上的基准,发现模型在需要假设选择和机制推理的任务上表现困难。
是时候 REFLECT 了:我们能信任 LLM 评判者来评估基于证据的研究代理吗?
本文介绍了 REFLECT,这是一个用于评估 LLM 评判者在深度研究代理评估中可靠性的元评估基准。实验表明,当前的 LLM 评判者仍然不可靠,在推理、工具使用和报告质量失败方面的整体准确率低于 55%。