论LLM作为裁判在科学新颖性评估中的局限性

Hugging Face Daily Papers 论文

摘要

本文介绍了RQ-Bench,一个用于评估LLM判断科学研究问题新颖性的基准。研究发现,LLM裁判一致认为生成的问题比人类专家认为的更新颖,这引发了对使用LLM进行科学新颖性评估可靠性的担忧。

LLM越来越多地被用于生成和评判科学想法。这使得新颖性评估成为了一个核心问题。完整的想法评估很困难,因为它通常需要判断一个方法、其可行性及其经验前景。因此,我们研究了一个更清晰的上游对象:研究问题(RQ)。RQ生成是科学构思的先决条件,并且可以将RQ与实际论文中探讨的问题进行比较。我们引入了RQ-Bench,一个基于近期arXiv论文构建的基准。对于每篇论文,我们从其引用的背景、空白和贡献中重建了作者锚定的RQ。这些RQ并不是同一背景下的唯一有效问题。它们是用来测试新颖性判断的作者锚定参考点。我们使用独立的LLM评判、比较性LLM评判和人类专家评估来评估模型生成的RQ。LLM裁判一致认为模型生成的RQ具有高度的新颖性,产生了新颖性幻象;在比较评估中,这种偏好变得更强。然而,领域专家得出相反的结论,更倾向于作者锚定的参考问题。我们进一步发现,许多生成的RQ是狭隘的或受限于来源,这一维度除非明确测试,否则LLM裁判经常忽略。总体而言,LLM裁判与人类专家之间矛盾的新颖性评估引发了对使用LLM评估研究问题科学新颖性可靠性的严重担忧。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:41

论文页面 - 论LLM作为评审在评估科学新颖性方面的局限

来源:https://huggingface.co/papers/2606.12071

摘要

大型语言模型生成的研究问题在与人类专家进行新颖性评估时表现出不一致的结果,这凸显了依赖LLM进行科学新颖性评估的隐忧。

LLM越来越多地被用于生成和评判科学想法。这使得新颖性评估 (https://huggingface.co/papers?q=novelty%20evaluation) 成为一个核心问题。完整的想法评估之所以困难,是因为它通常需要判断一个方法、其可行性以及其实验前景。因此,我们研究了一个更清晰的上游对象:研究问题(RQ)。RQ生成是科学构思的先决条件,并且RQ可以与真实论文中探索的问题进行比较。我们引入了RQ-Bench,一个基于近期arXiv论文 (https://huggingface.co/papers?q=arXiv%20papers) 构建的基准测试 (https://huggingface.co/papers?q=benchmark)。对于每篇论文,我们从其引用的背景、空白和贡献中重构出作者锚定的RQ。这些RQ并不是针对同一背景的唯一有效问题。它们是用于测试新颖性判断的作者锚定的参考点 (https://huggingface.co/papers?q=author-anchored%20reference%20points)。我们通过独立的LLM评审、比较性的LLM评审以及人类专家评估 (https://huggingface.co/papers?q=human%20expert%20evaluation) 来评估模型生成的RQ。LLM评审一致性地将模型生成的RQ评为高度新颖,从而产生了新颖性幻象;在比较评估 (https://huggingface.co/papers?q=comparative%20evaluation) 中,这种偏好变得更为强烈。然而,领域专家得出了相反的结论,更喜欢作者锚定的参考问题。我们进一步发现,许多生成的RQ范围狭窄或受源限制,这是LLM评审除非明确测试否则常会忽略的一个维度。总体而言,LLM评审与人类专家之间相互矛盾的新颖性评估 (https://huggingface.co/papers?q=novelty%20evaluation) 引发了关于使用LLM评估研究问题 (https://huggingface.co/papers?q=research%20questions) 科学新颖性的可靠性的严重担忧。

查看 arXiv 页面 (https://arxiv.org/abs/2606.12071) 查看 PDF (https://arxiv.org/pdf/2606.12071) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.12071)

引用该论文的模型 0

没有模型链接此论文

请在一个模型的 README.md 中引用 arxiv.org/abs/2606.12071 以从此页面链接。

引用该论文的数据集 1

declare-lab/rq-bench 更新于约12小时前 • 1.31k (https://huggingface.co/datasets/declare-lab/rq-bench)

引用该论文的空间 0

没有 Space 链接此论文

请在一个 Space 的 README.md 中引用 arxiv.org/abs/2606.12071 以从此页面链接。

包含该论文的收藏 0

没有收藏包含此论文

请将此论文添加到一个收藏 (https://huggingface.co/new-collection) 中以从此页面链接。

相似文章

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。

评估LLM作为共同科学家的研究诚信的诊断基础

arXiv cs.AI

本文介绍了IntegrityBench,一个用于评估LLM在机构压力下作为共同科学家时是否维护研究诚信的基准。研究发现,在峰值压力下,前沿模型在约三分之一的诚信关键决策中失败,且道德行为并不需要准确的不当行为分类。