NovGauge:一种用于诊断LLMs在论文新颖性评估能力的细粒度基准
摘要
NovGauge是一个基于人类锚定的基准,用于诊断LLMs在论文新颖性评估中的能力,覆盖任务、问题和方法维度。对18个LLMs的评估显示高幻觉率和逻辑不匹配,表明当前模型在此任务上不可靠。
arXiv:2609.11234v1 公告类型:新
摘要:大语言模型(LLMs)越来越多地用于主要AI会议的同行评审,但新颖性仍然是一个持续弱点。现有基准将新颖性作为单一整体分数评估,难以诊断模型在哪个维度上误判或其证据是否忠实。我们提出了NovGauge,一个基于人类锚定的细粒度新颖性评估诊断基准。该基准包含619对论文和50个多论文集,来源于两个专家来源:ICLR审稿人重叠声明和调查共引。实例沿三个维度独立标注:任务、问题和方法,捕捉应用目标、技术挑战和解决方案方法。我们提出一个级联诊断管道,验证每个维度的正确性、证据基础和逻辑支持。对18个LLMs的评估显示,幻觉率在0%到39%之间变化,在非幻觉的正确正向判断中,超过70%引用的证据未能逻辑支持所述原因。表现最佳的模型GPT-5.5在各维度上达到43-72%的验证F1分数,而大多数模型在忠实性验证后保留的原始F1分数不足一半。这些结果表明,当前LLMs在可靠的科学新颖性评估方面仍远未达到要求,特别是当正确性依赖于忠实的证据基础时。
查看缓存全文
缓存时间: 2026/09/12 08:24
# NovGauge:一个用于诊断大语言模型论文新颖性评估能力的细粒度基准 来源:https://arxiv.org/html/2609.11234 郭强 单位:复旦大学计算机科学与人工智能学院,中国上海 邮箱:[zitago121@gmail\.com](mailto:) 谭可欣 单位:复旦大学计算机科学与人工智能学院,中国上海 单位:东京大学工学研究生院,日本东京 张明 单位:复旦大学计算机科学与人工智能学院,中国上海 景文清 单位:复旦大学计算机科学与人工智能学院,中国上海 岳忠翰 单位:复旦大学计算机科学与人工智能学院,中国上海 陈嘉毅 单位:复旦大学计算机科学与人工智能学院,中国上海 吴世强 单位:复旦大学计算机科学与人工智能学院,中国上海 刘绍凡 单位:复旦大学计算机科学与人工智能学院,中国上海 张越 单位:Atom Infinite Pte\. Ltd\., 新加坡 应元凯 单位:复旦大学计算机科学与人工智能学院,中国上海 石杨 单位:AtomInnoLab 桂韬 单位:复旦大学计算机科学与人工智能学院,中国上海 张奇 单位:复旦大学计算机科学与人工智能学院,中国上海 黄萱菁 单位:复旦大学计算机科学与人工智能学院,中国上海 ###### 摘要 大语言模型(LLMs)在主要人工智能会议的同行评审中的应用日益增多,但新颖性评估仍然是一个持续存在的薄弱环节。现有的基准测试将新颖性作为一个整体的分数进行评估,这使得很难诊断模型误判了哪个维度,或者其引用的证据是否可靠。我们提出了NovGauge,一个基于人类锚定的、用于细粒度新颖性评估诊断的基准。该基准包含619对论文和50个多论文集合,来源于两个专家来源:ICLR审稿人声明的重叠和综述的共同引用。实例沿三个维度独立标注:*任务*、*问题*和*方法*,分别捕捉应用目标、技术挑战和解决方案方法。我们提出了一个级联诊断流程,用于验证每个维度的正确性、证据锚定和逻辑支持。对18个大语言模型的评估显示,在不同维度上,幻觉率在0%到39%之间变化;而在非幻觉的正确肯定判断中,超过70%引用的证据未能在逻辑上支持所述理由。表现最佳的模型GPT-5.5在不同维度上的验证F1分数达到43%至72%,而大多数模型在经过真实性验证后,其原始F1分数的一半都未能保留。这些结果表明,当前的大语言模型距离可靠的科学新颖性评估仍有很大差距,尤其是在判断正确性依赖于可靠证据锚定的情况下。 ## 1 引言 参见标题图1:一个标签,三个维度。一篇ICLR 2026的投稿论文与被标记的先前工作进行比较。NovGauge独立评估每个维度,揭示这对论文在方法上共享,但针对不同的任务。 参见标题图2:NovGauge框架概述。两个人类锚定的构建流程生成带有任务、问题和方法标签的论文对和多论文集合。模型输出通过级联评估漏斗,检查正确性、证据幻觉和推理不匹配,从而得出每个维度的诊断结果。 大语言模型已经通过两个渠道大规模地塑造了同行评审。审稿人越来越多地依赖通用大语言模型来起草评审意见,审计估计,目前在主要人工智能会议上,高达20%的文本是由大语言模型生成的(Liang et al., 2024a;Shen and Wang, 2026)。与此同时,专门的自动评审系统不断涌现(Zhou et al., 2024;D’Arcy et al., 2024;Zhu et al., 2025),其中一些在录取决定方面已接近人类水平的共识度(Weng et al., 2025)。然而,大语言模型生成的评审意见的可靠性仍然受到质疑(Wu et al. (2026a);Shin et al. (2025b);Du et al. (2024))。最近的评估显示,大语言模型的评审意见与人类判断的相关性很弱,并且可以被轻易地操纵(Baumann et al., 2026)。这一担忧对于新颖性评估尤为重要:对ICLR 2024–2025的大规模分析发现,缺乏新颖性是被拒论文中最常被引用的弱点之一(Kargaran et al., 2025)。 尽管新颖性如此重要,它对大语言模型审稿人来说仍然是一个特别具有挑战性的标准。研究表明,大语言模型在评审中会系统性地低估新颖性(Shin et al., 2025a),甚至其给出的新颖性评分与论文最终影响力呈负相关(Jiang, 2026)。这些结果证实了大语言模型的新颖性评估是不可靠的,但仅用一个整体标签上的单一准确率数字,只能揭示模型表现不佳,而无法指出它在新颖性的哪个方面判断失误。这就留下了评审中的实际问题未得到解答:给定一篇投稿和一篇被标记的先前工作,哪个新颖性维度存在重叠?引用的证据是否可靠? 可靠的诊断需要两种能力。第一是*按维度*评估。新颖性并非铁板一块:科学计量学研究将其分解为研究问题和方法(Luo et al., 2022;Shen et al., 2026),一篇论文可能在一个维度上与先前工作重叠,而在其他维度上保持新颖(图1)。然而,目前的基准测试要么让维度在不同实例间变化(Moussa et al., 2025),要么将新颖性作为多个评审标准中一个未区分的分数来处理(Qiao et al., 2026;Schopf and Färber, 2026;Lin et al., 2025;Wu et al., 2026b)。第二是*真实性*验证。即使模型的判断是正确的,其背后的推理也可能建立在虚构的证据或逻辑漏洞之上。目前还没有基准测试能系统性地诊断失败是源于判断错误、虚构证据还是逻辑漏洞(Schopf and Färber, 2026)。 我们引入了NovGauge,一个旨在实现新颖性判断细粒度诊断的基准。每个实例都独立标注了任务、问题和方法,提供了固定的每维度真实标签。标签锚定在两个互补的人类来源:ICLR审稿人的重叠声明和经过标注者验证的综述共同引用。除了成对比较,该基准还包括50个多论文分组集合。评估协议不止步于二元正确性,而是应用一个*级联*诊断流程,依次检查正确性、证据幻觉和推理不匹配。只有同时通过这三个阶段的预测才计入验证F1分数,确保模型是*以正确的理由得出了正确的答案*。我们的贡献在于: - • 一个包含619对和50个多论文集合的基准,具有固定的三维度真实标签,锚定于ICLR审稿人声明和经过标注者验证的综述共同引用。 - • 一个级联评估协议,按维度诊断新颖性判断,并通过幻觉和不匹配检查审计证据真实性。 - • 对18个大语言模型的系统性评估,揭示了即使是正确的判断也常常由虚构或逻辑脱节的证据支持,且失败模式在不同维度间差异显著。 图2总结了该基准的构建和评估流程。 ## 2 相关工作 ### 2.1 自动化论文评审 基于大语言模型的同行评审已从单一模型的批评生成(Zhou et al., 2024)发展到多智能体架构(D’Arcy et al., 2024;Yu et al., 2024;Bougie and Watanabe, 2024)以及在结构化推理链上微调的模型(Zhu et al., 2025;Weng et al., 2025;Taechoyotin and Acuna, 2025)。然而,系统性分析揭示,大语言模型过度关注技术有效性而低估新颖性(Shin et al., 2025a),对大语言模型生成的论文给出虚高分数(Li et al., 2025),并且仅在低质量投稿上与人类判断一致(Liang et al., 2024b)。Li et al. (2026) 进一步表明,使批评焦点与人类专家对齐是可靠评分的前提条件。这些发现促使了专门诊断新颖性判断的基准测试的出现。 ### 2.2 新颖性与相似性基准 表1将我们的工作置于从文档级相似性到细粒度新颖性评估的发展进程中。SciDocs(Cohan et al., 2020)和SciRepEval(Singh et al., 2023)基于引用图标签评估检索相关性,整体衡量相似性而不区分哪些维度重叠。近期的新颖性基准超越了检索,评估论文或想法是否推动了技术水平的进步。NovBench(Wu et al., 2026b)将新颖性定义为从单篇论文引言主张生成文本,而基于文献的系统评估稿件相对于现有工作的新颖性(Mostafa et al., 2026;Zhang et al., 2026a)。想法级基准根据检索到的相关工作评估研究想法:RINoBench(Schopf and Färber, 2026)和InnoEval(Qiao et al., 2026)分配新颖性分数,而ScholarEval(Moussa et al., 2025)和Idea Novelty Checker(Shahid et al., 2025)则动态识别每个想法的贡献维度。成对方法以指定的论文对作为输入,但目标是评估评审质量(Zhang et al., 2026b;Zheng et al., 2026)或相对新颖性排序(Lin et al., 2025),而不是在固定维度上进行重叠检测。 基准 | 任务 | 成对 | 分组 | 专家 | #维度 | 规模 --- | --- | --- | --- | --- | --- | --- SciDocs (Cohan et al., 2020) | 检索 | ✓ | — | — | 1 | 25K 篇论文 SciRepEval (Singh et al., 2023) | 检索 | ✓ | — | — | 1 | 60K 篇论文 NovBench (Wu et al., 2026b) | 生成 | — | — | ✓ | 1 | 1.7K 对 RINoBench (Schopf and Färber, 2026) | 评分 | — | — | ✓ | 1 | 1.4K 个想法 ScholarEval (Moussa et al., 2025) | 评分 + RAG | — | — | ✓ | 可变 | 117 个想法 Idea Novelty Checker (Shahid et al., 2025) | 评分 + RAG | — | — | ✓ | 1 | 167 个想法 InnoEval (Qiao et al., 2026) | 评分 | — | — | ✓ | 1 | 1217 个想法 SchNovel (Lin et al., 2025) | 排序 | ✓ | — | — | 1 | 15K 对 我们的(成对) | 分类 | ✓ | — | ✓ | 3 | 619 对 我们的(分组) | 分组 | — | ✓ | ✓ | 3 | 50 组 表1:与现有新颖性和相似性基准的比较。#维度表示新颖性重叠被独立判断的正交维度数量。这些维度包括任务、问题和方法,而不是相关性或清晰度等一般性评估标准。“可变”表示维度在不同实例间变化。 NovGauge通过提供在固定三维度分类下的每实例真实标签,解决了这些差距,使得能够系统性地诊断大语言模型新颖性判断在何处以及为何失败。 ## 3 基准构建 来源 | 规模 | 主要维度 | 成对 | 分组 --- | --- | --- | --- | --- ICLR 评审正样本 | 236 | 方法和问题 | ✓ | 综述共引正样本 | 227 | 任务 | ✓ | 综述跨组负样本 | 156 | 方法和任务 | ✓ | 多论文分组 | 综述共引集合 | 50 | 任务、问题、方法 | | ✓ 表2:最终基准组成。“主要维度”表示每个子集中的主要维度。 ### 3.1 设计原则 NovGauge通过三个核心设计原则解决了现有基准测试的局限性。 #### 原则1:按维度分解。 新颖性并非铁板一块。我们将其分解为三个正交维度,并独立评估每个维度。 - • **任务**:应用领域(例如,*图像分类* vs. *机器翻译*)。 - • **问题**:核心研究挑战(例如,*分布偏移* vs. *灾难性遗忘*)。 - • **方法**:技术途径(例如,*对比学习* vs. *有监督微调*)。 这遵循了研究贡献的*是什么*、*为什么*和*如何做*,并扩展了先前将研究问题和方法分开的分类体系(Luo et al., 2022;Shen et al., 2026)。我们将任务视为一个独立的轴,因为论文可能在问题或方法上共享,但针对不同的领域。其他贡献类型在这些维度内表示,而不是被视为单独的轴。图1展示了维度间的部分重叠。因此,每个实例都携带固定的每维度真实标签,使我们能够识别模型误判了哪个维度。 #### 原则2:专家来源标签。 每个标签都锚定在明确的专家证据上。正标签源自两个互补的来源:来自公开评审的ICLR审稿人重叠声明,以及经过三位标注者验证的综述共同引用分组。负样本通过跨组抽样构建,其中成对的论文取自综述作者在同一个句子中放入*不同*相似性分组的论文。 #### 原则3:基于证据的评估。 如果推理不可靠,正确的判断也是不充分的。因此,我们要求模型将每个肯定判断锚定在逐字的证据片段上,并通过第3.4节描述的三阶段级联流程评估输出。 ### 3.2 数据构建 NovGauge由两个互补的来源构建(表2)。
相似文章
基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测
本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。
GAUGE:在面向任务代理的用户模拟评估中不应信任LLM-as-a-Judge的时机
GAUGE是一个可重用的离线协议,用于衡量在评估面向任务代理时使用LLM-as-a-Judge的有效性,揭示了满足-成功差距,并提出了一种校准方法以提高准确性。
论LLM作为裁判在科学新颖性评估中的局限性
本文介绍了RQ-Bench,一个用于评估LLM判断科学研究问题新颖性的基准。研究发现,LLM裁判一致认为生成的问题比人类专家认为的更新颖,这引发了对使用LLM进行科学新颖性评估可靠性的担忧。
GENIE:一种用于衡量新颖性的细粒度指标
GENIE 是一种细粒度评估指标,用于衡量大语言模型在特定任务特征上的响应新颖性,相比整体性指标能提供更多洞察。
LongNovel:多尺度长上下文小说摘要幻觉检测基准测试
LongNovel 引入了一个多尺度基准测试,用于评估长上下文小说摘要中的幻觉,基于中英文小说构建,以改进LLM评估。