HalluPeer:一个基于分类体系的科学同行评审幻觉检测基准测试

arXiv cs.AI 论文

摘要

本文介绍了HalluPeer,这是一个基于分类体系的基准测试,用于检测科学同行评审中的幻觉,并提供了标注数据以评估和改进检测方法。

arXiv:2609.03580v1 公告类型:新 摘要:学术同行评审规模的不断扩大推动了使用大型语言模型(LLM)作为评审辅助工具,但LLM可能生成看似流畅却缺乏依据的观点,从而损害评审的可靠性。现有的幻觉基准测试并非为同行评审设计,因为同行评审的验证需要将观点锚定在长篇技术论文中。我们推出了HalluPeer,一个用于检测科学同行评审中幻觉的基准测试,提供了对齐的三元组:论文内容、人工撰写的评审以及注入了幻觉的评审,并为检测、分类和定位任务进行了标注。我们的流程建立了一个专门针对同行评审的幻觉分类体系,识别评审上下文,并通过自动化过滤注入幻觉。在12,000篇论文和38,000篇评审上的实验表明,现有的检测器难以将幻觉与合理的批评区分开来,而对真实评审的评估表明HalluPeer定义的幻觉模式确实存在于真实的同行评审中,凸显了来源感知验证的至关重要性。我们的项目主页可在以下网址找到:https://github.com/Lin-TzuLing/HalluPeer.git
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:08

# HalluPeer:基于分类法的科学同行评审幻觉检测基准
来源:https://arxiv.org/html/2609.03580
姚东庭 萧腾芳 陈伟志 帅宏翰††
††通讯作者。所属机构:国立阳明交通大学 邮箱:[[email protected]](mailto:[email protected])

###### 摘要
学术同行评审规模的扩大促使人们使用大型语言模型(LLM)作为评审助手,但LLM可能生成看似流畅却缺乏依据的论断,从而损害评审的可靠性。现有的幻觉检测基准并非针对同行评审设计,而在同行评审中,验证论断需要基于冗长的技术论文内容。我们提出了**HalluPeer**,一个用于检测科学同行评审中幻觉现象的基准,它提供了对齐的三元组:论文内容、人工撰写的评审以及注入幻觉的评审,并标注了用于检测、分类和定位的信息。我们的流程构建了一个同行评审特定的幻觉分类法,识别评审上下文,并通过自动化过滤注入幻觉。基于对12K篇论文和38K份评审的实验表明,现有的检测器难以区分幻觉与合理的批评,而对真实评审的评估则证明了HalluPeer定义的幻觉模式确实存在于真实同行评审中,突显了基于来源验证的关键需求。我们的项目主页可在 https://github.com/Lin-TzuLing/HalluPeer.git 找到。

## 1 引言
参考标题
图1:HalluPeer基准概览。该基准包含论文内容、原始人工撰写的评审和注入幻觉的评审三元组。每个三元组都附加了幻觉类型、注入指令和方面标签,以促进对同行评审中幻觉检测的系统性基准测试。

人工智能研究的快速增长给同行评审系统带来了越来越大的压力:ACL和EMNLP等主要NLP会议的投稿量从2020年的大约3.4K篇激增至2025年的超过8K篇,使得评审质量、一致性和及时性难以维持。为了应对这一压力,人工智能辅助同行评审成为一种有前景的解决方案。LLM越来越多地用于起草评论、构建批评性意见和简化综合评审(Ou et al., 2025;Yu et al., 2024)。从原型阶段发展,像AAAI 2026这样的会议已经尝试将LLM集成用于初步评审和委员会总结[1],旨在提高效率的同时保留人类监督。然而,人工智能辅助的评审引入了一个关键的可靠性问题:**论文评审中的幻觉**。尽管有精心的提示和系统保障,LLM仍可能生成看似流畅但缺乏支持的论断,例如,错误断言缺少基线、误报结果或捏造假设。这些事实错误超越了风格上的缺陷;它们会误导综合评审人并不公平地影响编辑决策。因此,检测这些幻觉对于可信的人工智能辅助评审工作流程至关重要。

然而,在问题已被广泛研究的领域,如问答、摘要和检索增强生成(RAG),检测这些幻觉更加困难(Liu et al., 2022;Manakul et al., 2023;Maynez et al., 2020;Li et al., 2023;Niu et al., 2024)。验证一份评审需要综合长篇技术章节(例如方法、表格、附录)中的证据,并且由于评审将事实与主观评价交织在一起,检测器必须验证基于论文的论断,同时排除评价性意见。这些要求也解释了为什么该问题仍未得到充分研究:现有的幻觉数据集很少提供该领域所需的标注结构——用于检查评审论断的、基于论文的证据,以及反映科学批评的细粒度幻觉类型。没有这些维度,评估无法揭示模型失败是因为无法检索到正确的证据、无法进行跨章节推理,还是无法识别特定的错误类型,如错误数字、捏造比较或不支持的归因。

因此,我们提出了**HalluPeer**,一个基于分类法的科学同行评审幻觉检测基准。我们将评审幻觉检测构建为一个基于论文的验证问题:如果一份评审中的论断不被提交的论文支持,或与论文内容不一致,则该论断是幻觉。这严格地将事实依据与语气和主观判断分离开来。如图1所示,HalluPeer包含对齐的三元组:*论文内容*、*人工撰写的评审*和*注入幻觉的评审*。构建过程遵循两个原则:覆盖科学性的失败模式,以及控制错误类型和上下文。为此,我们构建了一个同行评审特定的层次化幻觉分类法,将人工撰写的评审分割成句子,分配评审方面标签,并通过将分类法指令与方面兼容的上下文配对来构建幻觉模板。一个受约束的LLM编辑器随后引入幻觉并保持风格,之后进行自动化过滤。

基于HalluPeer,我们在三个任务上评估了现有的验证器:检测、分类和定位。结果表明,当前方法在处理科学评审时面临困难。通用验证器常常将不支持的论断与合理的批评混淆,而LLM判断器在需要技术依据的错误上表现不佳。对真实评审的分析表明,HalluPeer定义的幻觉模式确实出现在真实的同行评审中,并且仅在HalluPeer上训练的检测器能够恢复所有真实评审中专家标注的幻觉,而来源归因仍然是一个挑战。总体而言,这些结果表明,审计科学评审需要专门的、基于来源的验证,而非现成的真实性模型。我们的贡献总结如下:

- • 我们引入了HalluPeer,一个包含论文、人工评审和注入幻觉的评审的基准,并提供了用于检测、类型分类和定位的标注。
- • 我们提出了一种基于分类法、方面条件的构建流程,该流程归纳出同行评审特定的幻觉类型,识别兼容的评审上下文,并通过语义验证注入幻觉。
- • 我们系统地评估了幻觉检测、分类和定位,表明通用验证器在处理科学评审时举步维艰,而领域特定的微调显著提升了性能。额外的跨生成器、跨会议和真实评审评估表明了其在原始合成设置之外的鲁棒性,以及向自然发生的审稿人错误的迁移能力。

## 2 相关工作
### 2.1 LLM幻觉检测
幻觉检测旨在识别生成的、缺乏证据支持的陈述,该领域已在问答、摘要和检索增强生成中得到研究。一些方法在没有金标准参考的情况下运行,使用模型输出或跨采样响应的一致性(Liu et al., 2022;Manakul et al., 2023),而其他方法则根据明确的证据定义幻觉,例如源文档(Maynez et al., 2020;Cao et al., 2022;Bao et al., 2025)或检索到的段落(Sriramanan et al., 2024;Niu et al., 2024)。最近的基准测试增加了标签、跨度归因和类型级诊断(Mishra et al., 2024;Akbar et al., 2024;Bang et al., 2025)。然而,这些资源构建在通用领域文本或检索片段之上,并未捕捉科学同行评审的验证结构——在同行评审中,证据是一篇冗长的技术论文,而一个评审论断可能需要跨多个章节进行推理。HalluPeer通过与论文对齐的证据和评审特定的幻觉来解决这一空白。

### 2.2 LLM在自动化同行评审中的应用
不断增长的评审负担促使人们使用LLM进行评审草拟、结构化批评、综合评审辅助和评审质量评估(Russo et al., 2025;Thakkar et al., 2025;Zhuang et al., 2025;Du et al., 2024)。然而,事实依据仍然是一个挑战:LLM审稿人可能为不完整的稿件生成详细反馈(Ye et al., 2024),并生成不一致或缺乏论文支持的论断(Du et al., 2024;Ou et al., 2025)。这些发现确立了评审幻觉是科学同行评审中一个现实的风险。尽管如此,先前的工作缺乏一个专门的基准来系统地检测、分类和定位基于提交论文的幻觉评审论断。HalluPeer旨在填补这一空白。

## 3 评审幻觉的分类法
现有的幻觉分类法源自通用领域文本,并依赖于高层次的区分,例如,事实性与忠实性,或内在与外在幻觉(Ji et al. (2023);Li et al. (2024a))。这样的类别对于同行评审是不够的,因为不支持的论断通常涉及论文特定的数字或归因错误。如图2所示,我们将这些粗略类别细化为一个层次化的细粒度评审幻觉类型分类法,并提供了用于可控注入和评估的操作说明。第3.1节和3.2节描述了分类法结构和分解过程。

### 3.1 自上而下的分类法构建
我们的基准测试需要幻觉标签,这些标签对于数据构建是**可控的**,对于评估是**诊断性的**。为此,我们以自上而下的方式构建了一个层次化的树状分类法,其中粗略类别被递归地细化为细粒度的、特定于评审的错误类型。

**分类法结构**:我们将分类法表示为节点集 $\mathcal{V}$ 上的有根树。每个节点 $v \in \mathcal{V}$ 对应于一个幻觉概念,定义为 $v = \langle h_v, \delta_v, p_v, \mathcal{C}_v \rangle$,其中 $h_v$ 是幻觉概念的名称,$\delta_v$ 是操作描述,$p_v$ 是父节点,$\mathcal{C}_v = \{ u \in \mathcal{V} \mid p_u = v \}$ 是子节点集。沿着根到叶路径聚合支持不同粒度级别的分析。对于每个叶节点 $v \in \mathcal{V}_{\text{leaf}}$(其中 $\mathcal{C}_v = \emptyset$),描述 $\delta_v$ 给出了幻觉在评审文本中应如何出现的明确规范(例如,要更改、捏造或违反什么);这些叶节点规范既作为可控的注入指令,也作为细粒度的评估标签。

**使用粗略锚点初始化**:我们使用一组从先前幻觉分类工作(Akbar et al., 2024)改编而来的粗略语义锚点来初始化第一层:九个类别捕捉了常见的不支持生成形式,即:数字、实体、错误连接、归因失败、过度概括、推理错误、夸张、时态和基于上下文的含义错误[2]。这些锚点允许下游细化为特定于评审的表现形式。

### 3.2 LLM引导的递归分解
我们通过深度优先生成过程(算法1)将每个粗略锚点扩展为特定于评审的子类型。在每个递归步骤中,查询LLM提案者 $\mathcal{M}$ 以生成候选子节点。递归在两种条件下将节点指定为终端叶节点:达到预定义的最大深度,或LLM未产生进一步的有效细分(空扩展)。

**两个提案者函数**:提案者 $\mathcal{M}$ 通过两个函数使用。$\text{Expand}_{\mathcal{M}}$ 接受父概念及其描述,并返回子概念列表;$\text{Describe}_{\mathcal{M}}$ 接受子概念并生成该幻觉在评审文本中如何表现的操作定义。然后将每个子节点附加到其父节点,添加到全局节点集合中,分配其描述,并在下一个深度递归分解。

**可用子类别的约束**:为了保持分类法可用于细粒度标注和可控注入,我们通过提示(模板见附录J.1)强制执行几个约束。首先,生成的子节点应遵循相互独立且完全穷尽(MECE)的分离:兄弟类别应最小重叠,同时共同覆盖父概念的主要表现形式。其次,子节点应基于具体的同行评审场景(例如,关于基线或实验的论断),避免抽象的区分。第三,提案者保持兄弟类别在可比的粒度上,并在父节点在当前深度已经是原子级别时返回空列表。

### 3.3 集成与专家优化
依赖单一的LLM提案者会带来两个风险:生成式先验可能过度产生特异概念,独立分解的分支可能在整个层次结构中引入全局语义冗余。我们通过一个三阶段工作流程解决这两个问题(图3):(1)具有跨树一致性的多模型集成,(2)全局重叠识别,以及(3)人类专家验证。第一阶段首先保留具有跨模型共识的分类法节点,第二阶段对保留的节点执行成对重叠识别。

相似文章

PARALLAX: 区分真实幻觉检测与基准构建伪影

arXiv cs.CL

本文揭示了LLM幻觉检测领域报道的许多进展实际上源于基准构建伪影,其中真实答案被嵌入到提示中,使得简单的文本相似度基线方法能够获得近乎完美的分数。通过大规模受控评估,作者证明,在适当控制下,大多数方法的表现接近随机水平,除了对上层隐藏状态的监督探针(如SAPLMA)以及他们提出的DRIFT。

HalluWorld:基于参考世界模型的可控幻觉基准

arXiv cs.CL

HalluWorld 是一个可控基准框架,通过显式的参考世界模型在网格世界、国际象棋和实际终端任务等合成环境中评估大型语言模型中的幻觉。它可以细粒度分析各种故障模式,例如感知幻觉、多步状态追踪和因果模拟,揭示出前沿模型在处理扩展思维无法解决的复杂推理时仍然存在困难。