TADDLE: 一种用于检测有缺陷的LLM生成同行评审的工具增强代理

arXiv cs.AI 论文

摘要

介绍了TADDLE,一种用于检测有缺陷的LLM生成同行评审的工具增强代理,以及一个包含50篇ICLR 2025论文的1800条评审的专家标注基准。该系统将检测分解为四个专门的分析工具,并使用两阶段半监督学习进行二元和多标签分类。

arXiv:2605.26911v1 公告类型: 新 摘要: LLM生成的同行评审在主要会议中越来越常见,但由于其语言流畅、结构完整,其缺陷难以检测。现有工作要么分类作者身份而不判断质量,要么使用针对人类撰写评审设计的特征来评分质量;没有先前系统能在个体缺陷类型层面检测LLM生成评论的缺陷。为填补这一空白,我们提出了TADDLE,一种用于检测有缺陷的LLM生成同行评审的工具增强代理,以及首个针对此任务的专家标注基准。我们的基准包含50篇ICLR 2025论文的1800条评审,由18位领域专家根据六种缺陷类别(加上一个非缺陷标签)的分类法进行多标签标注。TADDLE将检测分解为四个专门的分析工具——Verify、Correct、Complete和Transform——由一个代理协调;一个集成器通过两阶段半监督学习将其输出综合为二元和多标签分类。大量实验表明,TADDLE在二元检测和多标签分类任务上均表现强劲。我们在https://github.com/AquariusAQ/TADDLE 发布基准和代码。
查看原文
查看缓存全文

缓存时间: 2026/05/27 09:09

# TADDLE: 用于检测有缺陷的LLM生成同行评审的工具增强代理

来源:https://arxiv.org/html/2605.26911

韩琦段1, 翔李1,\*  
1华东师范大学,通讯作者:xiangli@dase\.ecnu\.edu\.cn (https://arxiv.org/html/2605.26911v1/mailto:[email protected])\(翔李\*\)

###### 摘要

LLM生成的同行评审在主要学术会议上越来越普遍,但由于它们普遍流畅且结构良好,其缺陷很难被检测。现有工作要么仅分类作者身份而不判断质量,要么使用为人类撰写的评审设计的特征来评分质量;此前没有系统能在单个缺陷类型层面检测LLM生成评审中的缺陷。为填补这一空白,我们提出了 TADDLE,一种用于检测有缺陷的LLM生成同行评审的工具增强代理,并提供了首个针对该任务的专家标注基准。我们的基准包含在50篇ICLR 2025论文上的1,800篇评审,由18位领域专家根据包含六个缺陷类别(加上一个非缺陷标签)的分类体系进行多标签标注。TADDLE 将检测分解为四个专门的分析工具——验证、纠正、补全和转换——由一个代理协调;一个集成器通过两阶段半监督学习将其输出综合为二分类和多标签分类。大量实验表明,TADDLE 在二分类检测和多标签分类任务上均表现强劲。我们将基准和代码发布在 https://github.com/AquariusAQ/TADDLE。

## 1 引言

同行评审是科学交流的核心。LLM 的近期普及改变了评审的撰写方式:ICLR 2026、ICML 2026 和 ACL Rolling Review 现在允许评审者声明使用 AI 辅助,且领域主席越来越多地遇到从表面上看与细心的人类专家难以区分的评审。然而,质量并不统一。人们普遍担忧,一些 LLM 生成的评审虽然流畅,但包含幻觉的实验细节、对已在附录中回答的问题进行表面批评,或在高度学术期望的伪装下应用双重标准(Liet al. (2025) (https://arxiv.org/html/2605.26911#bib.bib5); Linet al. (2025) (https://arxiv.org/html/2605.26911#bib.bib9))。关键挑战在于,LLM 生成评审的失败模式看起来与粗心的人类评审者不同。一个未阅读论文的人类评审者通常会写出短小、含糊或明显泛泛的文本;而一个误读论文的 LLM 会生成篇幅长、结构良好且自信地基于虚构细节的文本。具体而言,一篇 LLM 评审可能声称“论文未扩展到多类分类”,而附录专门用一节讨论了这个主题。此类缺陷留下证据,但证据存在于评审与论文之间的关系:评审仅相对于论文实际内容包含一个“信息错误”。

关于该主题的现有工作可分为两条线。一方面,*LLM 生成文本检测*(Zhouet al. (2026) (https://arxiv.org/html/2605.26911#bib.bib7); Kumaret al. (2024) (https://arxiv.org/html/2605.26911#bib.bib8); Yuet al. (2024) (https://arxiv.org/html/2605.26911#bib.bib11); Kumaret al. (2025) (https://arxiv.org/html/2605.26911#bib.bib10))回答一个二元作者身份问题:文本是否由模型生成?这与质量正交。一旦会议允许 AI 辅助,知道一篇评审是 LLM 生成的并不能告诉领域主席它是否应该被信任。另一方面,针对人类撰写评审的*评审质量评估*(Sizoet al. (2025) (https://arxiv.org/html/2605.26911#bib.bib1); Arouset al. (2021) (https://arxiv.org/html/2605.26911#bib.bib3); Ryuet al. (2025) (https://arxiv.org/html/2605.26911#bib.bib6); Zhanget al. (2025) (https://arxiv.org/html/2605.26911#bib.bib14); Ebrahimiet al. (2025) (https://arxiv.org/html/2605.26911#bib.bib19))依赖于为粗心和有能力的评审看起来明显不同的场景设计的表面特征(例如,长度、引用计数、情感极性、语义对齐)。LLM 生成的评审在这些特征上普遍精良,因此信号基本消失。这些方法都无法转移到本文目标的新场景。

为了检测 LLM 生成评审中的缺陷,我们主张检测应该根据每种缺陷留下的证据类型进行分解。我们将这一观点实例化为 TADDLE,一种用于检测有缺陷的 LLM 生成同行评审的工具增强代理,其中编排器将评审分解为证据片段,通过四个专门的分析工具路由,并将收集的轨迹传递给微调的集成模块,该模块将其综合为最终分类。这四个工具在提示、可能访问的论文内容范围以及是否允许查询外部文献方面有所不同:验证工具对评审的主张进行事实核查;纠正工具按类型对检测到的错误进行分类;补全工具检查每个批评是否伴有可操作的修订方向;转换工具标记主观偏见和敌对语气。为了训练集成模块,我们构建了一个基于来自 ICLR/ICML/NeurIPS 2025 论文的高分歧 LLM 生成评审的基准,由一个专家多标签标注的金集和一个高置信度伪标签集组成。总而言之,本文的主要贡献包括:

- • 我们引入了首个用于细粒度缺陷 LLM 评审检测的多标签、专家标注基准。
- • 我们开发了 TADDLE,一种工具增强的基于代理的检测器,将评审审计分解为四个专门的分析工具和一个微调的集成器。
- • 我们在多个评估设置下进行了广泛实验,TADDLE 在这些设置上持续取得最佳性能。

## 2 相关工作

##### LLM 生成文本检测。一系列工作通过统计 Token 分布测试、生成时水印和微调分类器定位作者身份(Zhouet al. (2026) (https://arxiv.org/html/2605.26911#bib.bib7); Kumaret al. (2024) (https://arxiv.org/html/2605.26911#bib.bib8); Yuet al. (2024) (https://arxiv.org/html/2605.26911#bib.bib11); Kumaret al. (2025) (https://arxiv.org/html/2605.26911#bib.bib10))。这些方法实现了强大的作者身份检测,但回答了一个与我们的问题正交的问题:一篇 LLM 评审可能完全准确或完全幻觉,但在风格上无法区分。随着会议允许 AI 辅助,瓶颈从*作者身份*转向*正确性*。

##### 人类撰写的同行评审质量评估。人类同行评审的质量标准已沿着准确性、建设性、公平性和全面性等维度定义(Sizoet al. (2025) (https://arxiv.org/html/2605.26911#bib.bib1))。现有方法将专家评分量表与基于规则的启发式方法和基于表面特征的监督模型相结合——评审长度、引用计数、礼貌程度、情感极性、与论文的语义对齐(Arouset al. (2021) (https://arxiv.org/html/2605.26911#bib.bib3); Ryuet al. (2025) (https://arxiv.org/html/2605.26911#bib.bib6); Lanier (2021) (https://arxiv.org/html/2605.26911#bib.bib4); Liet al. (2025) (https://arxiv.org/html/2605.26911#bib.bib5))。这些特征对于人类撰写的评审是可靠的区分器,因为粗心的和有能力的评审者在这些维度上不同。然而,它们对 LLM 生成的评审信息量要小得多,因为 LLM 生成的评审无论质量如何都普遍流畅且结构规整。

##### 代理系统与 LLM 作为评判者。使用工具和结构化推理增强的 LLM 代理已应用于多跳问答、代码生成和科学写作(Yaoet al. (2022) (https://arxiv.org/html/2605.26911#bib.bib12); Tranet al. (2025) (https://arxiv.org/html/2605.26911#bib.bib13))。在同行评审中,代理系统已被用于生成评审(Jinet al. (2024) (https://arxiv.org/html/2605.26911#bib.bib15); Gaoet al. (2025) (https://arxiv.org/html/2605.26911#bib.bib16))或协助文献综述(Goet al. (2026) (https://arxiv.org/html/2605.26911#bib.bib17))。审计评审的补充问题受到的关注较少。密切相关的有 ReviewGuard(Zhanget al. (2025) (https://arxiv.org/html/2605.26911#bib.bib14)),它使用 GPT-4.1 标注冲突的 OpenReview 评审并端到端微调开源 LLM,以及 RottenReviews(Ebrahimiet al. (2025) (https://arxiv.org/html/2605.26911#bib.bib19)),它在可量化特征上回归质量。这两个系统都是为人类撰写或混合作者身份的评审语料库开发和评估的;它们的特征空间和训练分布反映了人类评审者的失败模式(简短、明显粗心、极端情感),这些在性质上与 LLM 生成的评审不同。

## 3 任务与缺陷分类体系

##### 符号表示。设 P 表示一篇论文,r 为 P 的同行评审。我们定义标签空间 L = {c0} ∪ C,其中 c0 是“非缺陷”标签,C = {c1, ..., c6} 是六个缺陷类别,详见附录 E (https://arxiv.org/html/2605.26911#A5)。每个评审关联一个二元缺陷标签 z ∈ {0,1} 和一个在 L 上的多标签向量 y ∈ {0,1}^7,其中 z=1 ⇔ ∃ i>0: yi=1 且 z=0 ⇔ y0=1。由于 c0 由 z 完全确定,多标签预测任务简化为选择六个缺陷类别 C 的一个子集;我们在本文中将其称为多标签任务。检测器 f: (r, P) ↦ (ẑ, ŷ, q, O) 联合产生二元标签、多标签缺陷向量、五分制质量评分 q 和包含每个缺陷解释及修订建议的自由形式输出 O。

##### 分类体系推导。我们将 Duet al. (2024) (https://arxiv.org/html/2605.26911#bib.bib18) 的 23 种缺陷类型目录精炼为六个类别。我们使用三种操作:(i) 合并高度重叠的类型(例如,实验评估错误、幻觉和自我矛盾都合并为信息错误;范围外建议和不专业陈述合并为不专业与敌意);(ii) 移除可通过简单规则工具检测的形式问题(格式错误、拼写、缺失分数),这些问题不是本工作的重点;(iii) 移除在 LLM 生成的评审中罕见出现的类别(例如,重复陈述)。最后,我们推导出六个在编辑上可操作且频率足够允许监督建模的类别;完整细节见附录 E (https://arxiv.org/html/2605.26911#A5)。

## 4 基准构建

### 4.1 论文选择与解析

我们从 ICLR、ICML 和 NeurIPS 2025 的公开 OpenReview 记录中采样论文。为确保有意义的检测信号,我们限制关注评审者分歧高的论文——即 ICLR 中最高和最低评审分数相差至少 3 分,ICML/NeurIPS 中至少相差 2 分,反映每个会议使用的评分量表。高分歧论文被刻意优先选择,因为它们呈现真正的挑战。正是在这些条件下,LLM 生成的评审最有可能引入事实错误或有偏见的裁决,使检测任务具有现实性而非琐碎。每篇论文通过 PaddleOCR-VL(Cuiet al. (2025) (https://arxiv.org/html/2605.26911#bib.bib35))从 PDF 解析为 Markdown 加图像文件。每个图像用 Qwen3-VL-4B-Instruct 描述为 ≤200 个 Token;每个附录小节用 Qwen3-30B-A3B-Thinking-2507 总结为 ≤500 个 Token。每篇论文因此由四个文本组件表示——主文本、参考文献、附录总结、图像描述——这些构成了检测时分析工具可用的输入。

### 4.2 人物角色条件化评审生成

我们使用六个 LLM 作为评审生成器:DeepSeek V3.2(DeepSeek-AI (2025) (https://arxiv.org/html/2605.26911#bib.bib23))、GLM 4.7(Teamet al. (2025) (https://arxiv.org/html/2605.26911#bib.bib26))、Kimi K2.5(Teamet al. (2026) (https://arxiv.org/html/2605.26911#bib.bib32))、Qwen3-30B(Team (2025) (https://arxiv.org/html/2605.26911#bib.bib25))、Llama 3.3-70B(Grattafioriet al. (2024) (https://arxiv.org/html/2605.26911#bib.bib33))和 MiniMax-M2.5(MiniMax (2026) (https://arxiv.org/html/2605.26911#bib.bib34))。对于每篇论文,实例化九个评审者角色:三个有能力的角色(准确且信息忠实;有建设性;专业且公正)和六个有缺陷的角色,每个缺陷类型一个。每个角色是一个系统提示规范,用于调节模型的评审行为;有缺陷的角色注入行为(例如,“*你倾向于误读图形趋势并颠倒变量之间的关系*”),但绝不允许模型揭示其自身的缺陷类别。模型生成结构完整的评审,包括摘要、优点、弱点、问题和每轴分数;完整提示见附录 H (https://arxiv.org/html/2605.26911#A8)。

##### 角色的作用。角色有两个目的。首先,它确保类别覆盖:没有角色条件化,缺陷在六个类别上的分布将不受控制且严重倾斜,使罕见类别(例如,偏见导向、无根据主张)几乎没有训练支持。每个缺陷类型一个角色确保每个类别有足够的正例来支持每类别建模和 Macro-F1 评估。其次,每个生成的评审携带一个隐式的单标签弱标签(所使用的角色),我们在伪标签过滤期间利用它(§5.4 (https://arxiv.org/html/2605.26911#S5.SS4))。关键的是,角色并不作为黄金标签使用:人类标注者对金集中的每个评审基于评审文本进行标注,并可能根据产生它的角色为任何评审标注零个、一个或多个缺陷类别。这种设计允许两种结果:如果 LLM 抵抗了角色注入,有缺陷角色的评审可能被标注为“非缺陷”;有能力的角色的评审可能包含缺陷并被专家标注为缺陷标签。

### 4.3 专家多标签标注

我们随机采样了 50 篇 ICLR 2025 论文并获得了它们的黄金标准标注,覆盖了由 DeepSeek V3.2、GLM 4.7、Kimi K2.5 和 Qwen3-30B 生成的共计 50×4×9=1,800 篇评审。十八位领域专家——均具有顶级 ML 会议的同行评审经验——各自对五分制质量评分进行标注(附录 E (https://arxiv.org/html/2605.26911#A5))。对于任何评分低于 4 的评审,标注者针对六类别分类体系对其进行多标签标注。在评估事实主张时,他们查阅原始论文 PDF。完整标注期间使用的最终指南在附录 E (https://arxiv.org/html/2605.26911#A5) 中逐字复述。

##### 划分。50 篇论文被分为 40 篇训练论文和 10 篇测试论文。总共,我们有 1,800 篇标注过的评审(50×4×9)。训练分割

相似文章

Review Arcade:论LLM评审的人类对齐与可游戏性

Hugging Face Daily Papers

本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。

DART:通过蒸馏-审计-修复训练缓解差异感知大语言模型中的有害漂移

arXiv cs.CL

# 通过蒸馏-审计-修复训练缓解差异感知大语言模型中的有害漂移 来源:[https://arxiv.org/html/2604.16845](https://arxiv.org/html/2604.16845) Ziwen Pan1 Zihan Liang111footnotemark:1 Jad Kabbara2 Ali Emami1 1埃默里大学 2麻省理工学院 {ziwen\.pan, zihan\.liang, ali\.emami}@emory\.edu, jkabbara@mit\.edu ###### 摘要 经过安全调优的大语言模型(LLM)通常会回避承认人口统计差异,即使这种承认在事实上是正确的(例如,基于血统的

通过溯源分析防范LLM代理失对齐

arXiv cs.CL

本文提出了一种基于溯源的框架和多阶段流水线\tool,用于在LLM代理执行工具调用前检测失对齐,与基于LLM作为裁判的基线相比,显著降低了错误率。

鲁棒批评者:防御LLMs免受多轮攻击

arXiv cs.AI

本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。