Review Arcade:论LLM评审的人类对齐与可游戏性

Hugging Face Daily Papers 论文

摘要

本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。

LLM生成的科学论文评审正获得广泛关注,甚至被一些大型会议正式试点。我们必须假设,不仅评审者在使用LLM辅助,作者也在提交前使用LLM修改论文。本研究基于2025年ACL滚动评审(ARR)的论文进行实验,从作者和评审者两个角度评估LLM评审。首先,我们发现LLM评审与人类评审的一致性有限。在最佳情况下,一致性尚可。然而,我们也发现LLM与人类的一致性随提示词和模型的不同而有显著变化。最后,我们研究了作者根据LLM评审采用迭代草稿-修订工作流改进投稿的场景。我们发现,这种对LLM评审的“操纵”在特定场景下是有效的,可导致高达35%的论文总体评分出现统计显著的提升。我们公布了代码:https://github.com/uhh-hcds/reviewarcade。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:35

论文页面 - Review Arcade:论LLM评审的人类对齐性与可操控性

来源:https://huggingface.co/papers/2605.28897

随着论文投稿数量持续攀升(NeurIPS 26 超过40,000篇;ARR 26年5月超过17,000篇),自动化评审正变得越来越难以忽视。今年,NeurIPSEMNLPAAAI 正在测试自动化评审流程,而来自斯坦福大学和Mila的新论文声称已经提出了安全稳定的方案。

因此,我们能否信任它们的问题变得愈发重要。生成的评审真的与人类判断一致吗?这些评审是否“安全”?或者,它们能否被操纵,在不改变任何有意义内容的情况下人为抬高分数?

在我们的新论文“Review Arcade:论LLM评审的人类对齐性与可操控性”中,我们研究了1,000篇真实ACL 2025投稿及其对应的真实评分与评审,以测试LLM是否与它们对齐。

在实验中,我们发现了三个关键发现:

  1. 在五个模型家族中,我们仅发现与人类评价的有限一致性**,同时被录用与未被录用的论文之间也存在差异。**
  2. 即使存在一致性,结果在不同模型、提示词甚至同一评价的重复执行之间并不稳定**,这使可靠性大打折扣。**
  3. 我们找到了一种通过在10轮迭代过程中“操纵”模型的方法,能够提高LLM评审分数(最多约35%的投稿),而无需进行有意义的修改(见图)。**

因此,我们强烈建议不要仅依赖LLM生成的评审,并鼓励讨论这是否应成为应对海量投稿的解决方案。

linkedin_post_quadrat2 (https://cdn-uploads.huggingface.co/production/uploads/646128252815a070474bdeba/biDahK7uum2zY1oUifEkv.png)

完整详情:https://arxiv.org/pdf/2605.28897

相似文章

Review Arcade:论LLM评审的人类对齐性与可操控性

arXiv cs.AI

本文通过实验评估了LLM生成的科学论文评审与人工评审之间的对齐程度,发现对齐有限且变化较大。研究还表明,作者可以通过迭代修改论文来“操控”LLM评审以提高分数,多达35%的论文的总体分数出现了统计显著提升。

LLM-as-Judge的几何学:为何LLM间共识并非人类对齐

arXiv cs.CL

本文从几何角度分析了为何作为裁判的LLM彼此之间高度一致,但与人类仅弱相关,发现LLM间共识在主观评分标准上反映的是坍塌子空间,而非真正的人类对齐。基于人类数据的后验校准提高了对齐,但即使经过校准的LLM也未达到人类的可靠性。

从提示到行为对齐:用于推荐评估的个性化LLM评判器

arXiv cs.AI

本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。

在LLM个性化中重新以人类为中心

Hugging Face Daily Papers

本文通过将真实人类重新引入评估循环,研究LLM个性化的有效性,揭示了在个性化管道的每个阶段人类判断与LLM输出之间的系统性差距,并强调了合成数据和LLM评判的局限性。