Review Arcade:论LLM评审的人类对齐与可游戏性
摘要
本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。
查看缓存全文
缓存时间: 2026/06/02 15:35
论文页面 - Review Arcade:论LLM评审的人类对齐性与可操控性
来源:https://huggingface.co/papers/2605.28897
随着论文投稿数量持续攀升(NeurIPS 26 超过40,000篇;ARR 26年5月超过17,000篇),自动化评审正变得越来越难以忽视。今年,NeurIPS、EMNLP 和 AAAI 正在测试自动化评审流程,而来自斯坦福大学和Mila的新论文声称已经提出了安全稳定的方案。
因此,我们能否信任它们的问题变得愈发重要。生成的评审真的与人类判断一致吗?这些评审是否“安全”?或者,它们能否被操纵,在不改变任何有意义内容的情况下人为抬高分数?
在我们的新论文“Review Arcade:论LLM评审的人类对齐性与可操控性”中,我们研究了1,000篇真实ACL 2025投稿及其对应的真实评分与评审,以测试LLM是否与它们对齐。
在实验中,我们发现了三个关键发现:
- 在五个模型家族中,我们仅发现与人类评价的有限一致性**,同时被录用与未被录用的论文之间也存在差异。**
- 即使存在一致性,结果在不同模型、提示词甚至同一评价的重复执行之间并不稳定**,这使可靠性大打折扣。**
- 我们找到了一种通过在10轮迭代过程中“操纵”模型的方法,能够提高LLM评审分数(最多约35%的投稿),而无需进行有意义的修改(见图)。**
因此,我们强烈建议不要仅依赖LLM生成的评审,并鼓励讨论这是否应成为应对海量投稿的解决方案。
linkedin_post_quadrat2 (https://cdn-uploads.huggingface.co/production/uploads/646128252815a070474bdeba/biDahK7uum2zY1oUifEkv.png)
完整详情:https://arxiv.org/pdf/2605.28897
相似文章
Review Arcade:论LLM评审的人类对齐性与可操控性
本文通过实验评估了LLM生成的科学论文评审与人工评审之间的对齐程度,发现对齐有限且变化较大。研究还表明,作者可以通过迭代修改论文来“操控”LLM评审以提高分数,多达35%的论文的总体分数出现了统计显著提升。
LLM-as-Judge的几何学:为何LLM间共识并非人类对齐
本文从几何角度分析了为何作为裁判的LLM彼此之间高度一致,但与人类仅弱相关,发现LLM间共识在主观评分标准上反映的是坍塌子空间,而非真正的人类对齐。基于人类数据的后验校准提高了对齐,但即使经过校准的LLM也未达到人类的可靠性。
用LLM评审员增强人工评估:你需要多少人工审核?
本文提出了一种两阶段抽样设计,其中LLM评估用于增强而非替代人工评分,并利用缺失数据文献中的双重稳健估计量,提供了确定人工和LLM评审样本量的指导。
从提示到行为对齐:用于推荐评估的个性化LLM评判器
本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。
在LLM个性化中重新以人类为中心
本文通过将真实人类重新引入评估循环,研究LLM个性化的有效性,揭示了在个性化管道的每个阶段人类判断与LLM输出之间的系统性差距,并强调了合成数据和LLM评判的局限性。