当AI评审训练AI评审者:科学判断崩溃与缓解
摘要
本研究探讨了AI生成的评审影响未来AI评审者训练的反馈循环,导致判断多样性降低,这种现象称为'科学判断崩溃'。同时介绍了TrustReviewer,这是一个开源系统,通过精选训练和激活引导来缓解这一问题。
查看缓存全文
缓存时间: 2026/09/21 03:20
论文页面 - 当AI评审训练AI评审员:科学判断坍缩与缓解方法
来源:https://huggingface.co/papers/2609.20942
摘要
大型语言模型(LLMs)越来越多地参与科学评估工作,既作为自动化评审员,也作为人类评审员的助手。随着模型生成的评审意见进入公共数据集和未来的训练语料库,AI同行评审可能变得具有递归性:后续评审员会学习早期模型产生的判断。我们在受控环境中研究了这种反馈循环的一个环节。从Llama 3.1 8B模型出发,我们首先在2018-2023年的ICLR官方评审数据上对评审员进行微调,然后使用系统性变化的官方评审与模型生成评审的混合数据集,在ICLR 2024数据上训练我们的后续模型。研究表明,引入合成评审会压缩评分分布,并降低同一篇论文及整个语料库层面的语义多样性。我们将这种模式称为“科学判断坍缩”。为了缓解这种失效模式,我们提出了TrustReviewer——一个基于开源LLM的系统,用于生成AI和机器学习论文的同行评审。TrustReviewer在两个互补阶段进行干预:在训练阶段的预防方面,我们在精心设计的语料库上对核心评审员进行单阶段训练,旨在减少低质量且语义退化的监督信号;在测试阶段的校正方面,配对激活引导旨在进一步缓解残余的判断坍缩倾向,无需进一步训练或额外专家标注。这些结果共同揭示了递归评审员训练的具体风险,并为保持判断多样性、提升AI辅助科学评估中的建议一致性提供了实用干预方案。
查看 arXiv 页面 (https://arxiv.org/abs/2609.20942) 查看 PDF (https://arxiv.org/pdf/2609.20942) 项目页面 (https://hosytuyen.github.io/projects/TrustReviewer/) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.20942)
通过代理获取论文:
hf papers read 2609.20942
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型
0
暂无模型关联本论文
在模型 README.md 中引用 arxiv.org/abs/2609.20942 以从本页面关联。
引用本论文的数据集
0
暂无数据集关联本论文
在数据集 README.md 中引用 arxiv.org/abs/2609.20942 以从本页面关联。
引用本论文的 Spaces
0
暂无 Space 关联本论文
在 Space README.md 中引用 arxiv.org/abs/2609.20942 以从本页面关联。
包含本论文的收藏集
0
暂无收藏集包含本论文
将本论文添加至收藏集 (https://huggingface.co/new-collection) 以从本页面关联。
相似文章
对AI辅助同行评议的操纵给科学界带来新风险
一项新研究表明,AI辅助的同行评审易通过廉价手段被操控——仅需对论文摘要进行表面改写,即可显著提高AI生成的评审分数,并可能使人类编辑决策产生偏差,凸显了建立防护措施的必要性。
关于AI评审员的局限与机遇:联合45位专家科学家评审Nature系列期刊论文的评审意见
一项研究评估了AI评审员(GPT-5.2、Claude Opus 4.5、Gemini 3.0 Pro)与45位人类专家评审员对Nature系列期刊论文的评审表现,发现AI评审员在综合评审质量上可以超越评分最高的人类评审员,尽管其准确性略低,但能提出更多重要问题。
AI编写的评论帮助人类发现缺陷
# AI编写的评论帮助人类发现缺陷 来源:[https://openai.com/index/critiques/](https://openai.com/index/critiques/) 我们希望确保未来执行极困难任务的AI系统始终与人类意图保持一致。[Many](https://openai.com/index/learning-to-summarize-with-human-feedback/)[previous\(opens in a new window\)](https://arxiv.org/abs/2204.05862)[works\(opens in a new window\)](https://www.deepmind.com/publications/gophercite-teaching-language-models-to-suppo
信任-监督悖论:随着AI变得更好,人类可能不再真正监督它
一篇思想文章,指出随着AI变得更准确,人类监督可能会退化为例行批准,从而产生'信任-监督悖论',即高性能AI仍可能因不完整的表征、过时数据或自动化偏见而失败,建议从人工审查转向治理边界。
NeurIPS 2026 AI生成的评审 [D]
关于在NeurIPS 2026中使用AI生成的评审的讨论,包括对提示注入的担忧,以及评审者在没有适当监督的情况下使用LLM却没有后果的问题。