当AI评审训练AI评审者:科学判断崩溃与缓解

Hugging Face Daily Papers 论文

摘要

本研究探讨了AI生成的评审影响未来AI评审者训练的反馈循环,导致判断多样性降低,这种现象称为'科学判断崩溃'。同时介绍了TrustReviewer,这是一个开源系统,通过精选训练和激活引导来缓解这一问题。

大型语言模型(LLMs)越来越多地参与科学评估,既作为自动化评审者,也作为人类评审者的助手。随着模型生成的评审进入公共数据和未来的训练语料库,AI同行评审可能变得递归:后续的评审者从早期模型产生的判断中学习。我们在受控环境中研究了这一反馈循环的一步。从Llama 3.1 8B开始,我们首先在2018年至2023年的官方ICLR评审上微调一个评审者,然后在ICLR 2024数据上训练四个后续模型,使用系统变化的官方和模型生成评审的混合。我们的研究表明,引入合成评审压缩了评分分布,并降低了同一篇论文和语料库级别的语义多样性。我们将这种模式称为科学判断崩溃。 为了缓解这种失败模式,我们引入了TrustReviewer,这是一个基于LLM的开源系统,用于生成AI和机器学习论文的同行评审。TrustReviewer在两个互补阶段进行干预。对于训练时预防,我们在一个精选的语料库上单阶段训练核心评审者,旨在减少低质量和语义退化的监督。对于测试时校正,配对激活引导旨在进一步缓解崩溃判断的残余趋势,无需进一步训练或额外的专家注释。总的来说,这些结果刻画了递归评审者训练的具体风险,并提供了在AI辅助科学评估中保持判断多样性并改善推荐对齐的实用干预措施。
查看原文
查看缓存全文

缓存时间: 2026/09/21 03:20

论文页面 - 当AI评审训练AI评审员:科学判断坍缩与缓解方法

来源:https://huggingface.co/papers/2609.20942

摘要

大型语言模型(LLMs)越来越多地参与科学评估工作,既作为自动化评审员,也作为人类评审员的助手。随着模型生成的评审意见进入公共数据集和未来的训练语料库,AI同行评审可能变得具有递归性:后续评审员会学习早期模型产生的判断。我们在受控环境中研究了这种反馈循环的一个环节。从Llama 3.1 8B模型出发,我们首先在2018-2023年的ICLR官方评审数据上对评审员进行微调,然后使用系统性变化的官方评审与模型生成评审的混合数据集,在ICLR 2024数据上训练我们的后续模型。研究表明,引入合成评审会压缩评分分布,并降低同一篇论文及整个语料库层面的语义多样性。我们将这种模式称为“科学判断坍缩”。为了缓解这种失效模式,我们提出了TrustReviewer——一个基于开源LLM的系统,用于生成AI和机器学习论文的同行评审。TrustReviewer在两个互补阶段进行干预:在训练阶段的预防方面,我们在精心设计的语料库上对核心评审员进行单阶段训练,旨在减少低质量且语义退化的监督信号;在测试阶段的校正方面,配对激活引导旨在进一步缓解残余的判断坍缩倾向,无需进一步训练或额外专家标注。这些结果共同揭示了递归评审员训练的具体风险,并为保持判断多样性、提升AI辅助科学评估中的建议一致性提供了实用干预方案。

查看 arXiv 页面 (https://arxiv.org/abs/2609.20942) 查看 PDF (https://arxiv.org/pdf/2609.20942) 项目页面 (https://hosytuyen.github.io/projects/TrustReviewer/) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.20942)

通过代理获取论文:

hf papers read 2609.20942

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型

0

暂无模型关联本论文

在模型 README.md 中引用 arxiv.org/abs/2609.20942 以从本页面关联。

引用本论文的数据集

0

暂无数据集关联本论文

在数据集 README.md 中引用 arxiv.org/abs/2609.20942 以从本页面关联。

引用本论文的 Spaces

0

暂无 Space 关联本论文

在 Space README.md 中引用 arxiv.org/abs/2609.20942 以从本页面关联。

包含本论文的收藏集

0

暂无收藏集包含本论文

将本论文添加至收藏集 (https://huggingface.co/new-collection) 以从本页面关联。

相似文章

对AI辅助同行评议的操纵给科学界带来新风险

arXiv cs.CL

一项新研究表明,AI辅助的同行评审易通过廉价手段被操控——仅需对论文摘要进行表面改写,即可显著提高AI生成的评审分数,并可能使人类编辑决策产生偏差,凸显了建立防护措施的必要性。

AI编写的评论帮助人类发现缺陷

OpenAI Blog

# AI编写的评论帮助人类发现缺陷 来源:[https://openai.com/index/critiques/](https://openai.com/index/critiques/) 我们希望确保未来执行极困难任务的AI系统始终与人类意图保持一致。[Many⁠](https://openai.com/index/learning-to-summarize-with-human-feedback/)[previous⁠\(opens in a new window\)](https://arxiv.org/abs/2204.05862)[works⁠\(opens in a new window\)](https://www.deepmind.com/publications/gophercite-teaching-language-models-to-suppo

NeurIPS 2026 AI生成的评审 [D]

Reddit r/MachineLearning

关于在NeurIPS 2026中使用AI生成的评审的讨论,包括对提示注入的担忧,以及评审者在没有适当监督的情况下使用LLM却没有后果的问题。