修辞如何奖励劫持AI审稿人?解析基于AI的同行评审中的修辞敏感性

Hugging Face Daily Papers 论文

摘要

本文研究了修辞框架如何导致基于AI的同行评审评分产生偏差,发现证据框架和新颖性立场的影响最大,且分数变动取决于审稿人的初始评分和评审严格程度。

随着大型语言模型越来越多地参与科学评估,我们研究了一种潜在的奖励劫持形式:在报告的科学内容保持不变的情况下,修辞选择如何影响AI审稿判断,以及这些影响如何随评审条件而变化。我们构建了一个受控语料库,包含4,200篇完整论文手稿,这些手稿源自120篇匿名化的ICLR 2026投稿。两个LLM重写器在相反方向上对六个修辞维度进行变换,五个LLM审稿人分别在标准和严格协议下评审生成的手稿。我们还测试了联合重写、递归重写和审稿人引导的重写。我们的结果表明,修辞敏感性是有结构的,而非均匀的。证据框架和新颖性立场在总体评估中产生最大的正负对比,范围框架构成较弱的第二梯队;其余维度的影响较小或不够稳定。这种层级在人工评估的质量水平上持续存在,但分数变动很大程度上取决于AI审稿人的原始分数:低分倾向于上升,高分倾向于下降,方向性对比在中间区间最为明显。更复杂的工作流并不能稳定带来更大的收益。联合重写强烈依赖于重写器,审稿人引导并不总是优于无引导的第二次重写,而重复重写会产生递减的、依赖配置的回报。在各种条件下,重写器主要决定对立变体之间的分离程度,而审稿人决定其分数影响的大小和方向。严格评审使平均OA分数降低1.36分,但并未持续改变修辞敏感性。这些发现指出了修辞呈现何时会影响AI科学评审,并推动构建对科学写作中保持内容不变的变异具有鲁棒性的评估系统。
查看原文
查看缓存全文

缓存时间: 2026/08/14 03:26

论文页面 - 修辞如何对AI审稿人进行奖励黑客攻击?剖析基于AI的同行评审中的修辞敏感性

Source: https://huggingface.co/papers/2608.08975

摘要

修辞框架以结构化方式显著影响AI科学评审分数,其效应受审稿人身份、分数区间和评审严格程度影响,而非重写复杂度。

随着大型语言模型越来越多地参与科学评估,我们研究一种潜在的奖励黑客形式(https://huggingface.co/papers?q=reward%20hacking):在保留所报告科学内容的前提下,修辞选择如何塑造AI评审判断,以及这些效应如何随评估条件变化而变化。我们构建了一个由120篇匿名ICLR 2026投稿衍生出的4,200篇完整论文手稿的受控语料库。两个LLM改写器在六个修辞维度(https://huggingface.co/papers?q=rhetorical%20dimensions)上沿相反方向进行改写,五个LLM审稿人(https://huggingface.co/papers?q=LLM%20reviewers)在标准和严格协议下评估生成的手稿。我们还测试了联合、递归和审稿人引导的改写(https://huggingface.co/papers?q=reviewer-guided%20rewriting)。我们的结果表明,修辞敏感性是结构化的而非均匀的。证据框架(https://huggingface.co/papers?q=Evidence%20framing)和新颖性立场(https://huggingface.co/papers?q=novelty%20stance)在总体评估中产生最大的正负对比,范围框架(https://huggingface.co/papers?q=scope%20framing)构成较弱的第二梯队;其余维度影响较小或较不稳定。这一层级在人工评估的质量水平上持续存在,但分数变动高度依赖于AI审稿人的原始分数:较低分数趋于上升,较高分数趋于下降,方向对比在中段区间最清晰。更复杂的工作流程并不一定带来更大的收益。联合改写(https://huggingface.co/papers?q=Joint%20rewriting)强烈依赖于改写器,审稿人引导并不一贯优于无引导的第二遍改写,重复改写产生递减且配置相关的回报。在不同条件下,改写器主要决定对立变体之间的分离度,而审稿人决定其分数效应的幅度和方向。严格评审将平均OA降低1.36分,但不会一致性改变修辞敏感性。这些发现揭示了修辞呈现何时影响AI科学评审,并促使评估系统对科学写作中保留内容的变体具有鲁棒性。

查看arXiv页面(https://arxiv.org/abs/2608.08975)查看PDF(https://arxiv.org/pdf/2608.08975)GitHub0(https://github.com/MingLiiii/Dissecting_AI_Reviews)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.08975)

在你的agent中获取这篇论文:

hf papers read 2608\.08975

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.08975即可从此页面链接。

引用该论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.08975即可从此页面链接。

引用该论文的Space0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.08975即可从此页面链接。

包含该论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面链接。

相似文章

对AI辅助同行评议的操纵给科学界带来新风险

arXiv cs.CL

一项新研究表明,AI辅助的同行评审易通过廉价手段被操控——仅需对论文摘要进行表面改写,即可显著提高AI生成的评审分数,并可能使人类编辑决策产生偏差,凸显了建立防护措施的必要性。

无需隐藏提示!仅通过呈现层面的修改即可操纵AI同行评审

arXiv cs.CL

本论文证明,仅通过修改呈现层面的内容(如摘要、框架和叙述)而不改变任何科学证据,就能操纵AI同行评审,攻击成功率达75.1%。作者提出了对抗性重构——一种闭环攻击方法,利用AI评审者倾向于被印象打动而非被说服的特点,并发布了一个用于测试鲁棒性的基准。