修辞如何奖励劫持AI审稿人?解析基于AI的同行评审中的修辞敏感性
摘要
本文研究了修辞框架如何导致基于AI的同行评审评分产生偏差,发现证据框架和新颖性立场的影响最大,且分数变动取决于审稿人的初始评分和评审严格程度。
查看缓存全文
缓存时间: 2026/08/14 03:26
论文页面 - 修辞如何对AI审稿人进行奖励黑客攻击?剖析基于AI的同行评审中的修辞敏感性
Source: https://huggingface.co/papers/2608.08975
摘要
修辞框架以结构化方式显著影响AI科学评审分数,其效应受审稿人身份、分数区间和评审严格程度影响,而非重写复杂度。
随着大型语言模型越来越多地参与科学评估,我们研究一种潜在的奖励黑客形式(https://huggingface.co/papers?q=reward%20hacking):在保留所报告科学内容的前提下,修辞选择如何塑造AI评审判断,以及这些效应如何随评估条件变化而变化。我们构建了一个由120篇匿名ICLR 2026投稿衍生出的4,200篇完整论文手稿的受控语料库。两个LLM改写器在六个修辞维度(https://huggingface.co/papers?q=rhetorical%20dimensions)上沿相反方向进行改写,五个LLM审稿人(https://huggingface.co/papers?q=LLM%20reviewers)在标准和严格协议下评估生成的手稿。我们还测试了联合、递归和审稿人引导的改写(https://huggingface.co/papers?q=reviewer-guided%20rewriting)。我们的结果表明,修辞敏感性是结构化的而非均匀的。证据框架(https://huggingface.co/papers?q=Evidence%20framing)和新颖性立场(https://huggingface.co/papers?q=novelty%20stance)在总体评估中产生最大的正负对比,范围框架(https://huggingface.co/papers?q=scope%20framing)构成较弱的第二梯队;其余维度影响较小或较不稳定。这一层级在人工评估的质量水平上持续存在,但分数变动高度依赖于AI审稿人的原始分数:较低分数趋于上升,较高分数趋于下降,方向对比在中段区间最清晰。更复杂的工作流程并不一定带来更大的收益。联合改写(https://huggingface.co/papers?q=Joint%20rewriting)强烈依赖于改写器,审稿人引导并不一贯优于无引导的第二遍改写,重复改写产生递减且配置相关的回报。在不同条件下,改写器主要决定对立变体之间的分离度,而审稿人决定其分数效应的幅度和方向。严格评审将平均OA降低1.36分,但不会一致性改变修辞敏感性。这些发现揭示了修辞呈现何时影响AI科学评审,并促使评估系统对科学写作中保留内容的变体具有鲁棒性。
查看arXiv页面(https://arxiv.org/abs/2608.08975)查看PDF(https://arxiv.org/pdf/2608.08975)GitHub0(https://github.com/MingLiiii/Dissecting_AI_Reviews)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.08975)
在你的agent中获取这篇论文:
hf papers read 2608\.08975
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.08975即可从此页面链接。
引用该论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.08975即可从此页面链接。
引用该论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.08975即可从此页面链接。
包含该论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
对AI辅助同行评议的操纵给科学界带来新风险
一项新研究表明,AI辅助的同行评审易通过廉价手段被操控——仅需对论文摘要进行表面改写,即可显著提高AI生成的评审分数,并可能使人类编辑决策产生偏差,凸显了建立防护措施的必要性。
无需隐藏提示!仅通过呈现层面的修改即可操纵AI同行评审
本论文证明,仅通过修改呈现层面的内容(如摘要、框架和叙述)而不改变任何科学证据,就能操纵AI同行评审,攻击成功率达75.1%。作者提出了对抗性重构——一种闭环攻击方法,利用AI评审者倾向于被印象打动而非被说服的特点,并发布了一个用于测试鲁棒性的基准。
量化评分标准修改对人类与自动评分者一致性影响的统计分析
本研究分析了评分标准(rubrics)的修改(例如从整体性标准转变为分析性标准)如何影响人类评分者与 AI 自动评分者之间的一致性。研究结果表明,提供示例和减少偏见有助于提高一致性,而更高的复杂性往往会降低一致性。
AI审稿人能看清全貌吗?多模态同行评审的攻击与防御
本文介绍了PaperGuard,这是一个用于评估和防御多模态AI同行评审系统对抗性攻击的基准,涵盖多个科学领域的文本和图像攻击。
清晰的直觉还是真正的分析?在LLM作为评审人的同行评审中基准测试认知可靠性
本文介绍了Kahneman4Review基准,包含3,563条同行评审,这些评审按照九个理论驱动的文本维度、八个偏见诊断和一个连续的推理质量评分进行评定,旨在评估LLM评审者能否区分同行评审中的分析性形式与真实的认知质量。