NeurIPS 2026 AI生成的评审 [D]

Reddit r/MachineLearning 新闻

摘要

关于在NeurIPS 2026中使用AI生成的评审的讨论,包括对提示注入的担忧,以及评审者在没有适当监督的情况下使用LLM却没有后果的问题。

我真的很困惑(作为作者)这个提示注入的目的是什么?只是一项研究吗?我真的希望他们能对AI生成的评审采取行动。显然,我们不能假设评审者只是直接将LLM的输出复制粘贴而没有经过任何查看,但在某些情况下看起来确实是这样的。事实上,在某些情况下,元评审似乎也大量使用了LLM。那么,使用LLM进行评审到底会有什么后果呢?
查看原文

相似文章

NeurIPS 2026 的提示注入?[D]

Reddit r/MachineLearning

一位用户报告称,他们从 OpenReview 下载的 NeurIPS 2026 论文 PDF 中发现了一个提示注入,怀疑是会议方添加的,并警告可能存在包含特定短语的 LLM 生成审稿意见。

Review Arcade:论LLM评审的人类对齐与可游戏性

Hugging Face Daily Papers

本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。

对AI辅助同行评议的操纵给科学界带来新风险

arXiv cs.CL

一项新研究表明,AI辅助的同行评审易通过廉价手段被操控——仅需对论文摘要进行表面改写,即可显著提高AI生成的评审分数,并可能使人类编辑决策产生偏差,凸显了建立防护措施的必要性。