位置:想要更优质的机器学习评审?别再礼貌请求,改用学分制激励如何?
摘要
本文论证,改进机器学习同行评审需要实施可执行的程序保障措施,并引入可消耗积分系统(如OpenReview Points),以此激励优质评审并控制投稿量。
arXiv:2608.14571v1 公告类型:新文章
摘要:随着投稿量的飙升、更严格的同行互评政策、OpenReview等平台的广泛应用,以及缺乏出版费用来抵消部分压力,机器学习(ML)社区在所有科学领域中拥有最大的学术影响力之一。然而,**几乎**每**个人**都**有许多**关于其评审体验的不愉快经历想要分享。更糟糕的是,目前缺乏公开的严肃讨论空间,更不用说对"如何使评审系统有效"或"如何改进评审系统"展开辩论。本文从两个核心问题出发进行探讨:*如何合理限制投稿量?*以及*如何激励良好评审、抑制不良评审?*我们首先评估了现有解决方案的优势与不足,具体分析了流行的会议机制的四种观点,并提出了两种改进的替代设计方案。
我们的总体立场是:机器学习同行评审的实质性改善,不会来自征稿启事或审稿指南中礼貌性的最佳实践建议——它需要**可执行且精细的程序性保障措施**,并结合**类货币的信用系统(例如我们提出的**OpenReview Points**)**。机器学习从业者可以通过贡献良好的评审实践来"赚取"此类积分,并在一个或多个主要会议上"使用"积分来兑换各类"特权",例如免费注册资格或申请额外评审资源的权利。
查看缓存全文
缓存时间: 2026/08/18 09:45
# 想要更好的机器学习论文评审?停止礼貌请求,用信用系统激励改进 来源:https://arxiv.org/html/2608.14571 ###### 摘要 随着论文投稿数量激增、互惠评审政策收紧、OpenReview等平台的广泛普及,以及缺少论文发表费用的抵消压力,机器学习(ML)社区已成为所有科学领域中学术产出规模最大的领域之一。然而,几乎所有人都对评审体验有着诸多不满。更糟的是,目前缺乏公共空间来严肃讨论甚至辩论何为有效的评审系统或如何改进。在这篇立场论文中,我们从两个核心问题展开讨论:**如何合理限制投稿量?**以及**如何激励良好评审、抑制不良评审?** 我们首先评估了现有应对尝试的优势与不足。具体而言,我们分析了四种流行的会议机制,并提出了两种替代设计方案。我们的核心观点是:ML同行评审的实质性改进不会来自征稿说明或审稿人指南中礼貌的最佳实践建议——它需要**可执行的细粒度流程保障**,并辅以**类货币的信用系统**(例如我们提出的OpenReview积分)。ML研究者可通过贡献优质评审实践来“赚取”此类积分,并在一个或多个主要会议中“使用”积分以兑换各类“福利”,如免费注册或申请额外评审资源的权利。 机器学习,ICML ## 1 引言 本文认为,通过征稿说明或审稿人指南中的礼貌请求或乐观性指导,难以改进机器学习(ML)的同行评审。几乎可以确定,细粒度但可执行的流程护栏,加上跨会议可使用的信用系统,是构建可持续评审生态系统的必备要素。 机器学习在规模和影响力上的扩张速度远超几乎所有其他科学领域。如今单个会议就能收到数万篇投稿,拥有支持互动讨论的开放获取平台(如OpenReview),并越来越多地采用互惠评审义务以平衡供需。表面上,ML社区具备维持健全且愉悦的同行评审流程的一切条件:我们拥有最大的学术产出和最现代的评审技术,且无需承受典型的付费墙、发表费用或昂贵会员制瓶颈。然而,现实体验往往远非如此。从晦涩或敷衍的评审到标准严重不一致,对评审过程的不满普遍存在(Thorn Jakobsen 和 Rogers, 2022),博士生、资深教授和产业研究人员皆有抱怨(例如参见第2.1节示例)。更糟的是,目前几乎没有结构化方式来追究不当行为者的责任,也缺乏激励措施促使优秀评审者更进一步。 在这篇立场论文中,我们扩展了对已识别的两个核心挑战的讨论: 1. 1\. 如何合理限制投稿量? 2. 2\. 如何激励良好评审、抑制不良评审? 我们首先阐述这两个问题为何是导致ML评审诸多不满的根源。接着,评估ML会议上已实施的一些现有缓解措施。我们提出对这些措施的看法,最后提出两种新机制:可大规模执行的**细粒度流程保障**;以及基于所谓“OpenReview积分”的信用系统,该系统允许研究人员以有形方式在主要会议和评审周期中“赚取”和“使用”其评审贡献。我们认为这些机制很可能有效解决上述诸多缺陷,更重要的是,其灵活性足以让每个会议采用自身变体。 除了提出的机制,我们还探讨了许多替代观点,分析其合理性(或不合理性),以及我们的机制如何考虑这些关切。论文以“建议实践”部分结尾,概述了我们对首批采用类似信用系统的会议应如何推进的愿景,以及应谨慎考虑的方面。附录B包含了基于真实会议的案例研究等补充材料。由于直接相关研究有限及页数限制,相关工作见附录A。我们强调,目标并非完善ML同行评审(任何人都不应声称能做到这点),而是让其失败更罕见、痛苦更小,最重要的是更具问责性和可持续性。我们也并非提出所有会议必须遵循的具体规则手册,而是倡导一个有前景的通用方向,供未来会议组织者探索并适应自身需求。 ## 2 根本原因 ### 2\.1 巨量投稿引发各类挑战 ML会议通常收到海量投稿已成共识(Kim等, 2025;Yang, 2025),这由该领域快速发展和日益普及的AI辅助研究推动(第3.1节)。这自然引发各类实际挑战。从人力角度看,更多投稿直接意味着对审稿人和领域主席(AC)的需求增加,进而加重资深领域主席(SAC)及最终程序主席(PC)的工作负担。在会议评审系统各环节承受如此巨大压力下,结果几乎可预测:每篇论文关注度降低、分诊更匆忙,评审质量和决策结果的差异更大(Su等, 2025;Shah, 2022)。此外,实际情况是,大多数ML会议通常保证一旦论文被接收即可获得现场展示机会。这使得物理容量限制发挥作用,直接对可接收论文数量施加上限。许多边缘或倾向接收的论文可能纯粹因容量限制被淘汰,这一角色常被委派给SAC。但考虑到投稿量与SAC数量对比(NeurIPS 2024有195位主会SAC,对应15,671篇投稿,约每位SAC负责80篇论文),此类分配从设计上就不合理且不可持续,因为很少有SAC能有精力或意愿审阅如此多论文的内容和评审记录。实践中,这种压力促使走捷径(例如更依赖数值分数或其他类似快速启发式方法),进一步放大了随机性并削弱了问责性。事实上,我们已看到许多SAC公开反对这种“为保容量而强制拒稿”的做法,例如NeurIPS的SAC Ahmad Beirami和Atlas Wang在LinkedIn上的发帖。 ### 2\.2 缺乏监督、反馈机制以及对优秀行为者的激励和对不良行为者的后果 尽管审稿人、AC和SAC有权提供反馈,但ML会议缺乏适当的监督和反馈机制。审稿人几乎可以完全免责——只要其行为不至于触发正式干预,即可提交敷衍、不一致或低质量的评审,且几乎不存在纠正或发现此类行为的途径。这种生态使行为者鲜有途径学习如何变得更好,更遑论激励其更进一步。由于缺乏常规化反馈、透明度量或正向激励,系统既不奖励卓越的评审贡献,也不遏制不良实践;我们在第3.4节对此详述。 ## 3 现有修复措施的不足 ### 3\.1 软硬投稿上限收效甚微 随着ML社区研究体量增长(Yang, 2025;Kim等, 2025)以及AI辅助研究日益普及,投稿量增速远超社区评审能力。这种升级自然引发了关于遏制投稿率和维持可控评审负荷的机制讨论,其中投稿上限常被视为减少此类数量的最直接方式之一。表1:ICLR 2025投稿最多的作者(按论文位置统计),基于PaperCopilot数据。每单元格报告在该计数方式下第n位最高产作者的投稿数。值得注意的是,“任意作者”统计远超“第一作者”或“通讯作者”统计。 最高投稿数 | #1 | #25 | #50 | #75 | #100 --- | --- | --- | --- | --- | --- 第一作者 | 74 | 33 | 33 | 33 | 33 通讯作者 | 34 | 13 | 11 | 9 | 8 任意作者 | 42 | 21 | 17 | 16 | 14 我们认为投稿上限——无论是“软性”的(例如超过一定投稿量后必须进行互惠评审)还是“硬性”的(例如对每位作者可投稿数量施加严格配额)——最多只能提供边际缓解。核心问题并非少数“超高产”主要作者个人向系统灌入大量新投稿,而是分散在整个社区,因为任何作者提交未准备好稿件或无休止地重复投稿存在严重缺陷的被拒稿件都几乎没有直接负面影响,总体上耗尽了评审能力。我们怀疑实践中,每位作者上限大多只是从署名中裁减辅助作者,以便团队符合配额。换言之——在低质量投稿无惩罚的情况下——投稿上限可能主要改变论文署名者,而非论文是否被提交。虽然缺乏直接证据,但公开统计数据至少暗示了这一点:如表1所示,有相当数量作者署名于多篇ICLR 2025投稿,但极少有人作为第一作者或通讯作者出现在同等数量的论文中,这表明他们不太可能是所有这些投稿的核心贡献者。在严格上限下,此类作者更可能从低优先级投稿中移除自己的名字,而非阻止这些论文投稿。因此,我们认为,除非存在真正的负向激励来抑制无限重投和/或奖励克制,否则投稿上限只能触及数量问题的边缘,而无法产生大规模的实质性影响。 ### 3\.2 不负责任的审稿人最关心自己的作品,礼貌请求无济于事 不良或不负责任的评审做法似乎普遍存在,很大程度上是因为当前会议机制缺乏问责性。直到最近,大多数ML会议对不负责任的审稿人未施加任何制裁,导致不良行为基本不受制约。对于通过强制手段(例如强制互惠评审)招募的审稿人,若将分配的任务视为待完成事项,他们最关心的可能是自己当前或未来的投稿。我们认为,要有效抑制不负责任的评审,必须在投稿端实施某种形式的制裁。否则,会议几乎无实际杠杆作用,通常只能在征稿说明或审稿人指南中礼貌请求;尽管存在一些非常周到的指南(如ARR审稿人指南),其效果仍不尽如人意。最近,从CVPR 2025开始,多个ML会议采用了本质上针对不负责任审稿人的报复性桌面拒稿政策。在CVPR 2025,其领域主席(AC)“识别出一些高度不负责任的审稿人,他们要么完全放弃评审流程,要么提交了质量极差的评审(包括由大型语言模型生成的评审)”,最终对涉及这些审稿人的19篇原本被接收的论文进行了桌面拒稿。这一举措标志着为保护评审质量和完整性而实施严格程序保障的有意义开端,但我们认为,如此严厉的报复性程序(如桌面拒稿)只能为会议带来边际效益,因为只有少数行为者会极端到公然无视直接指令并留下确凿证据。这是因为像桌面拒稿这样的严厉惩罚本质上是钝器:它过于严厉而无法广泛适用,只能合理用于有可验证信号的最极端违规。在CVPR的案例中,它主要针对完全放弃评审职责的审稿人,这是清晰、基于规则且可验证的违规,没有歧义空间。不幸的是,ML中大多数审稿人问题可能比完全疏忽更微妙。不负责任的评审可能表现为多种形式:从
相似文章
ICML Position Track: 想要更好的ML评审?别再客气请求,用积分系统来激励 [D]
这篇观点论文提出在ML会议中建立积分系统,通过为良好行为给予积分并允许兑换福利来激励高质量评审。
在AI会议上改进有问题的同行评审系统的简单方案 [R]
一个通过在AI会议上将作者分成两半来修复互惠性评审、消除不公平拒绝动机的方案。
NeurIPS 2026 AI生成的评审 [D]
关于在NeurIPS 2026中使用AI生成的评审的讨论,包括对提示注入的担忧,以及评审者在没有适当监督的情况下使用LLM却没有后果的问题。
为什么机器学习研究社区不限制每位作者的投稿数量?[D]
一位研究者质疑为什么机器学习社区不限制每位作者的投稿数量以管理评审质量,并引用了如安全(Security)和计算机体系结构(Computer Architecture)等其他领域的成功实践。
对AI辅助同行评议的操纵给科学界带来新风险
一项新研究表明,AI辅助的同行评审易通过廉价手段被操控——仅需对论文摘要进行表面改写,即可显著提高AI生成的评审分数,并可能使人类编辑决策产生偏差,凸显了建立防护措施的必要性。