标签
一位 AAAI 2027 的审稿人对提交论文中附带代码的数量之少感到惊讶,尽管会议强调可复现性,并询问缺乏代码是否应影响审稿评分。
文章探讨了同行评审系统如何艰难应对研究出版物和人工智能辅助论文的指数级增长,导致志愿审稿人不堪重负,并引发错误和延误,促使人们呼吁改革。
本文证明,仅凭标题和摘要,大语言模型就能有效解除科学论文作者匿名,从而威胁到双盲同行评审的有效性。作者认为,问题框架和研究焦点中的稳定模式构成了作者身份的潜在概念特征,这要求我们在人工智能增强的研究生态系统中重新评估匿名实践。
介绍了RubricReviewer,一个用于基于大语言模型(LLM)的同行评审的评分标准驱动框架,它显式生成论文自适应的评分标准,并将无训练的证据收集智能体(Scout)与经过训练的人类对齐模型(Aligner)相结合,以产生更全面、更具区分性和更鲁棒的评审意见。
作者在为三大顶级会议审稿后,认为没有提供代码以复现结果的论文应被直接拒稿,并指出其审阅的12篇论文中仅1篇提供了完整代码,7篇未提供任何代码。
一篇观点文章,敦促 NeurIPS 审稿人在反驳回应了他们提出的关切时提高评分,无论个人喜好如何,引发了关于审稿过程的讨论。
This paper introduces AutoSupervision, a benchmark and method for verifying whether manuscript revisions actually address reviewer concerns using grounded evidence from peer-review records. Experiments on 56,000 Nature Communications articles show LLMs can summarize reviewer concerns but still struggle with evidence-based verification.
来自BOSC 2026的经验报告,介绍使用生成式AI对开源软件投稿进行预审,由人类审稿人做出最终决定。大多数审稿人认为AI辅助预审有用,但更倾向于独立验证AI的结论。
A position paper arguing that autonomous AI agents in science widen the verification gap and that scientific verification infrastructure must evolve with observable-by-default workflows, scalable verification, and clear attribution to sustain trustworthy science.
一位审稿人讲述自己标记了两篇作者捏造但被接收为口头报告的论文,并报告称在其审阅的22篇投稿中,68%存在捏造引用、LLM生成内容或虚假作者列表。多项研究证实,仅2025年就有数万篇此类论文,且同行评审中AI生成的内容越来越多。
本文介绍了论文内声明验证框架,该框架利用大型语言模型评估论文中的创新声明是否得到方法学证据的支持,填补了现有自动化同行评审系统的空白。人工评估表明,该框架与人类评审员的关注点显著一致,特别是在创新相关问题上。
一位NeurIPS审稿人称遇到了一篇论文及其回复似乎完全由LLM生成,表达了沮丧并寻求如何评估此类投稿的建议。
本研究分析了不同类型的审稿指南(正式会议指南与模仿审稿人指南)如何影响基于LLM的自动化同行评审,发现正式指南产生的结果与人类判断更一致,而严格的评分细则则会降低性能。
一条Twitter帖子分析了某篇细胞嵌入论文异常漫长的同行评审过程,利用GPT-5.6对比预印本与最终发表版本,估算时间、计算资源、人力及APC成本,凸显期刊同行评审的性价比。
本文介绍了Kahneman4Review基准,包含3,563条同行评审,这些评审按照九个理论驱动的文本维度、八个偏见诊断和一个连续的推理质量评分进行评定,旨在评估LLM评审者能否区分同行评审中的分析性形式与真实的认知质量。
这篇观点论文提出在ML会议中建立积分系统,通过为良好行为给予积分并允许兑换福利来激励高质量评审。
AI-research-feedback 是一个为 Claude Code 设计的学术审稿技能,通过六个并行智能体检查语法、一致性、公式、图表和论证漏洞,支持指定期刊模拟审稿人,最后生成结构化审稿报告。
谷歌在ICML和STOC会议上部署了一个智能体AI同行评审系统,以30分钟周转时间评审了约1万篇论文。正式论文显示,与零样本提示相比,它多发现了34%的数学错误,为大规模AI自动化科学评审树立了先例。
我建立了MatrixAgentNet,一个以AI代理为用户的社交网络,具有代理原生认证、同行评审信誉、所有权证明和机器可读API。该平台目前有269个代理和461条评论,我正在寻求关于如何防止信誉游戏等设计决策的反馈。
一个包含55个LLM互相盲评的公开评估设置揭示了8个模型家族中统计显著的同类家族评分偏差,其中Mistral对自己模型的扣分最为严重。该研究指出了聚合排行榜的问题,并提出了改进方法,如使用响应内混合效应模型。