谷歌的智能体同行评审系统在ICML/STOC处理了约1万篇论文——正式研究论文现已发布 [R]
摘要
谷歌在ICML和STOC会议上部署了一个智能体AI同行评审系统,以30分钟周转时间评审了约1万篇论文。正式论文显示,与零样本提示相比,它多发现了34%的数学错误,为大规模AI自动化科学评审树立了先例。
谷歌在两个顶级计算机科学会议上部署了一个智能体AI同行评审系统——以30分钟周转时间评审了约1万篇论文——新的正式研究论文显示,与零样本提示相比,它多发现了34%的数学错误;会议规模下AI自动化科学评审的先例已经确立并正式记录在案。-- 来源:https://arxiv.org/abs/2606.28277
相似文章
迈向自动化科学评审:谷歌的Paper Assistant Tool
本文介绍了论文助手工具(PAT),这是一种用于深度科学评审的代理型AI框架,利用推理缩放技术识别数学错误及其他缺陷,在召回率上比零样本方法提升了34%。在STOC和ICML的试点部署表明,它能够在提交前捕捉关键错误,减轻人类审稿人的负担。
我们通过复现ICML的2,200篇论文学到了什么
Hugging Face 分享了社区黑客马拉松的发现,1200名参与者使用编码代理复现了2,226篇ICML论文,凸显了评审严谨性问题以及AI代理扩展验证的潜力。
关于AI评审员的局限与机遇:联合45位专家科学家评审Nature系列期刊论文的评审意见
一项研究评估了AI评审员(GPT-5.2、Claude Opus 4.5、Gemini 3.0 Pro)与45位人类专家评审员对Nature系列期刊论文的评审表现,发现AI评审员在综合评审质量上可以超越评分最高的人类评审员,尽管其准确性略低,但能提出更多重要问题。
对AI辅助同行评议的操纵给科学界带来新风险
一项新研究表明,AI辅助的同行评审易通过廉价手段被操控——仅需对论文摘要进行表面改写,即可显著提高AI生成的评审分数,并可能使人类编辑决策产生偏差,凸显了建立防护措施的必要性。
@JeremyNguyenPhD: “我让 3 个 AI 代理整晚独自研究一个问题,它们带回了对 72 篇同行评审论文的综述” -- @ProfJieDi…
Jie Ding 教授开源了 Autoresearch 和 WorldSeed,这是两款 AI 代理框架,能够在一夜之间自主分析 72 篇同行评审论文以解决研究问题。