标签
谷歌在ICML和STOC会议上部署了一个智能体AI同行评审系统,以30分钟周转时间评审了约1万篇论文。正式论文显示,与零样本提示相比,它多发现了34%的数学错误,为大规模AI自动化科学评审树立了先例。
本文介绍了论文助手工具(PAT),这是一种用于深度科学评审的代理型AI框架,利用推理缩放技术识别数学错误及其他缺陷,在召回率上比零样本方法提升了34%。在STOC和ICML的试点部署表明,它能够在提交前捕捉关键错误,减轻人类审稿人的负担。