迈向自动化科学评审:谷歌的Paper Assistant Tool
摘要
本文介绍了论文助手工具(PAT),这是一种用于深度科学评审的代理型AI框架,利用推理缩放技术识别数学错误及其他缺陷,在召回率上比零样本方法提升了34%。在STOC和ICML的试点部署表明,它能够在提交前捕捉关键错误,减轻人类审稿人的负担。
查看缓存全文
缓存时间: 2026/06/29 02:00
论文页面 - 迈向自动化科学评审:谷歌论文助手工具
来源:https://huggingface.co/papers/2606.28277
摘要
以PAT为代表的AI辅助科学评审系统利用先进的推理扩展技术来识别数学错误并提升研究质量,同时保持人类 oversight。
人工智能正推动科学发现领域的革命,加速从假设生成到数学定理证明的方方面面。然而,这种快速加速也带来了系统性的挑战:传统的人类同行评审(https://huggingface.co/papers?q=peer%20review)无法适应AI辅助科学成果的激增。最终,要解决这一矛盾,我们也必须部署AI来加速验证和评审过程本身。为了围绕这一转型展开讨论,我们提出了一个由四个渐进级别的AI-人类协作(https://huggingface.co/papers?q=AI-human%20collaboration)构成的科学评估分类法,并讨论了每个级别涉及的各种权衡。作为迈向这一未来的一步,我们引入了论文助手工具(PAT),一个为深度科学评审和验证构建的代理型AI框架(https://huggingface.co/papers?q=agentic%20AI%20framework)。PAT会读取完整的科学手稿,并生成全面评估,检查理论结果、验证实验、提出改进建议并识别潜在缺陷。通过利用推理扩展(https://huggingface.co/papers?q=inference%20scaling)技术,PAT能够发现单次模型调用无法察觉的深层问题,在SPOT基准(https://huggingface.co/papers?q=SPOT%20benchmark)上对数学错误(https://huggingface.co/papers?q=mathematical%20errors)的零样本召回率提升了34%。PAT作为预投稿工具(https://huggingface.co/papers?q=pre-submission%20tool)在两大计算机科学会议——STOC和ICML——的作者中进行的试点部署,展示了其识别关键错误并为研究论文提出实质性改进建议的能力。通过尽早发现错误,PAT减轻了审稿人的认知负担,同时保留了他们对评审过程结果的控制权。
查看arXiv页面(https://arxiv.org/abs/2606.28277)查看PDF(https://arxiv.org/pdf/2606.28277)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.28277)
在您的代理中获取此论文:
hf papers read 2606\.28277
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接到此论文
在模型的 README.md 中引用 arxiv.org/abs/2606.28277 以从此页面链接。
引用本文的数据集0
没有数据集链接到此论文
在数据集的 README.md 中引用 arxiv.org/abs/2606.28277 以从此页面链接。
引用本文的 Spaces0
没有 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.28277 以从此页面链接。
包含本文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
谷歌的智能体同行评审系统在ICML/STOC处理了约1万篇论文——正式研究论文现已发布 [R]
谷歌在ICML和STOC会议上部署了一个智能体AI同行评审系统,以30分钟周转时间评审了约1万篇论文。正式论文显示,与零样本提示相比,它多发现了34%的数学错误,为大规模AI自动化科学评审树立了先例。
PaperMentor:一种以人为本的多智能体写作辅导工具,面向Overleaf上的AI研究论文
PaperMentor是一种以人为本的多智能体写作助手,它集成了专家技能库和专门代理,能够在Overleaf上提供可操作的内联注释,在AI研究论文的可用性和相关性方面优于GPT-5.2。
迈向AI研究的端到端自动化
一篇介绍AI科学家(The AI Scientist)的论文,该系统自动化了从想法生成到同行评审的整个研究生命周期,展示了人工智能在科学贡献方面日益增长的能力。
AI能否评估AI科学家?一项使用自动化多模型评审的自主研究生成系统基准测试研究
本文提出了一种使用自动化多模型LLM评审的基准测试协议来评估AI科学家系统,比较了Sakana AI、CycleResearcher和Data-to-Paper等框架,并发现FARS基准论文显著优于其他系统。
@rohanpaul_ai: Meta、斯坦福、谷歌等多家顶级实验室的新论文提出了AutoResearchClaw。表明自动化研究改进…
来自Meta、斯坦福和谷歌的一篇新论文提出了AutoResearchClaw,该方法通过整合故障恢复、辩论和选择性人工输入来改进自动化研究。它在ARC-Bench上以54.7%的优势超越了AI Scientist v2,并揭示了当受到过程约束而非无限自由时,自主性会得到增强。