标签
本文介绍了论文助手工具(PAT),这是一种用于深度科学评审的代理型AI框架,利用推理缩放技术识别数学错误及其他缺陷,在召回率上比零样本方法提升了34%。在STOC和ICML的试点部署表明,它能够在提交前捕捉关键错误,减轻人类审稿人的负担。
本综述从系统层面对基于LLM的科学同行评审进行了分析,涵盖方法、基准以及包括提示注入和数据投毒等稳健性风险在内的可靠性挑战。
《自然》杂志新发表的一篇同行评审论文认为,微软声称其Majorana 1芯片实现了拓扑量子比特的说法并未令人信服地得到证明,并指出观测到的信号可能来自量子点。
本文利用深度学习方法(LCF-BERT-CDM)研究了《自然·通讯》多轮同行评审中方面级情感的分布与演化,实现了82.65%的宏F1值,并发现随着评审轮次增加,正面情感上升而负面情感下降。
这条推文介绍了一篇科学论文,该论文为初学者提供了简化的、循序渐进的指南,涵盖从初步想法到期刊选择和同行评审的整个研究和发表过程。
本文对用于同行评审的代理审核系统进行基准测试,评估了开源和专有系统在研究论文上的表现。最佳配置实现了83.0%的成对准确率,并捕获了71.6%的注入错误,但用户反馈强调了误报和吹毛求疵的问题。
本文介绍了一种多智能体同行评审推理方法,其中多个LLM独立生成思维链推理,然后相互评估输出以选择最佳答案。该方法在医学问答基准测试中优于单模型推理和多数投票。
一篇介绍AI科学家(The AI Scientist)的论文,该系统自动化了从想法生成到同行评审的整个研究生命周期,展示了人工智能在科学贡献方面日益增长的能力。
本文提出ProReviewer,一种基于大语言模型的学术同行评审智能体,其被形式化为马尔可夫决策过程。该智能体通过维护结构化的评审日志主动探究论文,在多个质量维度上优于现有方法。
本文介绍了PaperGuard,这是一个用于评估和防御多模态AI同行评审系统对抗性攻击的基准,涵盖多个科学领域的文本和图像攻击。
一项新研究表明,AI辅助的同行评审易通过廉价手段被操控——仅需对论文摘要进行表面改写,即可显著提高AI生成的评审分数,并可能使人类编辑决策产生偏差,凸显了建立防护措施的必要性。
Traxia提出了一种可验证、智能体原生的科学出版框架,其中自主AI智能体可以发表论文、进行同行评审并与人类协作,解决了可重复性和溯源问题。
一篇论文指出,AI的便利正在侵蚀工程领域那种以同伴为主导的文化——在这种文化中,相互学习和指导曾蓬勃发展;并警告说,将AI视为同伴会剥夺代码审查等实践所带来的人类成长。
白宫提出新规,将赋予政治任命官员对联邦研究资助的最终审批权,取代传统的同行评审流程。批评者认为这使科学资助政治化,损害了科学诚信。
美国管理和预算办公室提出新的联邦拨款规则,将使同行评审成为可选,允许以模糊定义的"国家利益"理由随时取消拨款,并禁止对某些文化议题的拨款,威胁美国科研事业。
本文通过实验评估了LLM生成的科学论文评审与人工评审之间的对齐程度,发现对齐有限且变化较大。研究还表明,作者可以通过迭代修改论文来“操控”LLM评审以提高分数,多达35%的论文的总体分数出现了统计显著提升。
研究人员在影响临床指南的医学论文中发现了28个AI生成的虚假引用,凸显了AI幻觉破坏科学诚信和患者护理的风险。
介绍PRISM,一个用于评估基于大语言模型的同行评审员的多维度基准,涵盖分析深度、新颖性评估、缺陷识别和建设性。研究结果表明,大语言模型在单个维度上能与人类评审员匹敌甚至超越,但缺乏跨所有维度的平衡表现,因此最适合作为人类评审的补充工具。
介绍了TADDLE,一种用于检测有缺陷的LLM生成同行评审的工具增强代理,以及一个包含50篇ICLR 2025论文的1800条评审的专家标注基准。该系统将检测分解为四个专门的分析工具,并使用两阶段半监督学习进行二元和多标签分类。
EvoSci提出了一种受生物启发的多智能体框架,将进化算法与知识图谱建模相结合,以迭代生成、评估和完善研究想法,在同行评审评估中取得了最佳性能。