peer-review

标签

Cards List
#peer-review

迈向自动化科学评审:谷歌的Paper Assistant Tool

Hugging Face Daily Papers · 2026-06-26 缓存

本文介绍了论文助手工具(PAT),这是一种用于深度科学评审的代理型AI框架,利用推理缩放技术识别数学错误及其他缺陷,在召回率上比零样本方法提升了34%。在STOC和ICML的试点部署表明,它能够在提交前捕捉关键错误,减轻人类审稿人的负担。

0 人收藏 0 人点赞
#peer-review

基于LLM的科学同行评审:方法、基准与可靠性挑战

arXiv cs.CL · 2026-06-25 缓存

本综述从系统层面对基于LLM的科学同行评审进行了分析,涵盖方法、基准以及包括提示注入和数据投毒等稳健性风险在内的可靠性挑战。

0 人收藏 0 人点赞
#peer-review

一篇新论文指出微软一年前夸大了其量子计算的说法

The Verge · 2026-06-24 缓存

《自然》杂志新发表的一篇同行评审论文认为,微软声称其Majorana 1芯片实现了拓扑量子比特的说法并未令人信服地得到证明,并指出观测到的信号可能来自量子点。

0 人收藏 0 人点赞
#peer-review

基于方面的情感演化及其与多轮同行评审中评审轮次的相关性:一种深度学习方法

arXiv cs.CL · 2026-06-24 缓存

本文利用深度学习方法(LCF-BERT-CDM)研究了《自然·通讯》多轮同行评审中方面级情感的分布与演化,实现了82.65%的宏F1值,并发现随着评审轮次增加,正面情感上升而负面情感下降。

0 人收藏 0 人点赞
#peer-review

@Researchable_SA: 一篇非常适合科研初学者的科学论文!它以简化且有条理的方式解释了……

X AI KOLs Timeline · 2026-06-21 缓存

这条推文介绍了一篇科学论文,该论文为初学者提供了简化的、循序渐进的指南,涵盖从初步想法到期刊选择和同行评审的整个研究和发表过程。

0 人收藏 0 人点赞
#peer-review

代理审核系统基准测试

arXiv cs.AI · 2026-06-20 缓存

本文对用于同行评审的代理审核系统进行基准测试,评估了开源和专有系统在研究论文上的表现。最佳配置实现了83.0%的成对准确率,并捕获了71.6%的注入错误,但用户反馈强调了误报和吹毛求疵的问题。

0 人收藏 0 人点赞
#peer-review

让LLMs相互评判:用于医学问答的多智能体同行评审推理

arXiv cs.CL · 2026-06-16 缓存

本文介绍了一种多智能体同行评审推理方法,其中多个LLM独立生成思维链推理,然后相互评估输出以选择最佳答案。该方法在医学问答基准测试中优于单模型推理和多数投票。

0 人收藏 0 人点赞
#peer-review

迈向AI研究的端到端自动化

arXiv cs.AI · 2026-06-16 缓存

一篇介绍AI科学家(The AI Scientist)的论文,该系统自动化了从想法生成到同行评审的整个研究生命周期,展示了人工智能在科学贡献方面日益增长的能力。

0 人收藏 0 人点赞
#peer-review

从被动生成到主动调查:一种主动的学术同行评审智能体

arXiv cs.CL · 2026-06-12 缓存

本文提出ProReviewer,一种基于大语言模型的学术同行评审智能体,其被形式化为马尔可夫决策过程。该智能体通过维护结构化的评审日志主动探究论文,在多个质量维度上优于现有方法。

0 人收藏 0 人点赞
#peer-review

AI审稿人能看清全貌吗?多模态同行评审的攻击与防御

arXiv cs.CL · 2026-06-12 缓存

本文介绍了PaperGuard,这是一个用于评估和防御多模态AI同行评审系统对抗性攻击的基准,涵盖多个科学领域的文本和图像攻击。

0 人收藏 0 人点赞
#peer-review

对AI辅助同行评议的操纵给科学界带来新风险

arXiv cs.CL · 2026-06-10 缓存

一项新研究表明,AI辅助的同行评审易通过廉价手段被操控——仅需对论文摘要进行表面改写,即可显著提高AI生成的评审分数,并可能使人类编辑决策产生偏差,凸显了建立防护措施的必要性。

0 人收藏 0 人点赞
#peer-review

Traxia:一个可验证、智能体原生的科学出版框架

arXiv cs.AI · 2026-06-09 缓存

Traxia提出了一种可验证、智能体原生的科学出版框架,其中自主AI智能体可以发表论文、进行同行评审并与人类协作,解决了可重复性和溯源问题。

0 人收藏 0 人点赞
#peer-review

我们不再互相请教了。一份关于AI与工程文化的宣言。

Reddit r/artificial · 2026-06-02 缓存

一篇论文指出,AI的便利正在侵蚀工程领域那种以同伴为主导的文化——在这种文化中,相互学习和指导曾蓬勃发展;并警告说,将AI视为同伴会剥夺代码审查等实践所带来的人类成长。

0 人收藏 0 人点赞
#peer-review

白宫提议赋予政治任命官员对研究资助的最终审批权

Hacker News Top · 2026-05-30 缓存

白宫提出新规,将赋予政治任命官员对联邦研究资助的最终审批权,取代传统的同行评审流程。批评者认为这使科学资助政治化,损害了科学诚信。

0 人收藏 0 人点赞
#peer-review

美国拟议新资助规定:我们可随时取消任何拨款

Ars Technica · 2026-05-29 缓存

美国管理和预算办公室提出新的联邦拨款规则,将使同行评审成为可选,允许以模糊定义的"国家利益"理由随时取消拨款,并禁止对某些文化议题的拨款,威胁美国科研事业。

0 人收藏 0 人点赞
#peer-review

Review Arcade:论LLM评审的人类对齐性与可操控性

arXiv cs.AI · 2026-05-29 缓存

本文通过实验评估了LLM生成的科学论文评审与人工评审之间的对齐程度,发现对齐有限且变化较大。研究还表明,作者可以通过迭代修改论文来“操控”LLM评审以提高分数,多达35%的论文的总体分数出现了统计显著提升。

0 人收藏 0 人点赞
#peer-review

研究人员刚刚在医学论文中发现28个虚假AI引用

Reddit r/ArtificialInteligence · 2026-05-27

研究人员在影响临床指南的医学论文中发现了28个AI生成的虚假引用,凸显了AI幻觉破坏科学诚信和患者护理的风险。

0 人收藏 0 人点赞
#peer-review

PRISM:评估LLM审稿人的多维度基准

arXiv cs.CL · 2026-05-27 缓存

介绍PRISM,一个用于评估基于大语言模型的同行评审员的多维度基准,涵盖分析深度、新颖性评估、缺陷识别和建设性。研究结果表明,大语言模型在单个维度上能与人类评审员匹敌甚至超越,但缺乏跨所有维度的平衡表现,因此最适合作为人类评审的补充工具。

0 人收藏 0 人点赞
#peer-review

TADDLE: 一种用于检测有缺陷的LLM生成同行评审的工具增强代理

arXiv cs.AI · 2026-05-27 缓存

介绍了TADDLE,一种用于检测有缺陷的LLM生成同行评审的工具增强代理,以及一个包含50篇ICLR 2025论文的1800条评审的专家标注基准。该系统将检测分解为四个专门的分析工具,并使用两阶段半监督学习进行二元和多标签分类。

0 人收藏 0 人点赞
#peer-review

EvoSci:一种受生物启发的多智能体框架,用于科学发现的演化

arXiv cs.AI · 2026-05-26 缓存

EvoSci提出了一种受生物启发的多智能体框架,将进化算法与知识图谱建模相结合,以迭代生成、评估和完善研究想法,在同行评审评估中取得了最佳性能。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈