peer-review

标签

Cards List
#peer-review

AAAI 2027 审稿:没有代码提交?[D]

Reddit r/MachineLearning · 昨天

一位 AAAI 2027 的审稿人对提交论文中附带代码的数量之少感到惊讶,尽管会议强调可复现性,并询问缺乏代码是否应影响审稿评分。

0 人收藏 0 人点赞
#peer-review

同行评审已不堪重负——它能在人工智能时代生存吗?

Ars Technica · 2天前 缓存

文章探讨了同行评审系统如何艰难应对研究出版物和人工智能辅助论文的指数级增长,导致志愿审稿人不堪重负,并引发错误和延误,促使人们呼吁改革。

0 人收藏 0 人点赞
#peer-review

大语言模型威胁双盲评审

arXiv cs.CL · 5天前 缓存

本文证明,仅凭标题和摘要,大语言模型就能有效解除科学论文作者匿名,从而威胁到双盲同行评审的有效性。作者认为,问题框架和研究焦点中的稳定模式构成了作者身份的潜在概念特征,这要求我们在人工智能增强的研究生态系统中重新评估匿名实践。

0 人收藏 0 人点赞
#peer-review

RubricReviewer:从直接批判到客观全面的基于评分标准的同行评审

arXiv cs.CL · 2026-08-04 缓存

介绍了RubricReviewer,一个用于基于大语言模型(LLM)的同行评审的评分标准驱动框架,它显式生成论文自适应的评分标准,并将无训练的证据收集智能体(Scout)与经过训练的人类对齐模型(Aligner)相结合,以产生更全面、更具区分性和更鲁棒的评审意见。

0 人收藏 0 人点赞
#peer-review

是时候对不包含可复现结果代码的论文进行直接拒稿了 [D]

Reddit r/MachineLearning · 2026-08-03

作者在为三大顶级会议审稿后,认为没有提供代码以复现结果的论文应被直接拒稿,并指出其审阅的12篇论文中仅1篇提供了完整代码,7篇未提供任何代码。

0 人收藏 0 人点赞
#peer-review

NeurIPS 2026:如果反驳回应了你的关切,请提高你的评分 [D]

Reddit r/MachineLearning · 2026-08-03

一篇观点文章,敦促 NeurIPS 审稿人在反驳回应了他们提出的关切时提高评分,无论个人喜好如何,引发了关于审稿过程的讨论。

0 人收藏 0 人点赞
#peer-review

AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision Verification

arXiv cs.CL · 2026-07-31 缓存

This paper introduces AutoSupervision, a benchmark and method for verifying whether manuscript revisions actually address reviewer concerns using grounded evidence from peer-review records. Experiments on 56,000 Nature Communications articles show LLMs can summarize reviewer concerns but still struggle with evidence-based verification.

0 人收藏 0 人点赞
#peer-review

开源软件投稿的AI辅助预审:来自BOSC 2026的经验报告

arXiv cs.CL · 2026-07-31 缓存

来自BOSC 2026的经验报告,介绍使用生成式AI对开源软件投稿进行预审,由人类审稿人做出最终决定。大多数审稿人认为AI辅助预审有用,但更倾向于独立验证AI的结论。

0 人收藏 0 人点赞
#peer-review

The Age of AI Agents Demands A New Scientific Paradigm To Sustain Trustworthy Science

arXiv cs.AI · 2026-07-31 缓存

A position paper arguing that autonomous AI agents in science widen the verification gap and that scientific verification infrastructure must evolve with observable-by-default workflows, scalable verification, and clear attribution to sustain trustworthy science.

0 人收藏 0 人点赞
#peer-review

我标记了两篇有虚假作者的研究论文,结果都被接收为口头报告

Hacker News Top · 2026-07-30 缓存

一位审稿人讲述自己标记了两篇作者捏造但被接收为口头报告的论文,并报告称在其审阅的22篇投稿中,68%存在捏造引用、LLM生成内容或虚假作者列表。多项研究证实,仅2025年就有数万篇此类论文,且同行评审中AI生成的内容越来越多。

0 人收藏 0 人点赞
#peer-review

方法是否支持声明?同行评审中的论文内验证

arXiv cs.CL · 2026-07-30 缓存

本文介绍了论文内声明验证框架,该框架利用大型语言模型评估论文中的创新声明是否得到方法学证据的支持,填补了现有自动化同行评审系统的空白。人工评估表明,该框架与人类评审员的关注点显著一致,特别是在创新相关问题上。

0 人收藏 0 人点赞
#peer-review

NeurIPS 2026 审稿人:AI生成的回复(及论文)[D]

Reddit r/MachineLearning · 2026-07-28

一位NeurIPS审稿人称遇到了一篇论文及其回复似乎完全由LLM生成,表达了沮丧并寻求如何评估此类投稿的建议。

0 人收藏 0 人点赞
#peer-review

评估审稿指南设计对基于LLM的自动化同行评审的影响

arXiv cs.CL · 2026-07-28 缓存

本研究分析了不同类型的审稿指南(正式会议指南与模仿审稿人指南)如何影响基于LLM的自动化同行评审,发现正式指南产生的结果与人类判断更一致,而严格的评分细则则会降低性能。

0 人收藏 0 人点赞
#peer-review

@PracheeAC:我注意到通用细胞嵌入论文从提交到发表的时间异常长(收稿日期:2023年12月;发表日期:2026年5月)。

X AI KOLs Timeline · 2026-07-15 缓存

一条Twitter帖子分析了某篇细胞嵌入论文异常漫长的同行评审过程,利用GPT-5.6对比预印本与最终发表版本,估算时间、计算资源、人力及APC成本,凸显期刊同行评审的性价比。

0 人收藏 0 人点赞
#peer-review

清晰的直觉还是真正的分析?在LLM作为评审人的同行评审中基准测试认知可靠性

arXiv cs.CL · 2026-07-14 缓存

本文介绍了Kahneman4Review基准,包含3,563条同行评审,这些评审按照九个理论驱动的文本维度、八个偏见诊断和一个连续的推理质量评分进行评定,旨在评估LLM评审者能否区分同行评审中的分析性形式与真实的认知质量。

0 人收藏 0 人点赞
#peer-review

ICML Position Track: 想要更好的ML评审?别再客气请求,用积分系统来激励 [D]

Reddit r/MachineLearning · 2026-07-07

这篇观点论文提出在ML会议中建立积分系统,通过为良好行为给予积分并允许兑换福利来激励高质量评审。

0 人收藏 0 人点赞
#peer-review

@GitHub_Daily: AI-research-feedback,一个给 Claude Code 用的学术审稿技能。 核心能同时跑六个审稿智能体,分别盯语法、前后一致性、公式、图表和论证漏洞。 还能指定 QJE、AER 这类期刊,模拟对应审稿人的挑剔程度,最后合…

X AI KOLs Timeline · 2026-07-03 缓存

AI-research-feedback 是一个为 Claude Code 设计的学术审稿技能,通过六个并行智能体检查语法、一致性、公式、图表和论证漏洞,支持指定期刊模拟审稿人,最后生成结构化审稿报告。

0 人收藏 0 人点赞
#peer-review

谷歌的智能体同行评审系统在ICML/STOC处理了约1万篇论文——正式研究论文现已发布 [R]

Reddit r/MachineLearning · 2026-06-29

谷歌在ICML和STOC会议上部署了一个智能体AI同行评审系统,以30分钟周转时间评审了约1万篇论文。正式论文显示,与零样本提示相比,它多发现了34%的数学错误,为大规模AI自动化科学评审树立了先例。

0 人收藏 0 人点赞
#peer-review

我建立了一个用户是AI代理而非人类的社交网络——希望能获得设计反馈

Reddit r/AI_Agents · 2026-06-28

我建立了MatrixAgentNet,一个以AI代理为用户的社交网络,具有代理原生认证、同行评审信誉、所有权证明和机器可读API。该平台目前有269个代理和461条评论,我正在寻求关于如何防止信誉游戏等设计决策的反馈。

0 人收藏 0 人点赞
#peer-review

我让55个LLM互相盲评(22k条评价,全部公开)。每个有足够数据的模型家族都偏向自家兄弟。Qwen的评委给Qwen加分约0.9分。Mistral给自己的扣分约1.0分。

Reddit r/LocalLLaMA · 2026-06-28

一个包含55个LLM互相盲评的公开评估设置揭示了8个模型家族中统计显著的同类家族评分偏差,其中Mistral对自己模型的扣分最为严重。该研究指出了聚合排行榜的问题,并提出了改进方法,如使用响应内混合效应模型。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈