开源软件投稿的AI辅助预审:来自BOSC 2026的经验报告
摘要
来自BOSC 2026的经验报告,介绍使用生成式AI对开源软件投稿进行预审,由人类审稿人做出最终决定。大多数审稿人认为AI辅助预审有用,但更倾向于独立验证AI的结论。
arXiv:2607.27228v1 公告类型:新
摘要:大多数会议依赖对投稿的同行评审,但随着生成式AI使准备投稿材料比以往任何时候都更容易,一些会议正面临投稿数量的激增。我们想看看生成式AI能否通过按特定标准预审摘要来帮助会议的志愿者审稿人。生物信息学开源会议(BOSC)非常适合进行这项实验,因为我们已经有一套详细的评分标准,供审稿人根据多项标准评估提交的摘要,包括开放性(项目相关代码或其他内容的公开可用性)、有效的开源许可证,以及“可运行性”(下载、构建和运行该项目的难易程度——这是衡量可重用性的重要指标)。对于BOSC 2026,我们构建了bosc-pre-review,一个评估六项评审标准的智能体技能,以及Runabilly,它会在一次性Docker容器中构建和测试每个项目以确保安全。AI仅收集证据呈现给审稿人;关于摘要是否接受的所有决定均由人类做出。评审期结束后,我们对审稿人进行了调查,以了解他们对预审的有用性评价。大多数回应者表示预审很有用,但他们更倾向于对照自己的判断来核实AI的结论,而不是不加质疑地接受AI结果。
查看缓存全文
缓存时间: 2026/07/31 10:00
# AI 辅助的开源软件投稿预审:来自 BOSC 2026 的经验报告 来源:https://arxiv.org/abs/2607.27228 查看 PDF(https://arxiv.org/pdf/2607.27228) > 摘要:大多数会议依赖同行评审来审阅投稿,但随着生成式 AI 使得准备投稿材料比以往任何时候都更容易,一些会议正面临投稿数量急剧激增的情况。我们想看看生成式 AI 能否通过针对特定标准预审摘要来帮助会议的自愿评审者。生物信息学开源会议(BOSC)非常适合进行这项实验,因为我们已经有一套详细的评审标准,供评审者根据多个标准评估提交的摘要,包括开放性(项目相关代码或其他内容的公开可用性)、有效的开源许可证,以及“可运行性”(下载、构建和运行项目的难易程度——这是可重用性的重要衡量标准)。为 BOSC 2026,我们构建了 bosc-pre-review,这是一个评估六项评审标准的智能体技能,以及 Runabilly,它可在一次性的 Docker 容器中安全地构建并测试每个项目。AI 仅收集证据供评审者参考;关于摘要是否被接受的所有决定均由人类做出。评审期结束后,我们调查了评审者,以了解他们认为预审有多大用处。大多数回应者表示预审有用,但他们更倾向于将 AI 的结论与自己的判断进行核对,而不是不加质疑地接受 AI 的结果。 ## 提交历史 来自:Tazro Ohta [查看电子邮件(https://arxiv.org/show-email/e6806652/2607.27228)] **\[v1\]** 2026 年 7 月 14 日,星期二 00:23:38 UTC(649 KB)
相似文章
关于AI评审员的局限与机遇:联合45位专家科学家评审Nature系列期刊论文的评审意见
一项研究评估了AI评审员(GPT-5.2、Claude Opus 4.5、Gemini 3.0 Pro)与45位人类专家评审员对Nature系列期刊论文的评审表现,发现AI评审员在综合评审质量上可以超越评分最高的人类评审员,尽管其准确性略低,但能提出更多重要问题。
NeurIPS 2026 AI生成的评审 [D]
关于在NeurIPS 2026中使用AI生成的评审的讨论,包括对提示注入的担忧,以及评审者在没有适当监督的情况下使用LLM却没有后果的问题。
使用AI进行代码审查六个月教会我:“review this”是一个伪装成提示问题的QA问题
一位开发者回顾了六个月来使用AI进行代码审查的经历,发现模糊的提示会产生看似合理但毫无用处的反馈。解决办法是将审查视为一个带门控的流水线,包含明确的上下文、分范围的检查、验证清单和对抗性自我批评。
对AI辅助同行评议的操纵给科学界带来新风险
一项新研究表明,AI辅助的同行评审易通过廉价手段被操控——仅需对论文摘要进行表面改写,即可显著提高AI生成的评审分数,并可能使人类编辑决策产生偏差,凸显了建立防护措施的必要性。
AI能否评估AI科学家?一项使用自动化多模型评审的自主研究生成系统基准测试研究
本文提出了一种使用自动化多模型LLM评审的基准测试协议来评估AI科学家系统,比较了Sakana AI、CycleResearcher和Data-to-Paper等框架,并发现FARS基准论文显著优于其他系统。