Metag:用于构建智能元评审能力的数据集

arXiv cs.LG 论文

摘要

本文介绍了一个名为Metag的数据集,旨在通过识别基于审稿人反馈和作者回复的手稿修改,帮助科学同行评审中的元评审人员,从而提升可追溯性和透明度。

arXiv:2608.20488v1 Announce Type: new 摘要:AI工具在科学研究周期中的支持任务日益增多,从实验设计和稿件准备到同行评审。同时,会议投稿的持续增长增加了元评审人员的负担,他们需要综合审稿反馈、作者反驳和稿件修订。为了解决这一问题,本文介绍了Metag,一个用于加速元评审代理开发的数据集,特别是识别科学文章在评审-反驳过程中的修改。每个实例包含一个审稿人的关切、作者提出的解决方案,以及实施所述更改的稿件差异。Metag的收集方式是获取评审截止日期前和接受后的稿件版本,计算两个文档之间的差异,并请人类标注者将这些差异与OpenReview讨论中的行动项对齐。最终的数据集包含349个与论文差异相关的高质量行动项,将支持构建方法,使元评审人员能够快速识别作者是否已回应审稿人陈述以及这些更改在论文中的位置,从而在整个同行评审过程中增强透明度和可追溯性。该数据集在 https://github.com/microsoft/Metag-dataset 公开可用。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:30

# Metag:一个用于构建元审稿能力的数据集 来源:https://arxiv.org/html/2608.20488 \\workshoptitle AI Native Academia Min ChenDivya TadimetiGemma ZhangAlice LiNigel Boachie KumankumahPavan Uttej RavvaSadid HasanSomya ChatterjeePruthvi Prakash NavadaXiao WangYue KangSulaiman VesalLarry Heck机构:佐治亚理工学院\{anisundar, svesal\}@microsoft\.com, larryheck@gatech\.edu\[0\.5em\] 微软 ###### 摘要 人工智能工具越来越多地支持科学研究周期的各个环节,从实验设计、稿件准备到同行评审。与此同时,会议投稿数量的持续增长增加了元审稿人的负担,他们需要综合审稿人反馈、作者反驳以及稿件修订。为解决此问题,本文介绍了 Metag,一个用于加速开发元审稿智能体的数据集,特别专注于识别科学文章在评审-反驳过程中所做的修改。每个实例包含一个审稿人关切点、作者提出的解决方案,以及实施所述修改的稿件差异。Metag 的收集方法是获取评审截止日期前和接受后的稿件版本,计算两个文档之间的差异,并让人工标注员将这些差异与 OpenReview 讨论中的行动项对齐。最终数据集包含 349 个高质量的行动项,并关联到稿件差异,将有助于构建赋能元审稿人的方法,使其能够快速识别作者是否回应了审稿人意见以及这些修改在稿件中的具体位置,从而在整个同行评审过程中增加透明度和可追溯性。该数据集公开于 https://github.com/microsoft/Metag-dataset。 ## 1 引言 近期工作显示,人工智能工具和助手在撰写和评审科学论文方面的应用日益增多(Liang2024MonitoringAC (https://arxiv.org/html/2608.20488#bib.bib13))。对作者而言,人工智能助手有助于校对论文、改进写作结构以及修正语法错误。类似地,也开发了人工智能工具来协助评审流程。Paper Assistant Tool(icml2026pat (https://arxiv.org/html/2608.20488#bib.bib7)),一个在 ICML 2026 评审过程中引入的人工智能工具,已被部署用于辅助标记问题、突出方法中的错误以及帮助改进论文写作。人工智能工具减轻了实验和评审过程中的认知负担,从而加速了研究周期,并导致顶尖人工智能会议投稿规模的大幅增长(bok2025openreview (https://arxiv.org/html/2608.20488#bib.bib2))。 尽管此类工具的开发主要面向论文作者和审稿人,但一个重要且相对未被充分探索的研究领域是开发辅助元审稿流程的人工智能工具(kuznetsov2024can (https://arxiv.org/html/2608.20488#bib.bib11))。元审稿人必须将大量来自评审意见、反驳和作者讨论的信息综合成一个连贯的陈述。这个过程具有挑战性,因为相关证据分布于冗长、相互关联的文本中,审稿人可能强调不同的关切点,而作者的回复可能描述了修订内容,但并未明确指出这些修订在最终稿件中的位置(kuznetsov2024can (https://arxiv.org/html/2608.20488#bib.bib11))。尽管自然语言处理系统可以协助评审汇总和摘要,但对元审稿人的有效支持需要*可追溯性*:即能够将同行评审中提出的问题与作者所做的具体修改联系起来。 参见说明 图1:Metag 数据收集过程示例及样本数据。 基于审稿人指出的行动项和在提交后创建最终版稿件所做的修改(绿色高亮),任务是提取与这些行动项相关的具体差异。这种可追溯性可以提高评审-反驳过程的透明度和问责性。它可以帮助元审稿人和程序委员会成员核实承诺的修订是否已实施,区分实质性更改与不相关的编辑,并检查作者回复所依据的稿件证据。现有工具可以识别 PDF 不同版本之间的文本差异(ssibb\_pdf\_diff\_viewer (https://arxiv.org/html/2608.20488#bib.bib17)),但它们通常不能解释每个更改是由哪个审稿人行动项驱动的。因此,自动链接稿件差异与审稿人关切点代表了文档比较领域一个重要且未充分探索的延伸。 为支持针对此问题的研究,本文介绍了一种数据收集方法,并发布了 Metag 数据集,该数据集将从审稿人-作者对话中提取的行动项与原始和修订科学论文之间的相应变更联系起来。Metag 旨在支持开发智能体人机协同系统,协助元审稿人导航修订过程,通过核实作者陈述并将判断基于稿件证据。图1 (https://arxiv.org/html/2608.20488#S1.F1) 提供了数据集的一个示例,给定 OpenReview 上评审的行动项,任务是找出实现审稿人要求的具体更改。Metag 通过计算已接受论文提交评审前的 arXiv 版本与其最终版之间的差异构建,然后通过审稿人-作者对话将特定编辑与引发它们的审稿人评论联系起来。该过程生成了一个配对编辑和评论的数据集,将审稿人反馈与解决这些反馈的具体稿件更改连接起来。该数据集公开于 https://github.com/microsoft/Metag-dataset,采用 CDLA\-2\.0 许可证(111https://cdla.dev/permissive-2-0/)。 ## 2 相关工作 ##### 不涉及文档修改的科学评审。 几个数据集研究不涉及建模作者如何修改稿件的科学同行评审。cPAPERS(sundar2024cpapers (https://arxiv.org/html/2608.20488#bib.bib18))和 SciDQA(singh\-etal\-2024\-scidqa (https://arxiv.org/html/2608.20488#bib.bib16))支持基于科学论文及其 OpenReview 讨论的问答,而 ORSUM(zeng2024scientific (https://arxiv.org/html/2608.20488#bib.bib24))则专注于科学观点摘要。"修订与重投"(kuznetsov\-etal\-2022\-revise (https://arxiv.org/html/2608.20488#bib.bib12))引入了对评审句子的语用标记,并通过明确的章节引用和嵌入相似性将审稿人建议与稿件章节联系起来。这些资源捕获了评审的内容、意图或组织,但未能将审稿人的请求与稿件版本间观察到的变化对齐。类似地,Friction(10\.1145/3706598\.3714316 (https://arxiv.org/html/2608.20488#bib.bib25))使用大语言模型为新手作者识别反馈,并呈现了一个指示可能需要修改段落的热图。尽管它支持反馈驱动的写作,但未对源于科学同行评审的修改进行建模。 ##### 不涉及科学评审的文档编辑。 一个互补的研究方向独立于同行评审研究迭代文档修订。arXivEdits(jiang2022arxivedits (https://arxiv.org/html/2608.20488#bib.bib8))提供了一个计算框架,用于在文档、句子和词汇层面提取 arXiv 版本之间的更改。它们还对编辑意图进行了分类,从而能够分析进行修订的原因。IteraTeR(du\-etal\-2022\-understanding\-iterative (https://arxiv.org/html/2608.20488#bib.bib4))收集了来自 arXiv、Wikipedia 和 Wikinews 的编辑,并引入了编辑意图分类,但不包含促使科学修订的审稿人反馈。TETRA(mita2024towards (https://arxiv.org/html/2608.20488#bib.bib14))也涉及文档修订,使用的是专业编辑产生的编辑,而非响应科学同行评审所做的更改。这些数据集对变化的内容建模,但通常无法将这些更改与审稿人关切或作者承诺联系起来。 ##### 科学评审与文档编辑。 与 Metag 最相关的工作是 ARIES(darcy\-etal\-2024\-aries (https://arxiv.org/html/2608.20488#bib.bib3)),它将审稿人评论与科学稿件的修订对齐。ARIES 依赖标注员识别可操作的审稿人评论,并直接将其与相关文本片段对齐。相比之下,Metag 首先计算原始和修订 PDF 之间的结构化差异,然后让标注员选择实现从审稿人-作者对话中提取的每个行动项的差异。这种表述保留了插入、删除、替换、页面位置和周围上下文,同时将任务框定为从完整的稿件更改集合中选择相关编辑。更广泛地说,kuznetsov2024can (https://arxiv.org/html/2608.20488#bib.bib11) 提供了同行评审流程中自然语言处理研究的全面分类,包括联合分析稿件、评审意见和审稿人-作者讨论的方法。Metag 通过特别关注评审对话与可观测稿件修订之间的可追溯性,补充了这一文献。该领域不同相关数据集的比较见表1 (https://arxiv.org/html/2608.20488#S2.T1)。 表1:针对迭代编辑和科学评审的不同数据集比较。 \# 样本数 = 经人工标注员验证的样本数量。 ## 3 方法 ### 3\.1 数据集收集 Metag 通过利用 OpenReview 上的评审-反驳过程进行收集。审稿人和作者之间的来回对话产生了关于论文所做更改及其背后原因的丰富记录。Metag 的收集过程包括六个阶段:(1)论文和评审抓取,(2)PDF 获取,(3)PDF 差异计算,(4)行动项提取,(5)人工标注和过滤,(6)标注员间一致性及数据集组装。每个阶段在下面详细描述,并由图2 (https://arxiv.org/html/2608.20488#S3.F2) 示例说明。 参见说明 图2:显示生成 Metag 数据集各个步骤的框图。(1)抓取 OpenReview 以获取提交。(2)然后将提交提供给 Semantic Scholar 以获取相应的 arXiv 提交前 PDF。(3)计算两个版本之间的差异。(4)同时从评审中提取行动项,并(5)与行动项配对以生成 Metag 的最终版本。 #### 3\.1\.1 阶段1:论文和评审抓取 使用 OpenReview API(222https://docs.openreview.net)获取目标会议 ICLR 2024 的所有提交,符合 OpenReview 服务条款(333https://openreview.net/legal/terms)。虽然 Metag 专门关注 ICLR,但该过程可以扩展到任何在 OpenReview 上发布评审的会议。Metag 仅限于那些审稿人评论在论文最终版中得到回应的工作。因此,从所有提交的集合中只保留被接受的论文,因为最终版的存在是有保证的。对于每篇被接受的论文,通过遍历以每个官方评审笔记(Official\_Review)为根的回复树,递归收集每个官方评论回复(Official\_Comment),并按时间顺序排列所得讨论串,提取完整的审稿人-作者对话。然后,每个对话串被存储为一个结构化记录,包含初始评审、作者和审稿人后续评论的序列以及匿名审稿人标识符。 #### 3\.1\.2 阶段2:PDF 获取 下一阶段是获取评审-反驳过程前后的 PDF。由于 OpenReview 未提供提交时的论文版本,只提供最终版,因此首先在 arXiv(444https://arxiv.org/)上检查每篇论文的存在。然而,OpenReview 和 arXiv 不提供交叉引用,且作为独立系统运行。因此,使用 Semantic Scholar(fricke2018semantic (https://arxiv.org/html/2608.20488#bib.bib5); kinney2025semanticscholaropendata (https://arxiv.org/html/2608.20488#bib.bib10))将 OpenReview 论文与其 arXiv 预印本链接。Semantic Scholar 按标题索引论文,并公开会议录用信息和 arXiv ID(如果存在)。该过程首先从 OpenReview 获取最终版论文。记录 PDF 和提交时间戳创建日期(cdate)。然后,用论文标题查询 Semantic Scholar。通过返回标题与查询标题之间的归一化莱文斯坦距离(normalized Levenshtein distance)验证匹配。如果最佳结果距离超过5%,则拒绝搜索结果并丢弃该论文。从 Semantic Scholar 返回的结果中解析出论文的 arXiv 标识符。使用 arXiv API,获取论文的所有版本。将每个版本的 arXiv 上传日期与 OpenReview cdate 进行比较,只保留提交日期当天或之前最新的上传版本,以确保下载的版本最接近评审时的版本,不包括提交后的更新。作为安全措施,排除无法获取版本历史的论文。所有下载和查询均采用指数退避重试逻辑以遵守速率限制。 1\{ 2"paper\_id":"xBfQZWeDRH", 3"action\_item":\{ 4"comment":"训练加速的度量是基于训练轮次的数目...", 5"response":"我们已修订稿件以更明确地解释此比较。" 6\}, 7"all\_diffs":\[ 8\{ 9"diff\_index":0, 10"tag":"replace", 11"old":"OriginalTitleHere", 12"new":"PUBLISHEDATICLR2024ORIGINALTITLE" 13\}, 14\{ 15"...":"省略了差异1\-\-440" 16\}, 17\{ 18"diff\_index":441, 19"tag":"replace", 20"old":"inthetrainingprocedure,", 21"new":"\(64vs\.256epochs\),", 22"page":6 23\}, 24\{ 25"...":"省略了差异442\-\-1066" 26\} 27\], 28"labels":\[ 29false,"...",true,"...",false 30\], 31"relevant\_diff\_indices":\[441\] 32\} 列表1:简化的差异分类实例。省略号表示省略的候选项。 #### 3\.1\.3 PDF 差异计算 下一步是计算提交给会议的 PDF 与提交后版本之间的差异。为了获得差异,遵循 PDF\-Diff 仓库(ssibb\_pdf\_diff\_viewer (https://arxiv.org/html/2608.20488#bib.bib17))在两个 PDF 之间计算结构化差异。差异(diff)是一个连续的文本级更改,表示文档两个版本之间的差异,识别添加、删除、替换或移动的内容(opengroup\_diff (https://arxiv.org/html/2608.20488#bib.bib21))。首先,使用 PyMuPDF(pymupdf (https://arxiv.org/html/2608.20488#bib.bib1))解析两个 PDF,然后使用 Git 的直方图差异算法(555https://git\-scm\.com/docs/diff\-options\.html\#Documentation/diff\-options\.txt \- \- \-histogram)获取差异。差异提取器在文本块级别操作,生成一个编辑列表,每个编辑标记为插入(insert)、删除(delete)或替换(replace),并包含原始和修订的文本片段、其周围上下文、页码和词汇级边界框。结果是论文原始版本和修改版本之间的差异列表,示例见列表1 (https://arxiv.org/html/2608.20488#LST1)。 #### 3\.1\.4 行动项提取 审稿人-作者对话通常讨论论文的多个方面。除了指出需要改进的领域,审稿人通常会就相关方面提出澄清问题...

相似文章

代理审核系统基准测试

arXiv cs.AI

本文对用于同行评审的代理审核系统进行基准测试,评估了开源和专有系统在研究论文上的表现。最佳配置实现了83.0%的成对准确率,并捕获了71.6%的注入错误,但用户反馈强调了误报和吹毛求疵的问题。

迈向自动化科学评审:谷歌的Paper Assistant Tool

Hugging Face Daily Papers

本文介绍了论文助手工具(PAT),这是一种用于深度科学评审的代理型AI框架,利用推理缩放技术识别数学错误及其他缺陷,在召回率上比零样本方法提升了34%。在STOC和ICML的试点部署表明,它能够在提交前捕捉关键错误,减轻人类审稿人的负担。