ReGround:基于多模态证据的审稿意见定位
摘要
ReGround 是一个大规模数据集,用于将审稿意见定位到科学论文的多模态证据上,揭示了在检索任务中整合文本、表格和图表的重要性和挑战性。
arXiv:2609.11460v1 Announce Type: new
摘要: 审稿意见自然关联到被审论文的特定部分,但由于长篇多模态文档的存在,将这些意见定位到底层证据上非常困难。现有基准测试并未捕捉到这一场景,主要关注显式的、信息查询型问题。我们引入ReGround,一个用于审稿意见定位的大规模数据集,该数据集将10,267条审稿意见链接到3,656篇论文原始匿名提交中的16,274个证据。我们基于一个简单观察:作者反驳通常包含对提交内容的明确引用,以回应审稿意见,这提供了一个高精度的标注源。我们将定位视为一个检索任务,并评估了多种检索方法。结果显示,对整个论文内容的检索效果不佳,证据类型推理是一个主要瓶颈,而多模态证据提供了文本单独无法获取的互补信号。我们的数据集揭示了将审稿意见定位为科学文档理解中一个困难且实际重要的问题。
查看缓存全文
缓存时间: 2026/09/11 08:31
# ReGround:基于多模态证据的审稿意见溯源
来源:https://arxiv.org/html/2609.11460
Serwar Basch
隶属机构:无处不在知识处理实验室(UKP Lab)
计算机科学系与黑森人工智能中心(hessian.AI),达姆施塔特工业大学
Lizhen Qu
Iryna Gurevych
隶属机构:无处不在知识处理实验室(UKP Lab)
计算机科学系与黑森人工智能中心(hessian.AI),达姆施塔特工业大学
###### 摘要
审稿意见天然关联于被审论文的特定部分,但由于多模态长文档的复杂性,将这些意见溯源到底层证据十分困难。现有基准测试并未捕捉这一场景,主要聚焦于显式的、信息查询型的问题。我们引入**ReGround**——一个用于*审稿意见溯源*的大规模数据集,它将10,267条审稿意见与来自3,656篇论文*原始匿名投稿*中的16,274处证据相关联。我们基于一个简单的观察:作者的回应信(Rebuttal)通常包含对投稿中用于回应审稿意见内容的明确引用,这提供了一个高精度的标注来源。我们将溯源任务形式化为检索任务,并评估了多种检索方法。结果显示,对整个论文内容进行检索效果不佳,证据类型推断是主要瓶颈,而多模态证据提供了文本单独无法获取的互补信号。我们的数据集揭示了“审稿意见溯源”是科学文档理解中一个困难且具有实际重要性的问题。
---
代码与数据已开源:
https://github.com/UKPLab/emnlp2026-reground

**图1**:数据集构建流程概览与代表性示例。我们利用作者回应信中明确的论文引用,推导出审稿意见与原始匿名投稿内容之间的高精度关联。
(1) 检测引用了特定论文内容的回应信句子。
(2) 将每个包含引用的回应信句子与其对应的审稿意见段落对齐。
(3) 在提交的PDF中解析引用,提取相应内容,形成审稿意见–论文内容对。
| 数据集 | 标注方法 | 原始投稿 | 多模态 | 证据类型 | 规模 |
|----------------|----------|----------|--------|--------------------|--------------|
| ARIES | 手动 | ✗ | ✗ | 文本段落 | 42篇论文 |
| PeerQA | 手动 | ✗ | ✗ | 句子/段落 | 208篇论文 |
| QASPER² | 手动 | ✗ | ✓ | 段落 | 1585篇论文 |
| F1000RD | 手动 | ✓ | ✗ | 行/段落/章节 | 172篇论文 |
| CLAIMCHECK | 手动 | ✓ | ✗ | 文本段落 | 41篇论文 |
| **本文(Ours)** | **自动** | **✓** | **✓** | **行/章节/图/表** | **3656篇论文** |
**表1**:将查询和同行评审意见与完整稿件内容相关联的数据集比较。
---
## 1 引言
同行评审产生了大量关于科学论文的专家意见,其增长速度之快,以至于顶级人工智能会议已开始在其官方工作流程中部署审稿辅助系统。任何此类系统的核心挑战在于将审稿意见溯源至其所依赖的论文内容:一个方法细节、一个结果表格、一个章节层面的论断,或图表中的一个视觉模式。除了同行评审,这代表了一个更广泛的科学文档问题:将自然、未明确指定的查询溯源到长多模态文档中。挑战是双重的:证据在模态上异质,表现为文本、表格或图表;在粒度上多样,从单行到整个章节。现有资源并不直接支持这一场景(表1)。
科学问答数据集如QASPER和PeerQA聚焦于具有相对明确答案区间的信息查询问题。相比之下,审稿意见往往是评估性的、未明确指定的,并与论文内容隐式关联,如图1所示。基于修订的数据集如ARIES将意见与论文后续版本的修改相关联,而非与原始投稿中的可用证据相关联。最后,针对与原始论文精细关联的资源,如F1000RD和CLAIMCHECK,是手动标注的、规模小且仅限于文本。
我们发现作者回应信是高精度溯源标注的来源。在回应评审时,作者通常明确指向投稿论文的特定部分作为回应、澄清或强调可能被忽视的内容的证据。我们将这些提及称为**论文引用**,被引用的内容称为**证据**。因为回应信讨论的是被审阅的论文,这些引用揭示了审稿意见与原始匿名投稿之间的关联,而非与修订版或最终版的关联。基于此,我们引入了**ReGround**,一个用于将审稿意见溯源至科学论文多模态证据的大规模数据集。ReGround包含3,656篇论文和16,274个审稿意见–证据对,覆盖段落、章节、表格和图表。
我们将溯源形式化为一个检索任务:给定一条审稿意见,目标是检索作者用于回应它的证据。除了同行评审,该数据集还针对与科学问答、事实核查和基于文档的辅助共享的能力:为长论文上的自然语言查询检索多模态证据。我们针对文本和视觉模态,对稀疏、稠密、交叉编码器、基于大语言模型(LLM)和多模态检索器进行了基准测试。我们的发现揭示了溯源问题的几个独特难点:(1) 在异构证据池上进行检索对所有模型家族都很困难,即使最好的基于LLM的排序器也只达到21%的Recall@10;(2) 推断证据类型(段落、章节、图表、表格)是一个主要瓶颈;(3) 模型也难以处理关联到多个证据的意见;(4) 对于图表,视觉和文本信号是互补的,存在显著的模态特定故障模式,这促使我们进行多模态融合而非替代。
---
## 2 相关工作
一系列不断增长的工作引入了同行评审语料库,以研究评审过程及审稿人–作者互动。一些数据集进一步用话语或论证结构标注了审稿–回应交流,如APEC和DISAPERE。虽然这些语料库对于建模评审过程很有价值,但它们在文档级别工作,而我们的工作直接针对审稿意见与论文内容之间的精细关联。
其他相关数据集试图将审稿意见与论文内容关联,但与我们的场景有显著不同。ARIES和Re3R将审稿意见与论文修订对齐,捕捉反馈如何体现在修订后的论文中,而非意见如何与原始投稿关联。PeerQA将审稿人问题重构为文档级问答,并手动标注答案区间,但基于最终版论文且仅限于文本证据。更接近的相关工作,Kuznetsov等人引入了F1000RD数据集,并研究了审稿句子与论文内容之间的隐式关联,强调了将未明确指定的审稿意见溯源至长文档的难度。然而,他们的工作仅限于文本且依赖手动标注。其他工作如CLAIMCHECK和ABCD-Link专注于以主张为中心或句子级别的关联,规模仍然较小。
与我们工作同期,PRISM-Bench汇编了来自ICLR论文的384个审稿人标记的多模态不一致性,作为多项选择基准。相比之下,我们的数据集自动从作者回应信中提取,针对原始投稿,规模扩展到数千篇论文,并覆盖精细的多模态证据。
我们的任务也与科学证据检索和文档级问答相关,在这些任务中,系统必须在长文档中识别支持性证据。先前的基准包括事实核查数据集如SciFact,引用跨度识别,以及针对整篇论文的问答如QASPER。最近的工作已将这些设置扩展到多模态和基于PDF的检索。我们的设置在几个关键方面有所不同:审稿意见是自然发生的而非众包的,通常是评估性的而非信息查询型的;并且图表在回应这些意见中扮演核心角色。通过将审稿意见溯源至原始投稿中的精细、多模态证据,我们的数据集揭示了现有基准未捕捉到的一个具有挑战性且实际重要的检索问题。
---
## 3 数据集构建
### 3.1 任务定义
我们将*审稿意见溯源*形式化为一个检索任务。给定一条审稿意见c,目标是检索*作者引用的证据*:论文中回应、澄清、反驳或提供上下文的内容。我们使用结构化文档表示构建一个候选证据池D={d1,...,dn},这些证据单元提取自同一篇原始投稿。一条审稿意见可能关联于一个或多个单元,因此我们评估单证据和多证据检索。检索是一个自然的框架,因为它是多个下游应用的共同前提。我们进一步针对*隐式*设置,即意见本身不包含对黄金证据的明确引用(例如,“图3”、“第4.2节”、“第120行”),因为此类引用可以通过字符串匹配轻松解决。
#### 证据单元。
检索池包含文本证据单元(段落、章节、图/表标题)和视觉证据单元(图和表图像)。行引用被映射到其包含的段落,因为ACL风格的行号是格式化产物而非语义单元。
### 3.2 数据来源
我们的任务要求原始投稿保留作者和审稿人实际讨论的证据,这与可能基于评审意见进行编辑的修订版或最终版形成对比。为此,我们使用NLPeer的第2版,包含来自EMNLP 24/25、COLING 25、NAACL 25和ACL 25的原始投稿、审稿意见和回应信。
### 3.3 预处理
#### 审稿意见和回应信分段。
我们使用针对科学写作定制的基于规则的分割器将审稿意见和回应信分割成句子。该分割器处理常见的引用模式(如“Fig. 4”、“Sec. 6.6”)和破坏现成工具的列表式格式化。
#### 论文内容提取。
我们解析*原始投稿*PDF,为每篇论文创建结构化文档表示。文本内容在多个层级提取:(i) 带编号的单独行;(ii) 通过章节标题和编号识别的章节级区间;(iii) 图和表标题。由于ACL风格的论文遵循标准化模板,我们使用pypdf进行PDF解析,而非OCR,以确保确定性和一致的结果。然而,由于无法从PDF解析中可靠地重建段落边界,我们使用GROBID来解析段落。最后,我们使用PDFFigures 2.0提取图和表作为图像及其标题。
### 3.4 构建审稿–证据关联
#### 检测论文引用。
我们使用通过在250封回应信随机样本上迭代开发的正则表达式,识别明确引用论文内容的回应句子,并在最终手动检查数据集后进行了细化。正则表达式模式涵盖对行、章节、表格、图表、附录、方程式、页面和脚注的引用。
#### 对齐回应信与审稿意见。
作者通常引用或索引他们正在回应的审稿意见(例如,“W1”、“Q5”)。利用这些线索,我们使用一个大语言模型(gpt-oss-120b)将每个包含引用的回应句子对齐到其对应的审稿意见。当一条回应涉及多个审稿段落时,我们将它们连接起来。手动评估对齐质量的详细信息见第3.6节。
#### 解析论文引用。
我们针对结构化文档表示解析每个检测到的论文引用。行引用映射到包含它们的段落,章节引用通过编号和标题匹配,图/表引用通过索引匹配并链接到其标题和提取的图像。
### 3.5 过滤
从回应信中提取的原始关联包含三种噪声源,我们通过连续过滤器移除它们。首先,作者经常逐字引用审稿人文本,这可能触发误报引用检测;我们丢弃与审稿意见重叠的回应句子(使用模糊字符串匹配,约20%的句子)。其次,为了聚焦于隐式设置,如果审稿意见已经引用了回应信中引用的相同论文内容,溯源将通过字符串匹配变得可以轻松解决,因此我们丢弃此类配对(约18%的配对)。第三,我们提示gpt-oss-120b移除作者引用的证据实际上不在原始投稿中的配对,即 (i) 承诺的最终版更改,(ii) 回应信中引入的新实验,或 (iii) 来自外部论文的内容(约23%的配对);我们在第3.6节手动验证了这一步骤。
| 统计量 | 值 |
|----------------------------|--------|
| 论文数 | 3656 |
| 审稿意见(查询) | 10267 |
| 论文引用(证据) | 16274 |
| 唯一论文引用 | 13391 |
| 每篇论文平均查询数 | 2.81 |
| 每个查询平均证据数 | 1.58 |
| ≥2个证据的查询比例 | 25.77% |
**表2**:摘要统计信息。相似文章
RefCaptioner:多参考图像 grounded 视频字幕生成
介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。
M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准
本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。
视觉具象化推理
本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。
当眼见不为实:交互式视觉定位在LVLMs中的基准测试
本文介绍了一个用于大型视觉语言模型(LVLMs)中交互式视觉定位的受控评估框架,表明当前LVLMs的表现低于人类基线,并在主动问题驱动定位方面存在困难。
GRASP:在多人物非语言交互中建立社交推理的根基
GRASP是一个大规模数据集,用于多人物视频中的社交推理,将高层次社交问题与细粒度的注视和手势事件联系起来,并引入了社交基础奖励(Social Grounding Reward)以提升多模态模型的理解能力。