ToolSciVer: 基于视觉工具增强强化学习的多模态科学声明验证

arXiv cs.CL 论文

摘要

本文介绍了ToolSciVer,这是首个面向多模态科学声明验证(MSCV)的工具增强框架。该框架为视觉语言模型(VLM)配备了类型感知的视觉工具,并使用GRPO训练策略,在SciVer和MuSciClaims数据集上,跨多个模型家族实现了卓越性能。

arXiv:2607.16131v1 公告类型:新 摘要:多模态科学声明验证(MSCV)要求模型利用论文中的视觉证据(包括图形、表格、图表和文本上下文)来验证科学声明。然而,现有方法往往因难以定位关键视觉证据、准确读取结构化科学视觉内容以及将多模态观测整合到可靠推理中而失败。我们提出了ToolSciVer,据我们所知,这是首个用于MSCV的工具增强框架。ToolSciVer为视觉语言模型配备了三种类型感知的视觉工具:表格行列聚焦、图表结构解析和高分辨率区域放大,这些工具将密集的科学视觉内容转换为明确的、面向声明的证据,并通过组相对策略优化(GRPO)在包含答案正确性、格式有效性、长度控制、工具使用效率和工具有效性惩罚的复合奖励下训练策略。在来自三个模型家族(Qwen、InternVL、Gemma)的五个视觉语言模型上,对SciVer和MuSciClaims数据集的实验表明,与包括基于提示和基于强化学习的工具使用方法在内的四个竞争基线相比,我们的方法取得了更优的性能,突显了学习型、类型感知工具使用在科学声明验证中的有效性。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:37

# ToolSciVer:基于视觉工具增强强化学习的多模态科学声明验证
来源:https://arxiv.org/html/2607.16131
周炳林¹ 施鹏² 镰井亮¹ 张楠¹ 张睿¹
¹宾夕法尼亚州立大学
²滑铁卢大学
\{bbz5169, rmz5227\}@psu\.edu

###### 摘要

多模态科学声明验证(MSCV)要求模型利用论文中以视觉为基础的证据(包括图形、表格、图表及文本上下文)来验证科学声明。然而,现有方法通常失败,因为它们难以定位决定性的视觉证据,准确读取结构化科学视觉内容,并将多模态观察整合到可靠的推理中。我们提出了 ToolSciVer,据我们所知,这是首个用于 MSCV 的工具增强框架。ToolSciVer 为一个 VLM 配备了三种类型感知的视觉工具:表格行/列聚焦、图表到结构解析以及高分辨率区域缩放。这些工具将密集的科学视觉内容转换为明确的、面向声明的证据,并使用组相对策略优化(GRPO)在包含答案正确性、格式有效性、长度控制、工具使用效率和工具使用有效性惩罚的复合奖励下训练策略。在来自三个模型家族(Qwen、InternVL、Gemma)的五个 VLM 上,针对 SciVer 和 MuSciClaims 数据集的实验表明,我们的方法相比四种竞争基线(包括基于提示和基于 RL 的工具使用方法)取得了优越的性能,凸显了学习到的、类型感知的工具使用对科学声明验证的有效性。¹ 代码可在 https://github.com/psunlpgroup/Tool-Sciver 获取。

## 1 引言

多模态科学声明验证(MSCV)对于构建可信的科学信息系统至关重要[29, 13]。在 MSCV 中,模型需要判断某个声明是否被跨越文本描述和科学视觉内容的证据支持或反驳。与传统的文本事实验证[24, 26, 28, 27, 1]不同,MSCV 要求通过解决两个关键挑战来整合不同结构的异质模态:提取局部化的、结构化的视觉证据,以及对该证据进行多步骤推理以验证声明。

尽管兴趣日益增长,但现有的 MSCV 方法在应对这些挑战方面仍然有限。最近的研究强调,前沿的专有模型(如 GPT、Claude 和 Gemini)在正确验证依赖于对表格、图表和图形的精确视觉解释时仍然困难重重[29, 13, 6, 7]。它们通常无法定位正确的视觉证据,并且难以通过可靠的、有依据的多步骤推理来跨模态聚合信息[13, 29, 7]。与此同时,虽然最近的工具增强 VLM 提出了用于聚焦或提取视觉状态的外部视觉操作[4, 34, 22],但这些方法是为通用领域的视觉问答而开发的,依赖于一系列狭窄的图像编辑操作(例如裁剪、缩放、高亮),因此不适合 MSCV 所需的、针对声明条件的证据定位以及跨科学表格、图表和多面板图形的跨图聚合。我们在表 1 中总结了它们的局限性。

参见图注
图 1:ToolSciVer 框架概述,用于基于证据的工具增强科学声明验证。给定一个声明、文本上下文和科学视觉证据,模型可以直接回答或迭代地调用类型感知的视觉工具来获取与声明相关的证据。收集到的工具观测结果被添加到增强上下文中,并用于最终的声明验证。

在本文中,我们引入了 ToolSciVer,一个用于 MSCV 的类型感知工具增强强化学习框架。为了解决上述挑战,ToolSciVer 相比先前工作包含两项主要创新:(1) 我们设计了一套专门处理科学论文中复杂多模态证据的工具,(2) 我们提出使用强化学习结合多种奖励来训练模型,以高效使用这些工具并对提取的证据进行多步骤推理。具体来说,如图 1 所示,我们的框架为一个 VLM 配备了三种专门工具,与科学证据中最常见的视觉类型相匹配:基于 OCR 的表格聚焦工具(Table Focus),返回表格中局部化的行或列证据;图表解析工具(Chart Parse),将图表和曲线图转换为结构化文本观测;区域缩放工具(Region Zoom),返回适用于通用或多面板图形的高分辨率裁剪区域。此外,有效使用这些工具要求模型共同决定是否需要工具、哪种工具匹配视觉类型、哪些参数能识别相关证据,以及如何将返回的观测结果整合到其判断中。因此,我们使用组相对策略优化(GRPO)[21] 来训练模型,以学习选择性、有效且可靠的工具使用。我们的奖励结合了最终答案正确性、输出格式有效性、长度控制、工具使用效率以及针对格式错误或失败工具交互的惩罚,鼓励模型仅在需要时获取正确的视觉证据。

为了展示我们方法的有效性,我们在两个近期具有挑战性的 MSCV 基准测试上进行了全面实验:SciVer[29] 和 MuSciClaims[13],它们包含需要验证的复杂声明,具有多样的证据模态、科学子领域和推理结构。我们将 ToolSciVer 应用于三个基础模型家族(Qwen、InternVL、Gemma),并与四个竞争基线进行比较:无工具的 CoT 推理、仅提示的工具使用 CoT 推理,以及两种基于 RL 的多模态工具使用基线 VTool-R1[34] 和 OpenThinkIMG[22]。在两个基准测试中,ToolSciVer 都一致优于无工具 CoT 推理和仅提示的工具访问方法,并且在整体性能上强于基于 RL 的工具使用基线。我们的进一步分析和消融实验表明,我们的方法通过促进更准确的视觉证据定位、更合适的工具选择以及在表格、图表和通用科学图形上对提取证据的更可靠推理来提升性能。

我们的贡献总结如下:

- • 我们从视觉证据提取的角度研究多模态科学声明验证,并识别出观察阶段的视觉证据获取是一个关键瓶颈。
- • 我们提出了 ToolSciVer,据我们所知,这是第一个用于 MSCV 的视觉工具增强框架。它包含一套类型感知的视觉工具,能够暴露多模态、与声明相关的科学证据,并通过强化学习训练以实现选择性、有效且高效的工具使用。
- • 我们在多个科学领域和推理难度下的挑战性 MSCV 基准测试上,实证验证了 ToolSciVer 的有效性,在不同于强工具使用基线的多个基础模型家族上达到了最先进的性能。

## 2 相关工作

#### 面向声明的视觉证据工具

| 方法 | 目标任务 | 表格证据 | 图表证据 | 区域检查 | 结构化观测 | 学习 | 效率奖励 |
|---|---|---|---|---|---|---|---|
| VisProg[5] | 通用视觉推理 | ✗ | ✗ | ○ | ✗ | 无需训练 | ✗ |
| ViperGPT[23] | 通用视觉推理 | ✗ | ✗ | ○ | ✗ | 无需训练 | ✗ |
| MM-ReAct[35] | 通用多模态推理 | ✗ | ✗ | ○ | ✗ | 提示 | ✗ |
| Visual Sketchpad[8] | 视觉/数学推理 | ✗ | ✗ | ○ | ✗ | 提示 | ✗ |
| ReFocus[4] | 结构化图像理解 | ○ | ○ | ○ | ✗ | 提示/监督 | ✗ |
| DePlot/MatCha[14,15] | 图表理解 | ✗ | ✓ | ✗ | ✓ | 监督/预训练 | ✗ |
| VTool-R1[34] | 结构化视觉推理 | ○ | ○ | ○ | ✗ | RL | ✗ |
| OpenThinkIMG[22] | 图表/工具推理 | ✗ | ○ | ○ | ✗ | RL | ✗ |
| ToolSciVer(我们的) | MSCV | ✓ | ✓ | ✓ | ✓ | RL | ✓ |

表 1:ToolSciVer 与代表性的工具增强和视觉推理方法的比较。✓ 表示针对相应视觉类型有专门的面向声明的证据提取器或解析器;○ 表示通过视觉编辑、草图、裁剪/缩放、OCR 或基于代码的视觉工具提供部分或通用支持,没有专门的科学证据提取器;✗ 表示没有明确支持。“结构化观测”指可直接用作验证证据的结构化观测结果,如表格行/列或图表值,而非原始 OCR 文本、边界框或编辑后的图像。

#### 科学和多模态声明验证。

声明验证通常被形式化为基于证据的预测,系统检索证据并预测其是否支持或反驳声明。在科学领域,SciFact 及后续工作研究了针对论文摘要、全文上下文、开放域检索和基于 LLM 的零样本设置的验证[26, 28, 27, 1]。科学表格验证进一步表明,关于科学证据的声明需要基于证据的、组合式的推理以及对歧义的谨慎处理[16]。最近的基准将这一方向扩展到多模态证据:SciVer 评估对科学文档的多模态科学声明验证,而 MuSciClaims 则侧重于以图形为中心的科学声明[29, 13]。相关工作还研究了多跳多模态声明、对视觉和文本表格表示的验证以及统一的多模态事实验证[30, 37, 12]。最近的跨模态科学验证研究还表明,当前的多模态模型在基于表格、图表和图形的证据上仍然薄弱[6, 7]。我们的工作建立在这些基准之上,但聚焦于错误背后的机制:在做出最终验证决策之前获取与声明相关的视觉证据。

#### 从结构化科学视觉中提取视觉证据。

结构化视觉理解已针对表格、图表、曲线图和文档类图像进行了研究。对于表格证据,TabFact、SciTab 和 M2-TabFact 表明基于表格的验证需要准确的基于证据的推理和组合推理[2, 16, 37]。对于图表和曲线图,ChartQA 强调对图表内容的视觉和逻辑推理,而 DePlot 和 MatCha 则展示了通过图到表转换或图表反渲染将图表转换为显式中间表示的价值[17, 14, 15]。这些工作激发了我们对结构化证据的使用,但固定的 OCR、解析或裁剪本身并不能决定是否需要工具、调用哪个工具,或者哪一行、列、图表元素或区域与声明相关。因此,我们将视觉证据提取视为学习到的验证策略的一部分,而不是固定的预处理步骤。

#### 工具增强 VLM 和强化学习。

工具使用在语言模型中已被广泛研究。ReAct 通过提示将推理和行动交织在一起,而 Toolformer 则从自监督信号中学习 API 使用[36, 20]。视觉编程和工具使用系统(如 VISPROG、ViperGPT 和 MM-ReAct)调用外部视觉模块或生成可执行程序,无需针对特定任务进行训练[5, 23, 35]。Visual Sketchpad 和 ReFocus 进一步表明,中间视觉操作可以暴露聚焦的视觉状态,用于多模态推理[8, 4]。与我们最接近的是 VTool-R1 和 OpenThinkIMG,它们通过强化学习训练 VLM 使用视觉工具[34, 22],而更广泛的工具学习工作则强调奖励设计、执行可靠性和行动效率[18, 9, 31]。与这些通用的视觉工具使用设置不同,我们的方法专门针对 MSCV:工具按科学视觉类型组织,其输出是面向声明的证据,而 GRPO 训练鼓励选择性、有效且高效的工具使用以进行科学验证。

## 3 我们的方法

### 3.1 任务形式化

我们研究多模态科学声明验证(MSCV),即模型使用文本上下文和科学视觉证据验证科学声明。每个实例记为 x = (q, V, t),其中 q 是声明,V = {v_i}_{i=1}^N 是相关科学视觉集合,t 表示可选的文本上下文,如图注、周围段落或基准元数据。模型输出归一化预测 ŷ,位于基准标签空间中。在我们的实验中,两个基准测试均被视为二分类验证,Y = {supported, refuted}。

### 3.2 框架概述

MSCV 的关键挑战在于,决定性的证据通常是视觉上局部化且结构上受约束的,要求模型读取特定的表格条目、恢复图表趋势或检查密集科学图形的局部区域。因此,我们将 MSCV 形式化为一个证据获取问题,并提出 ToolSciVer,一个工具增强框架,在做出最终验证决策之前选择性提取与声明相关的视觉证据。

如图 1 所示,给定一个声明、文本上下文和科学视觉证据,模型可以直接回答(无工具),或迭代地调用类型感知的视觉工具来获取与声明相关的证据。收集到的工具观测结果被添加到增强上下文中,并用于最终的声明验证。我们的框架包含三个专门工具:(1) 基于 OCR 的表格聚焦工具(TableFocus);(2) 图表解析工具(ChartParse),将图表转换为结构化文本;(3) 区域缩放工具(RegionZoom),返回高分辨率裁剪区域。这些工具的输出被设计为明确的、面向声明的证据,以便模型可以直接使用它们进行推理。工具调用由模型通过强化学习训练的策略控制,以决定何时以及如何调用工具。

相似文章

SVoT: 基于强化学习的状态感知思维可视化空间推理

arXiv cs.AI

论文提出了SVoT,一种用于多模态大语言模型(MLLMs)中多跳空间推理的强化学习框架,该框架生成交错、可验证的中间状态和可视化,在涉及多对象交互和数值推理的新基准测试上取得了显著的准确性提升。