VAMPS:视觉辅助数学问题求解基准
摘要
VAMPS 是一个包含 1,168 道多模态双语数学题的新基准,旨在评估 LLM 能否通过构建图形/可视化并对其进行推理来提升解题能力。核心发现:即便在绘图本是自然解题策略的问题上,直接分析求解的表现也出人意料地优于借助工具进行可视化求解。
查看缓存全文
缓存时间: 2026/06/05 02:05
# VAMPS:视觉辅助数学问题求解基准 来源:https://arxiv.org/html/2606.04244 Shayan Vassef\*Mohammadreza Bakhtiari\*Yasamin Medghalchi\*Ilker HacihalilogluMesrob OhannessianLele WangGiuseppe Carenini ###### 摘要 多模态大语言模型在复杂推理方面的能力日益增强,但当它们需要借助工具将问题外化、并对工具输出进行推理时——尤其是依赖可视化辅助手段时——性能往往会下降。这一差距尤为重要,因为真实的工程和科学工作流程通常依赖可视化工具进行分析、验证和决策。为研究这一问题,我们提出了 VAMPS(*视觉辅助数学问题求解*),一个面向图形辅助数学的基准。VAMPS 包含 1,168 个多模态、双语多项选择问答对,这些问答对来源于伊朗大学入学考试的代数和微积分题目,并通过人工审核的 LLM 生成合成变体加以扩充。所有题目均经过筛选,确保绘图是自然的求解策略,能够直观揭示交点、极值、渐近线等关键信息。VAMPS 兼顾基准测试与诊断功能,超越了此前主要评估固定视觉输入推理能力的多模态基准,专门测试模型能否通过*构建*有用图形并将答案*锚定*于所生成的可视化结果来解决问题。总体而言,我们发现在各类模型中,直接分析求解的表现意外地优于工具辅助的视觉求解——即便在绘图是自然策略的题目上也是如此。 ## 1 引言 近期大语言模型(LLMs)在直接从文本求解数学问题方面展现出强大能力,通常通过生成符号推导、分解中间步骤或将精确计算委托给类代码表示来实现\[16 (https://arxiv.org/html/2606.04244#bib.bib16),10 (https://arxiv.org/html/2606.04244#bib.bib10),18 (https://arxiv.org/html/2606.04244#bib.bib18)\]。这些进展甚至延伸到了极具挑战性的奥林匹克竞赛级别问题\[30 (https://arxiv.org/html/2606.04244#bib.bib30)\]。然而,现实世界的科学和工程工作流程不仅仅依赖文本分析。在实践中,科学工作流程本质上是多模态且迭代的,涉及计算、仿真、可视化和解释的综合运用。专家依靠这种相互配合来验证假设、改进模型并做出明智决策\[7 (https://arxiv.org/html/2606.04244#bib.bib7),22 (https://arxiv.org/html/2606.04244#bib.bib22),44 (https://arxiv.org/html/2606.04244#bib.bib44),6 (https://arxiv.org/html/2606.04244#bib.bib6)\]。 受这一差距的启发,近期研究探索了将推理能力从 LLMs 扩展到视觉-语言模型(VLMs)和多模态大语言模型(MLLMs)。在 LLMs 中,基于强化学习的微调显著提升了推理能力,这种方法鼓励结构化的多步骤问题求解。然而,在多模态场景下复现这一成功的尝试大多未能奏效\[50 (https://arxiv.org/html/2606.04244#bib.bib50),26 (https://arxiv.org/html/2606.04244#bib.bib26)\]。现有许多方法在本质上仍以文本为驱动:图像仅在初始阶段被处理,随后的推理完全以文本形式进行,缺乏中间视觉推理步骤。 为解决这一局限,Visual Sketchpad\[20 (https://arxiv.org/html/2606.04244#bib.bib20)\]和 Refocus\[15 (https://arxiv.org/html/2606.04244#bib.bib15)\]等近期推理框架在推理过程中引入了中间视觉推理,并在多模态任务上展现出性能提升。这些方法表明,推理不必完全停留于文字层面;中间视觉表示可以作为证据,引导和验证后续决策。这一视角在数学领域尤为自然——代数表示与图形表示的协调配合被广泛认为是学习函数和方程的基础\[23 (https://arxiv.org/html/2606.04244#bib.bib23),12 (https://arxiv.org/html/2606.04244#bib.bib12)\]。 在代数问题求解中,这种协调往往借助外部可视化工具实现。图形计算器允许求解者将符号表达式转化为图像,检查交点、单调性、极值、渐近线、反函数关系和相对大小,然后利用这些视觉线索引导最终答案。因此,图形辅助数学推理不仅仅是符号求解或解读给定图像。模型必须决定应绘制什么、将意图传达给工具、检查所生成的可视化结果,并将视觉证据整合到最终决策中。 尽管如此,现有数学基准仍主要在纯文本场景或提供静态视觉输入的条件下评估模型。因此,它们无法全面测试图形辅助问题求解所需的完整*推理到感知的交接*过程:模型必须将问题转化为信息丰富的图形,然后通过视觉读取所生成的图形来找到答案。这引出了一个核心问题:现代模型真的能从方程到图形的转化中获益吗?而正是这种转化使得绘图对人类求解者如此有用。 基于这一动机,我们提出了 VAMPS,一个以伊朗大学入学考试111[Konkour](https://en.wikipedia.org/wiki/Iranian_University_Entrance_Exam)数学题目(代数和微积分)为核心的基准。VAMPS 包含 1,168 个多模态多项选择问答对。基准的核心由 218 道真实题目构成,每道题均提供波斯语(法尔西语)原文及人工审校的英文译文,共计 436 个原始问题实例。我们进一步以真实题目为种子,通过 LLM 辅助生成合成多模态变体,并经人工审核加以扩充。据我们所知,VAMPS 是首个专为评估外部绘图工具视觉推理能力而设计的波斯语-英语双语基准。 至关重要的是,这些问题经过精心筛选,使得绘图往往是自然的——在许多情况下也是更优的——求解策略,因此该基准非常适合评估模型能否在数学推理过程中构建并利用视觉证据。在本研究中,我们使用 Desmos\[11 (https://arxiv.org/html/2606.04244#bib.bib11)\]作为生成视觉表示的绘图工具。Desmos 天然支持函数绘图和视觉分析,同时能生成可审计的工件——包括表达式、图形和截图——可供事后检查。这使得我们能够对最终答案准确性和中间工具使用行为进行细粒度评估:模型是否请求了恰当的图形、是否正确解读了所生成的图形,以及是否利用视觉证据选择了正确答案。 这一框架引出了一个简单但重要的实证问题:访问绘图工具能否可靠地提升模型性能?对于人类求解者而言,视觉检查往往能厘清难以通过符号追踪的关系。然而对于当前模型来说,图形界面也可能暴露新的失败模式,包括错误的图形构建、不完整的工具使用、对视觉线索的误解,或无法将图形证据整合到最终答案中。VAMPS 旨在测试外部视觉工具在实践中是否真正对模型有所帮助,或者推理到感知的交接对于当前系统来说是否仍是瓶颈。 综上所述,我们的主要**贡献**如下: \(1\) 我们提出了 VAMPS,据我们所知,这是首个面向智能体模型评估的波斯语-英语数学基准,包含 1,168 个多模态问答对。 \(2\) 我们将*推理到感知的交接*形式化为工具辅助代数推理的核心瓶颈,并提供了一个分析框架,用以理解即便在可视化看似公平、有意义且有帮助的情况下,视觉工具使用仍可能损害性能的原因。 \(3\) 我们报告了跨互补求解模式的双语基准结果,直接比较了纯文本分析基线、工具辅助视觉求解和提供可视化的探针方法。 ## 2 相关工作 **面向数学推理的智能体与工具增强方法。** 基于 LLMs 的数学推理研究已远超将其作为独立文本生成器的范畴。一系列研究通过将精确执行委托给外部运行时来提升数学性能。PAL 将文字题转化为可执行代码,将精确计算交由解释器完成\[16 (https://arxiv.org/html/2606.04244#bib.bib16)\]。Program of Thoughts Prompting 通过显式分离推理与计算进一步强化了这一分解\[10 (https://arxiv.org/html/2606.04244#bib.bib10)\]。ToRA 将这一思路扩展为更具智能体特征的形式,模型在多步骤轨迹中交替进行自然语言推理和工具使用\[18 (https://arxiv.org/html/2606.04244#bib.bib18)\]。在这一研究路线中,工具之所以有价值,是因为它们有助于保持严谨性:外部接口返回的是符号、数值或可执行结构,而非需要解读的视觉输出。 另一研究路线采用紧密结合的神经符号系统来攻克更难的数学领域。AlphaGeometry 和 AlphaGeometry 2 将学习得到的提议机制与符号推演相结合,以求解高难度几何题\[43 (https://arxiv.org/html/2606.04244#bib.bib43),1 (https://arxiv.org/html/2606.04244#bib.bib1)\]。同样,Inter-GPS、GeoQA 和 UniGeo 表明,多模态几何可以从显式符号程序以及几何计算与证明的统一序列生成视角中受益\[28 (https://arxiv.org/html/2606.04244#bib.bib28),8 (https://arxiv.org/html/2606.04244#bib.bib8),9 (https://arxiv.org/html/2606.04244#bib.bib9)\]。这些系统是 VAMPS 的重要对照案例。它们的最大收益来自于维持或恢复形式化结构。而 VAMPS 研究的是外部工具*不*返回证明对象、程序或符号状态的场景——它返回的是必须通过视觉解读的图形。这一区别对于我们更广泛地思考工具调用具有重要意义。 Toolformer 和 ReAct 确立了如今已成标准的观点:工具使用通过启用外部动作、执行和检索来扩展模型能力\[41 (https://arxiv.org/html/2606.04244#bib.bib41),47 (https://arxiv.org/html/2606.04244#bib.bib47)\]。然而,大量基准文献此后表明,工具调用也会产生新的失败面:模型必须选择正确的工具、构造有效参数、追踪状态、从糟糕的中间输出中恢复,并在多轮交互中保持稳定\[24 (https://arxiv.org/html/2606.04244#bib.bib24),39 (https://arxiv.org/html/2606.04244#bib.bib39),27 (https://arxiv.org/html/2606.04244#bib.bib27),48 (https://arxiv.org/html/2606.04244#bib.bib48),25 (https://arxiv.org/html/2606.04244#bib.bib25),34 (https://arxiv.org/html/2606.04244#bib.bib34)\]。VAMPS 继承了所有这些困难,并额外增加了一项:工具输出是一张图像,其决定性内容可能十分微妙。 参见图1:现有数学基准的对比,涵盖是否提供视觉输入、是否面向图形相关数学、是否需要自主生成图形、是否具有智能体工具循环等维度。 VAMPS 的设定还与近期关于视觉草稿板和图解推理的研究相关联。Hsu 等人研究了 LLMs 是否能从生成和读取图解抽象中受益\[19 (https://arxiv.org/html/2606.04244#bib.bib19)\]。VAMPS 支持类似的探究,但更为系统,且以绘图为核心。 **视觉与多模态数学基准数据集。** 视觉数学领域的基准格局如今已相当广泛,但高度异质。部分数据集专注于合成图表或图形阅读,如 FigureQA、PlotQA 和 ChartQA\[21 (https://arxiv.org/html/2606.04244#bib.bib21),33 (https://arxiv.org/html/2606.04244#bib.bib33),31 (https://arxiv.org/html/2606.04244#bib.bib31)\]。这些资源对于探究图形和图表上的感知能力颇具价值,但通常在固定图像上评估模型,而非基于自主生成的视觉证据。另一类基准专注于几何图形和多模态数学程序,包括 Geometry3K、GeoQA 和 UniGeo\[28 (https://arxiv.org/html/2606.04244#bib.bib28),8 (https://arxiv.org/html/2606.04244#bib.bib8),9 (https://arxiv.org/html/2606.04244#bib.bib9)\]。这些基准更强调几何和形式推理流程,而非视觉辅助决策。 近期多模态数学基准进一步扩展了范围。MathVista 将 28 个已有多模态数据集与三个新数据集——IQTest、FunctionQA 和 PaperQA——整合为一个大型视觉上下文数学推理基准\[29 (https://arxiv.org/html/2606.04244#bib.bib29)\]。VCBench 聚焦于显式视觉依赖性,其多图像数学问题的设计使得决定性信息分布在所提供的视觉材料中,而非仅凭文本可以还原\[46 (https://arxiv.org/html/2606.04244#bib.bib46)\]。MV-MATH 进一步朝向交错多视觉场景发展,数学证据分散在多张协调图像中\[45 (https://arxiv.org/html/2606.04244#bib.bib45)\]。MathVerse 通过将每道题改写为多个版本来加强模态控制,各版本在文本与视觉信息的比重上有所不同\[49 (https://arxiv.org/html/2606.04244#bib.bib49)\]。GRAB 直接面向图形分析,包含关于图表属性、变换和真实图形变体的问题\[40 (https://arxiv.org/html/2606.04244#bib.bib40)\]。总体而言,这些数据集表明,即便对于强大的多模态 LLMs,视觉数学推理仍具有相当挑战性。然而,它们大多仍将图像视为*给定的*输入。 VAMPS 在数据来源和评估协议上均有所不同。它以真实的 Konkour 题目为基础,而非仅依赖合成图形或大量改编的教科书风格题集,并以双语形式发布。最重要的是,它评估的是多轮智能体场景——模型必须自主生成图形、检查图形,并根据该工件做出视觉驱动的回答。这使得 VAMPS 既是一个视觉数学推理基准,也是一个智能体工具使用基准。图1 (https://arxiv.org/html/2606.04244#S2.F1)给出了 VAMPS 相对于此前数学基准系列的整体定位;附录中的表6 (https://arxiv.org/html/2606.04244#A7.T6)提供了更为全面的对比。 ## 3 VAMPS 基准 ### 3\.1 数据创建 VAMPS 以来自连续八年考试(2016-2023)的 218 道 Konkour 题目为基础。Konkour 数学部分每年包含 140 道题,初始候选题库共计 1,120 道题。题库涵盖多个难度等级,而非仅限于高度程式化或纯合成的题目。我们对题库中的每道题进行了人工审查,仅保留符合基准范围的题目——即如图2 (https://arxiv.org/html/2606.04244#S3.F2)(右)所示,绘图是自然且有效求解策略的题目——最终保留了 218 道核心题目。 对于每道保留的题目,我们保留波斯语原文,使用 GPT-5.4\[38 (https://arxiv.org/html/2606.04244#bib.bib38)\]生成英文译文,并在第二轮中人工审核译文、选项忠实度和答案正确性。这一经过验证的真实种子……
相似文章
TableVista:在视觉和结构复杂性下对多模态表格推理进行基准测试
介绍了 TableVista,这是一个全面的基准测试,用于评估基础模型在视觉和结构复杂性下的多模态表格推理能力,包含 3,000 个问题,扩展为 30,000 个多模态样本。对 29 个模型的评估显示,在复杂布局和仅视觉设置下性能有所下降。
MathNet:一个面向数学推理与检索的全球多模态基准
# 论文页面 - MathNet:一个面向数学推理与检索的全球多模态基准 来源:[https://huggingface.co/papers/2604.18584](https://huggingface.co/papers/2604.18584) ## 摘要 MathNet 是一个大规模、多语言、多模态的奥赛级数学问题数据集,旨在评估生成式模型和基于嵌入的系统中的数学推理与检索能力。数学问题解决对于大型语言和多模态模型而言仍是一项极具挑战性的推理测试。
OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。
VLM是通过自适应测试时优化进行视频推理的优秀教师
本文提出一种新范式:视觉-语言模型(VLM)作为测试时教师,通过可微分奖励和LoRA优化引导视频生成模型(VGM),在视频推理基准测试上平均提升16.7个百分点。
VLMs 是否像工程师一样推理?一个基准与分阶段评估
本文介绍了 EngVQA,一个用于评估视觉语言模型工程推理能力的多模态基准,以及一个 8 阶段自动评估框架,能够对推理失败进行细粒度分析。它揭示了当前 VLMs 在工程推理能力上的重大局限性。