MentalThink:在Mental SVG World中塑造思维

arXiv cs.AI 论文

摘要

MentalThink 引入了一种视觉-符号推理范式,用于多模态大语言模型(MLLMs),该范式使用SVG代码作为中间视觉表示进行多轮推理。通过SFT和RL的两阶段训练,在空间推理基准上取得了出色表现。

arXiv:2607.03530v1 Announce Type: new 我们引入了 MentalThink,一种视觉-符号推理范式,它为多模态大语言模型(MLLMs)配备了一种可执行的“心理”可视化机制。MentalThink 的核心是一个 think-with-SVG 管道,其中模型学习生成、渲染和解释可缩放矢量图形(SVG)代码,作为多轮推理的中间视觉表示。通过创建结构化的矢量草图,模型可以将空间假设外化,通过确定性渲染进行检查,并在受限的几何空间中进行推理,从而有效模仿人类的心理意象过程。我们通过一个两阶段训练框架实例化该范式,结合用于 SVG 语法对齐的监督微调(SFT)与多轮强化学习(RL),以鼓励对中间视觉假设进行迭代检查、修订和完善。大量评估表明,MentalThink 在空间理解和推理基准上取得了卓越性能(例如,在 VSIBench 上为 55.1%,在 MindCube 上为 76.0%),表明可执行矢量图形为动态视角获取、视觉反思和组合场景构建提供了可验证的视觉工作空间。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:35

# MentalThink:在思维SVG世界中塑造思维 来源:https://arxiv.org/html/2607.03530 Jisheng Yin Dingming Li En Yu Yana Wei Han Zhou Liang Zhao Hongyu Zhou Hongbo Peng Jianjian Sun Zheng Ge Xiangyu Zhang Daxin Jiang Jingyu Wang ###### 摘要 我们引入 **MentalThink**,这是一种视觉-符号推理范式,为多模态大语言模型(MLLMs)配备了一种可执行的“心智”可视化机制。MentalThink 的核心是一个 **think-with-SVG** 流水线,其中模型学习生成、渲染和解释**可缩放矢量图形(SVG)** 代码,作为多轮推理的中间视觉表示。通过创建结构化的矢量草图,模型可以外化空间假设,通过确定性渲染检查它们,并在受限的几何空间内进行推理,从而有效模拟人类心理意象的过程。我们通过一个两阶段训练框架实例化这一范式,将 SVG 语法对齐的监督微调(SFT)与多轮强化学习(RL)相结合,鼓励对中间视觉假设进行迭代检查、修正和优化。大量评估表明,MentalThink 在空间理解和推理基准测试中取得了优越的性能(例如,在 VSIBench 上达到 55.1%,在 MindCube 上达到 76.0%),表明可执行矢量图形为动态视角转换、视觉反思和组合场景构建提供了一个可验证的视觉工作空间。 空间推理、多模态大语言模型、视觉推理、心理意象、可缩放矢量图形、思维链、测试时扩展 参见图1:不同思维范式的概念对比。 ## 1 引言 > “灵魂没有心理意象就无法思考。” —— 亚里士多德《论灵魂》 人类的推理能力远不止于语言符号的操作(Dinneen, 1995 (https://arxiv.org/html/2607.03530#bib.bib6))。认知过程通常涉及**心理意象**(Kosslyn, 1980 (https://arxiv.org/html/2607.03530#bib.bib17)),个体在此构建并操纵**心智模型**(Johnson-Laird, 1983 (https://arxiv.org/html/2607.03530#bib.bib16))以理解复杂关系、规划行动和解决问题(Shepard & Metzler, 1971 (https://arxiv.org/html/2607.03530#bib.bib36))。这种认知能力充当了一个动态的可视化剪贴板,使我们能够模拟场景、转换视角,并将抽象概念扎根于**准物理**空间中。这种形式的视觉思维是人类认知的一个关键方面,也是人工智能(AI)的一个有前景的前沿领域。 近期,大语言模型(LLMs)的进展通过展现结构化认知行为的长上下文语言痕迹,展示了强大的心智推理能力(Liu et al., 2025b (https://arxiv.org/html/2607.03530#bib.bib25); Wei et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib43); Gandhi et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib9))。多模态大语言模型(MLLMs)(Guo et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib10); Hong et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib12); Wei et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib43))探索了多种机制将视觉输入融入推理;然而,现有范式不可避免地存在根本性的权衡。以语言为中心的方法(Wei et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib43); Huang et al., 2026 (https://arxiv.org/html/2607.03530#bib.bib14))通过扩展思维链(CoT)(Wei et al., 2022 (https://arxiv.org/html/2607.03530#bib.bib42))依赖文本描述。尽管灵活,这些方法通常缺乏**视觉基础**:缺乏结构化的空间表示,文本推理容易偏离几何现实,导致语义上看似合理但视觉上不真实的幻觉(Liu et al., 2025a (https://arxiv.org/html/2607.03530#bib.bib24); Li et al., 2026 (https://arxiv.org/html/2607.03530#bib.bib21))。相反,利用显式布局表示(例如2D/3D边界框、认知地图(Yin et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib54)))或外部工具(Zhang et al., 2025b (https://arxiv.org/html/2607.03530#bib.bib61))的方法试图缓解这一问题。然而,这些策略要么将丰富的视觉场景简化为稀疏的几何基元,要么将视觉想象卸载到不相交的外部模块,从而损害了基于语言推理固有的符号灵活性和通用性。 这引出一个自然问题:**一种推理模式能否在保留语言符号优势的同时,扎根于视觉结构?** 我们认为**可缩放矢量图形(SVG)** 是一个引人注目的解决方案。首先,作为一种**结构化的视觉语言**,它提供了视觉布局的**完整且组合的表示**,封装了对象几何和空间层次结构。因此,生成有效的矢量命令需要真正的结构理解,超越了纯文本生成中常见的表面模式匹配。其次,由于其本质上是**基于代码的**,这种表示天然地与LLMs的架构对齐。由于模型在大型文本语料库和标记或编程语言(例如HTML/XML)上进行了广泛的预训练,它们可以轻松地重用现有的层次和组合先验(Han et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib11))来操作以代码形式表达的视觉元素。 为此,我们引入**MentalThink**,一种新颖的推理范式,使多模态LLM能够通过显式且可解释的心理意象进行视觉思考。MentalThink 的核心采用了 **think-with-SVG** 流水线(图1 (https://arxiv.org/html/2607.03530#S0.F1)(d)),其中模型生成SVG作为其内部视觉推理的中间表示。我们通过一个渐进的两阶段训练框架来实现这一范式。 (1) 在第一阶段,我们在一个精选的 **think-with-SVG** 数据集上进行监督微调(SFT),教模型将抽象推理外化为结构化的SVG表示。 (2) 在第二阶段,我们应用多轮强化学习(RL)来优化推理过程本身,鼓励模型迭代地检查、修正和校正其中间视觉假设。 通过全面评估,MentalThink 在空间理解和推理基准测试中取得了优越的性能(例如,在 VSIBench(Yang et al., 2025b (https://arxiv.org/html/2607.03530#bib.bib50))上达到55.1%,在 MindCube(Yin et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib54))上达到76.0%)。除了原始准确率,我们的定性分析揭示,think-with-SVG 引发了难以用纯语言复制的复杂空间推理模式,包括动态视角转换、反思性视觉优化和组合场景构建。这些发现表明,think-with-SVG 构成了一种有前景的范式,通过显式的心理意象增强了模型认知,为多模态推理提供了一种高效且可验证的抽象。 ## 2 相关工作 **思维链(CoT)推理。** CoT提示的发展标志着从LLMs中引出复杂推理的一个重要里程碑(Wei et al., 2022 (https://arxiv.org/html/2607.03530#bib.bib42))。通过指示模型生成一系列中间推理步骤(即思考过程),CoT将棘手的问题转化为一系列可管理的子问题。这种分解充当了认知桥梁,使模型能够在长程中保持逻辑一致性,并减少错误传播的可能性,从而显著提高了需要复杂推理的任务的性能。这种CoT过程通过SFT外部化或内部化(Yue et al., 2023 (https://arxiv.org/html/2607.03530#bib.bib58); Yu et al., 2023b (https://arxiv.org/html/2607.03530#bib.bib57)),并进一步通过RL扩展(OpenAI, 2024 (https://arxiv.org/html/2607.03530#bib.bib28); DeepSeek-AI et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib5)),构建了从测试时计算到性能的线性变换。 CoT的一个自然演進是将其扩展到多模态领域。多模态CoT的开创性工作(Zhao et al., 2023 (https://arxiv.org/html/2607.03530#bib.bib63); Yu et al., 2023a (https://arxiv.org/html/2607.03530#bib.bib55); Zhang et al., 2023 (https://arxiv.org/html/2607.03530#bib.bib62); Wei et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib43); Meng et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib27); Xiaomi & Team, 2025 (https://arxiv.org/html/2607.03530#bib.bib47))表明,当被提示或自我探索生成交织文本解释与视觉特征的推理过程时,MLLMs在复杂的多模态推理任务上能取得显著更好的结果。然而,这些方法在很大程度上仍是**以语言为中心的**,推理过程依赖于对视觉内容的文本描述。这种方法通常缺乏**视觉基础**:没有结构化的空间表示,模型的文本推理很容易偏离图像的实际几何现实,导致语义上合理但视觉上错误的幻觉(Liu et al., 2025a (https://arxiv.org/html/2607.03530#bib.bib24))。此外,与可以执行和验证的基于代码的推理不同,纯文本缺乏严格自验证的机制。 **Think-with-Image。** 为解决以语言为中心的推理的限制,近期一些方法(Hu et al., 2024 (https://arxiv.org/html/2607.03530#bib.bib13); Wu & Xie, 2024 (https://arxiv.org/html/2607.03530#bib.bib46); OpenAI, 2025 (https://arxiv.org/html/2607.03530#bib.bib29))提出了“think-with-image”。一种策略是利用SFT或RL技术,使模型能够调用外部工具进行图像操作,例如放大/缩小(Sarch et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib34); Zheng et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib64))或生成辅助视觉(Chern et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib3); Qin et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib31)),作为中间推理步骤。然而,这种方法的实用性通常受限于外部工具的刚性API,这破坏了推理链的端到端可微性。另一种策略专注于内部视觉表示,例如生成**认知地图**(Yin et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib54))或**边界框布局**(Li et al., 2025a (https://arxiv.org/html/2607.03530#bib.bib19); Yang et al., 2025e (https://arxiv.org/html/2607.03530#bib.bib53))来显式建模空间关系。虽然这些方法改进了定位,但它们常常将复杂的视觉细节过度简化为稀疏的基元(例如,框),从而丢失了详细推理所需的精细形状信息。在这项工作中,我们提出了一种新颖的“think-with-SVG”流水线。通过生成一种结构化、机器可读的格式,这种格式本质上是视觉的且组合精确,我们弥合了抽象符号推理与具体视觉基础之间的鸿沟,而无需依赖黑盒外部工具。 **LLM和MLLM中的SVG。** 传统上,LLM语境下的可缩放矢量图形(SVG)主要被用作**生成目标**(Xing et al., 2024 (https://arxiv.org/html/2607.03530#bib.bib48))或评估空间理解的**基准**(Yang et al., 2025d (https://arxiv.org/html/2607.03530#bib.bib52))。近期工作探索了利用LLMs生成SVG代码以创建图标、图表和艺术设计(Rodriguez et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib33); Xing et al., 2024 (https://arxiv.org/html/2607.03530#bib.bib48)),或使用SVG渲染任务来评估模型关于空间坐标的代码生成能力(Wu & Xie, 2024 (https://arxiv.org/html/2607.03530#bib.bib46))。然而,这些方法将SVG视为最终输出,即思维过程的“结果”,而非思维本身的媒介。据我们所知,**MentalThink**是第一个利用SVG作为**中间推理模态**的工作,使模型能够为复杂的多模态任务构建、检查和优化“心理草图”以指导其决策过程。 参见图2:Think-with-SVG 流水线。MentalThink 训练 MLLMs 在多轮思考过程中原生地使用 SVG 代码来渲染“心理图像”,并借助 SVG 环境,实现对复杂问题求解的更先进、更有效的推理能力。 ## 3 Think-with-SVG 推理框架 ### 3.1 预备知识:多模态 CoT 基于近期的理论基础(Zhang et al., 2025a (https://arxiv.org/html/2607.03530#bib.bib59); Chen et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib2); Gan et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib8)),我们首先建立思维链推理范式(Wei et al., 2022 (https://arxiv.org/html/2607.03530#bib.bib42))的正式定义,该范式将问题求解结构化为一系列中间、人类可读的步骤。 **定义 3.1(思维链状态)。** 给定查询 $q \in \mathcal{Q}$ 和一个中间推理步骤序列 $\xi = \{\xi_1, \xi_2, ..., \xi_t\}$,我们将CoT状态定义为元组 $s = (q, \xi)$,其中每个 $\xi_i \in \mathcal{L}$ 表示在语言空间 $\mathcal{L}$ 中向解决方案推进的语义单元。 **定义 3.2(推理轨迹)。** 一个长度为 $T$ 的完整推理轨迹 $\tau$ 是一个序列 $\tau = \{s_0, s_1, ..., s_T\}$,其中 $s_0 = (q, \emptyset)$ 表示初始状态,$s_T = (q, \xi, a)$ 包含最终答案 $a \in \mathcal{A}$。 对于多模态推理,我们扩展这些定义: **定义 3.3(多模态思维链)。** 给定一个多模态查询 $(q, \mathbf{v})$,其中 $\mathbf{v} = \{v_1, ..., v_n\} \subset \mathcal{V}$ 表示视觉输入,一个多模态CoT状态为: $$s^{\text{mm}} = (q, \mathbf{v}, \xi^{\text{mm}}) \quad (1)$$ 其中 $\xi^{\text{mm}} = \{\xi_1^{\text{mm}}, ..., \xi_t^{\text{mm}}\}$,且每个 $\xi_i^{\text{mm}} \in \mathcal{L} \times \mathcal{V}$ 可以引用或融入视觉信息。 尽管强大,现有的多模态CoT过程(Hong et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib12); Yang et al., 2025a (https://arxiv.org/html/2607.03530#bib.bib49); Wei et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib43); Zheng et al., 2025 (https://arxiv.org/html/2607.03530#bib.bib64))本质上仍是语言性的。模型将其对视觉数据的解释用语言表达出来,而不是在视觉空间内进行推理。 ### 3.2 Think-with-SVG:一种结构化视觉推理流水线 think-with-SVG 流水线通过用结构化的、视觉-符号表示来替换或增强纯粹的语言思维步骤,重新构想了推理过程。我们现在正式化这一范式,将SVG确立为符号推理与视觉推理之间的结构化桥梁。 **定义 3.4(结构化视觉语言)。** 我们将 SVG 代码空间 $\mathcal{S}$ 定义为一个具有以下属性的结构化视觉语言: $$\mathcal{S} = \{\sigma: \sigma = \langle E, A, H \rangle\} \quad (2)$$ 其中 $E = \{e_1, e_2, ..., e_n\}$...

相似文章

SVoT: 基于强化学习的状态感知思维可视化空间推理

arXiv cs.AI

论文提出了SVoT,一种用于多模态大语言模型(MLLMs)中多跳空间推理的强化学习框架,该框架生成交错、可验证的中间状态和可视化,在涉及多对象交互和数值推理的新基准测试上取得了显著的准确性提升。