通过语言与符号表示之间的模态切换进行空间推理
摘要
本文探讨了将多跳文本-空间故事嵌入到几何感知模态(如网格)中的方法,展示了从纯语言推理切换到基于网格的推理时性能提升42%,并引入了一种用于LLM模态选择的切换度量。
查看缓存全文
缓存时间: 2026/07/01 05:37
# 通过语言与符号表示之间的模态切换实现空间推理
来源:https://arxiv.org/html/2606.31285
Shreya Rajpal Tanawan Premsri Parisa Kordjamshidi
计算机科学与工程系
密歇根州立大学
密歇根州,美国
\{rajpalsh, premsrit, kordjams\}@msu\.edu
###### 摘要
人类推理本质上是多模态的:当问题变得困难时,我们很少仅用语言思考。我们常常通过画草图或绘制网格来外化推理过程,以理解底层概念结构并避免错误。基于这一前提,我们的研究探讨:(a) 将多跳文本空间故事 grounding 到几何感知模态(如布局或网格)是否比基于自然语言的推理更能提升推理效果;(b) 模型是否能决定何时依赖自然语言推理,何时切换到结构化模态。我们通过引入一个基于可信度和复杂性信号的切换度量来解答这些问题,该度量估计了何时将空间故事 grounding 到结构中更有可能提升性能。这为大型语言模型(LLM)推理中的原则性模态选择迈出了第一步。在我们的多个设置中,从基于自然语言的推理切换到基于网格的表示,LLM 性能提升了高达 42%,凸显了模态选择对推理结果的重要性。
---
# 通过语言与符号表示之间的模态切换实现空间推理
Shreya Rajpal Tanawan Premsri Parisa Kordjamshidi
计算机科学与工程系
密歇根州立大学
密歇根州,美国
\{rajpalsh, premsrit, kordjams\}@msu\.edu
## 1 引言
空间推理在众多研究领域中变得越来越重要,包括自动驾驶、导航和机器人技术(Zhou et al., 2024 (https://arxiv.org/html/2606.31285#bib.bib39); Zhang et al., 2024 (https://arxiv.org/html/2606.31285#bib.bib37); Song et al., 2025 (https://arxiv.org/html/2606.31285#bib.bib30))。然而,LLM 在空间推理中仍存在显著局限,尤其是在空间上下文变得复杂时(Liu et al., 2025a (https://arxiv.org/html/2606.31285#bib.bib13))。这类任务要求模型在组合多个关系的同时,保持对实体间相对位置的一致理解。在多跳设置中,这些关系更难跟踪,导致错误累积和空间解释不一致(Shi et al., 2022 (https://arxiv.org/html/2606.31285#bib.bib29); Premsri and Kordjamshidi, 2025 (https://arxiv.org/html/2606.31285#bib.bib24))。即使强大的 LLM,在 StepGame(Shi et al., 2022 (https://arxiv.org/html/2606.31285#bib.bib29))、SpartQA(Mirzaee et al., 2021 (https://arxiv.org/html/2606.31285#bib.bib19))和 ReSQ(Mirzaee and Kordjamshidi, 2022 (https://arxiv.org/html/2606.31285#bib.bib17))等基准测试中,如果没有专门的提示或逐步推理轨迹,也表现不佳(Mirzaee and Kordjamshidi, 2023 (https://arxiv.org/html/2606.31285#bib.bib18); Rizvi et al., 2024 (https://arxiv.org/html/2606.31285#bib.bib27); Zhang et al., 2026 (https://arxiv.org/html/2606.31285#bib.bib35))。然而,这些方法仍然主要依赖自然语言推理,迫使模型隐含地从文本中推断几何和布局。这与人类推理形成对比。对于复杂的空间描述,人们常常使用草图、图表或网格将场景外化为简化的结构,而不是仅靠语言推理(Larkin and Simon, 1987 (https://arxiv.org/html/2606.31285#bib.bib10); Rexigel et al., 2024 (https://arxiv.org/html/2606.31285#bib.bib26))。这反映了图示化的思想,使空间结构更容易被感知和推理(Talmy, 2003 (https://arxiv.org/html/2606.31285#bib.bib31))。类似地,图1 (https://arxiv.org/html/2606.31285#S1.F1) 显示,基于自然语言的 LLM 推理必须隐式地跨多个步骤跟踪关系,这可能导致幻觉关系或多跳错误(Rizvi et al., 2024 (https://arxiv.org/html/2606.31285#bib.bib27)),而网格使结构显式化。这引出了一个核心问题:显式的空间表示能否成为语言模型比自然语言更有效的推理媒介?

图1:多跳空间设置中的自然语言与网格推理对比。
为了研究这一点,我们比较了直接基于自然语言故事推理与使用不同推理模态的效果。这里,*模态*指的是用于推理的空间故事的文本表示形式。这些替代方案显式编码了场景的空间结构,包括提取的关系三元组和基于布局的形式。¹¹代码可在以下地址获取:https://github.com/HLR/Spatial-Modality-Switching
如图1 (https://arxiv.org/html/2606.31285#S1.F1) 中的示例所示,显式结构(例如网格布局)可以为多跳空间推理提供比纯文本更有效的媒介。基于这一直觉,我们提出了一种网格 grounding 框架,通过编码实体间的空间关系,将空间故事转换为显式的二维网格。然后将生成的网格反馈给语言模型,用于多跳空间问答。然而,使用结构化表示进行推理并非总是必要;在某些情况下,根据模型能力和问题复杂度,基于自然语言的推理可能就足够了。为了应对这些挑战,我们引入了一个切换度量,用于估计模型何时应依赖自然语言,何时应使用结构化空间表示。该度量结合了每个实例的可信度和复杂性信号,从而实现原则性的模态选择,而不是用固定模态进行推理。在多个空间推理基准测试中,我们的框架大幅提升了准确率:在 StepGame 上提升高达 42%(Li et al., 2024 (https://arxiv.org/html/2606.31285#bib.bib11)),在 SpaRTUN 上提升 8%(Mirzaee and Kordjamshidi, 2022 (https://arxiv.org/html/2606.31285#bib.bib17)),在 ReSQ 上提升 5%(Mirzaee and Kordjamshidi, 2022 (https://arxiv.org/html/2606.31285#bib.bib17))。这些结果凸显了将可视化和结构化符号表示不仅仅视为输出,而是视为推理媒介的重要性。
总之,我们的贡献是:(1) 我们研究了将推理模态从自然语言切换到显式空间结构是否有助于提升多跳空间推理。我们还引入了一个基于网格的 grounding 框架,将空间故事转换为结构化二维布局用于推理。(2) 我们提出了一个自适应切换框架,利用可信度和复杂性信号来决定模型何时应使用自然语言推理,何时应切换到结构化表示,从而向 LLM 推理中的原则性模态选择迈出了一步。
## 2 相关工作
近期研究表明,语言模型在 StepGame(Shi et al., 2022 (https://arxiv.org/html/2606.31285#bib.bib29); Li et al., 2024 (https://arxiv.org/html/2606.31285#bib.bib11))、SpartQA(Mirzaee et al., 2021 (https://arxiv.org/html/2606.31285#bib.bib19))、SpaRTUN(Mirzaee and Kordjamshidi, 2022 (https://arxiv.org/html/2606.31285#bib.bib17))、ReSQ(Mirzaee and Kordjamshidi, 2022 (https://arxiv.org/html/2606.31285#bib.bib17))和 SpaRP(Rizvi et al., 2024 (https://arxiv.org/html/2606.31285#bib.bib27))等基准测试的多跳空间推理中表现挣扎。即使是 GPT-4 这样的强大模型,在空间推理中也显得脆弱,经常出现基本推理错误,并且无法可靠地组合空间关系(Cohn, 2023 (https://arxiv.org/html/2606.31285#bib.bib3); Cohn and Hernandez-Orallo, 2023 (https://arxiv.org/html/2606.31285#bib.bib4); Rizvi et al., 2024 (https://arxiv.org/html/2606.31285#bib.bib27))。先前的工作通过两大方向来解决这些失败。一条工作线是将外部符号或结构化推理组件整合到空间推理中,例如将基于 LLM 的关系提取与 Answer Set Programming(Yang et al., 2023 (https://arxiv.org/html/2606.31285#bib.bib33); Kaur et al., 2025 (https://arxiv.org/html/2606.31285#bib.bib8); Wang and Sun, 2026 (https://arxiv.org/html/2606.31285#bib.bib32))或 Prolog(Mirzaee and Kordjamshidi, 2023 (https://arxiv.org/html/2606.31285#bib.bib18))结合,在微调时施加逻辑约束(Premsri and Kordjamshidi, 2025 (https://arxiv.org/html/2606.31285#bib.bib24)),或使用图神经网络建模多步空间依赖(Li et al., 2023 (https://arxiv.org/html/2606.31285#bib.bib12); Zhou et al., 2025 (https://arxiv.org/html/2606.31285#bib.bib38))。这些方法通常需要额外的训练或外部求解器来提升空间推理。相比之下,我们研究的是提供给语言模型本身的表示如何影响推理时的空间推理。
一条更接近的工作线是研究当中间推理以不同方式表示时,空间推理是否会得到改善。思维树提示探索多跳空间推理的多条推理路径(Li et al., 2024 (https://arxiv.org/html/2606.31285#bib.bib11)),而 Chain-of-Symbol(Hu et al., 2024 (https://arxiv.org/html/2606.31285#bib.bib7))和基于坐标的表示(Liu et al., 2025b (https://arxiv.org/html/2606.31285#bib.bib14))表明符号或量化表示可以改善空间推理。我们的工作与此方向一致,但比较了多种推理表示,包括自然语言、关系三元组和坐标布局,并引入了网格 grounding 作为 LLM 推理的几何保持表示。
最后,为了更有效地使用计算密集型推理策略,近期工作探索了自适应推理方法,仅在需要时分配额外的推理。DOTS(Yue et al., 2025 (https://arxiv.org/html/2606.31285#bib.bib34))、Route-to-Reason(Pan et al., 2025 (https://arxiv.org/html/2606.31285#bib.bib23))、AdaptThink(Zhang et al., 2025 (https://arxiv.org/html/2606.31285#bib.bib36))、Thinkless(Fang et al., 2026 (https://arxiv.org/html/2606.31285#bib.bib6))、AdaCoT(Lou et al., 2025 (https://arxiv.org/html/2606.31285#bib.bib16))和 RouteLLM(Ong et al., 2025 (https://arxiv.org/html/2606.31285#bib.bib20))等方法根据任务难度、置信度或预期效用选择推理深度或跨模型路由。CodeSteer(Chen et al., 2025 (https://arxiv.org/html/2606.31285#bib.bib2))类似地引导 LLM 在文本和代码生成之间切换以处理符号任务。这些工作为自适应推理提供了重要先例,但主要将切换框架化为在模型、推理深度或生成模式之间进行路由。相比之下,我们的工作研究的是在空间表示层面进行无需训练的切换,利用可信度和复杂性信号来决定何时使用自然语言推理,何时切换到显式几何保持表示(如网格)。
## 3 方法

图2:将图1中的同一个故事和问题映射到四种推理模态:(i) 关系三元组、(ii) 完整网格、(iii) 剪枝网格、(iv) 基于坐标的表示。每种模态都被用作同一问题的推理媒介。

图3:所提出管道和切换机制的概述,输入与图1中的故事和问题相同。
##### 问题定义:我们考虑一个空间问答任务。给定一个空间叙事 \(SS\) 和一个问题 \(QQ\),模型通过推断两个或多个实体之间的空间关系来回答问题。答案可以是“是/否”形式,也可以是来自固定空间关系集合(如 `left` 和 `above`)的多类标签。这是一个具有挑战性的问题,因为实体之间的关系可能是隐式的,模型通常需要跨多个关系进行推理才能推断出正确答案。为了解决这个问题,我们假设根据上下文,某些模态可能比自然语言更有效地简化推理。图1 (https://arxiv.org/html/2606.31285#S1.F1) 通过一个多跳故事说明了这一点:要推断 \(G\) 和 \(N\) 之间的关系,需要在文本中跟踪多个中间实体,这可能很复杂,而网格使相关关系更加清晰。因此,我们设计了一个框架来分析输入和模型输出,并在需要时在文本和结构化模态之间进行切换。整体管道如图3 (https://arxiv.org/html/2606.31285#S3.F3) 所示。它有两个主要组件:(i) 评估问题复杂性和模型可信度;(ii) 将叙事转换为替代的推理模态。评估模块识别基于自然语言推理不可靠或叙事过于复杂的情况,并触发切换到结构化模态。基于此管道,我们研究了关系三元组、基于坐标的布局和网格作为推理的替代表示,并探讨从基于自然语言的推理切换到合适的结构化模态如何影响模型性能。接下来我们描述推理模态和切换策略。
### 3.1 映射到多种推理模态
我们将每个空间叙事和问题转换为多种推理模态,包括定性和定量的空间表示。定性表示捕捉符号关系,例如相对方向或包含关系,而定量表示通过基于坐标的布局使空间排列显式化。基于网格的表示介于两者之间,将实体组织在离散的行列布局中。每种模态随后被独立用于推理。图2 (https://arxiv.org/html/2606.31285#S3.F2) 展示了我们框架中考虑的模态,讨论如下。
1. **原始文本**:这是基线,模型直接以自然语言形式对原始故事、问题和选项进行推理。
2. **关系三元组**:对于此模态,我们使用少样本上下文学习从故事中提取成对空间关系,形如 `{头实体, 关系, 尾实体}` 的三元组。当句子包含多个关系或需要共指消解时,此过程将叙事转换为定性空间表示。例如,从 "a medium purple object is inside and touching block H" 中,我们提取 `{头实体: medium purple object, 关系: tangential-proper-part, 尾实体: block H}`。这些三元组包括方向关系,如 `left`、`right`、`above` 和 `below`,以及拓扑关系,如 `disconnected`、`externally connected`、`partially overlapping`、`equal`、`tangential proper part`、`non-tangential proper part`、`tangential proper part inverse`、`non-tangential proper part inverse`(必要时)(Kordjamshidi et al., 2010 (https://arxiv.org/html/2606.31285#bib.bib9))。如图2 (https://arxiv.org/html/2606.31285#S3.F2)(i) 所示,模型接收带有问题的关系三元组并推断最终答案。
3. **网格**:对于此模态,我们将提取的空间关系映射到二维网格中,在满足方向和拓扑约束的同时为实体分配相对位置。拓扑关系用紧凑标签编码,例如 `#dc` 表示 `disconnected`。我们使用 Python 程序生成网格,该程序具有预定义的重相似文章
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。
视觉语言模型真的能进行视觉推理吗?模态差距的严格研究
本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。
LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents
This paper proposes a modality transfer task for Large Multimodal Models (LMMs) in GIS workflows and finds that current OpenAI LMMs struggle to transfer spatial information between image and text modalities, highlighting a critical bottleneck for autonomous GIS agents.
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。
视觉具象化推理
本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。