SpatialSpeak:基于问答原生重建与局部和全局上下文的空间链式思考推理

Hugging Face Daily Papers 论文

摘要

SpatialSpeak 引入了一个两阶段框架,用于视觉语言模型中的空间推理,使用问答原生重建预训练和空间链式思考学习,以在基准测试中实现最先进的性能。

视觉语言模型(VLMs)可以从几何先验中受益,用于多视图空间推理,但仅答案训练并不直接监督中间几何估计及其在推导定量空间答案中的使用。我们假设,当VLM首先通过多视图重建联合学习互补的局部几何和全局场景上下文时,空间链式思考(CoT)监督会变得更有效。我们引入SpatialSpeak,一个将问答原生重建预训练与空间链式思考学习连接起来的两阶段框架。在第一阶段,问答原生重建预训练(QA-RP)结合了标记点3D查询用于细粒度局部几何,和对象中心查询用于跨视图的全局场景上下文。这两个任务都基于文本的问答形式化,允许几何估计和后续推理共享相同的自回归输出接口。在第二阶段,带视觉补偿的空间链式思考(CoT-VC)训练模型表达问题相关的几何估计并使用它们推导答案,通过可靠性评估和视觉补偿在需要时支持答案细化。在ReVSI上,QA-RP将CoT-VC的增益从2.6提高到6.9分,消融实验表明局部和全局重建监督都是有益的。SpatialSpeak在ReVSI、VSI-Bench和SPAR-Bench上取得了最先进的结果,ReVSI得分为62.8,超过最强的比较基线8.7分。
查看原文
查看缓存全文

缓存时间: 2026/09/29 04:11

论文页面 - SpatialSpeak:基于局部与全局上下文的质问原生重建实现空间链式推理

来源:https://huggingface.co/papers/2609.33616

摘要

视觉-语言模型(VLMs)可以从几何先验中受益于多视角空间推理,但仅基于答案的训练并不直接监督中间几何估计及其在推导定量空间答案中的应用。我们假设,当VLM首先通过多视角重建联合学习互补的局部几何和全局场景上下文时,空间链式推理(CoT)的监督将变得更加有效。我们提出SpatialSpeak,一个将质问原生重建预训练与空间CoT学习相结合的两阶段框架。在第一阶段,质问原生重建预训练(QA-RP)结合了用于细粒度局部几何的标记点3D查询和用于跨视角全局场景上下文的对象中心查询。两项任务均被表述为基于文本的问答,允许几何估计和后续推理共享相同的自回归输出接口。在第二阶段,带有视觉补偿的链式推理(CoT-VC)训练模型表达与问题相关的几何估计,并使用它们推导答案,通过可靠性评估和视觉补偿支持在需要时进行答案优化。在ReVSI数据集上,QA-RP将CoT-VC的增益从2.6点提升至6.9点,消融实验表明局部和全局重建监督均有益处。SpatialSpeak在ReVSI、VSI-Bench和SPAR-Bench上取得了最先进的结果,ReVSI得分为62.8,超过最强比较基线8.7点。

查看arXiv页面 (https://arxiv.org/abs/2609.33616) 查看PDF (https://arxiv.org/pdf/2609.33616) 项目页面 (https://yangcaoai.github.io/SpatialSpeak/) GitHub3 (https://github.com/yangcaoai/SpatialSpeak-VLM) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.33616)

在您的智能体中获取此论文:

hf papers read 2609.33616

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

在模型README.md中引用arxiv.org/abs/2609.33616以从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

在数据集README.md中引用arxiv.org/abs/2609.33616以从此页面链接。

引用此论文的交互空间0

没有交互空间关联此论文

在交互空间README.md中引用arxiv.org/abs/2609.33616以从此页面链接。

包含此论文的合集0

没有合集包含此论文

将此论文添加至合集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。

SpatialCLI:先使用空间工具推理,再脱离工具

Hugging Face Daily Papers

SpatialCLI 提出了一种框架,先训练视觉语言模型使用专业空间工具,再将这些能力内化,使 Qwen3-VL-8B-Instruct 在 MindCube 基准上从 29.3% 提升至 84.6%(使用工具时)。