SpatialSpeak:基于问答原生重建与局部和全局上下文的空间链式思考推理
摘要
SpatialSpeak 引入了一个两阶段框架,用于视觉语言模型中的空间推理,使用问答原生重建预训练和空间链式思考学习,以在基准测试中实现最先进的性能。
查看缓存全文
缓存时间: 2026/09/29 04:11
论文页面 - SpatialSpeak:基于局部与全局上下文的质问原生重建实现空间链式推理
来源:https://huggingface.co/papers/2609.33616
摘要
视觉-语言模型(VLMs)可以从几何先验中受益于多视角空间推理,但仅基于答案的训练并不直接监督中间几何估计及其在推导定量空间答案中的应用。我们假设,当VLM首先通过多视角重建联合学习互补的局部几何和全局场景上下文时,空间链式推理(CoT)的监督将变得更加有效。我们提出SpatialSpeak,一个将质问原生重建预训练与空间CoT学习相结合的两阶段框架。在第一阶段,质问原生重建预训练(QA-RP)结合了用于细粒度局部几何的标记点3D查询和用于跨视角全局场景上下文的对象中心查询。两项任务均被表述为基于文本的问答,允许几何估计和后续推理共享相同的自回归输出接口。在第二阶段,带有视觉补偿的链式推理(CoT-VC)训练模型表达与问题相关的几何估计,并使用它们推导答案,通过可靠性评估和视觉补偿支持在需要时进行答案优化。在ReVSI数据集上,QA-RP将CoT-VC的增益从2.6点提升至6.9点,消融实验表明局部和全局重建监督均有益处。SpatialSpeak在ReVSI、VSI-Bench和SPAR-Bench上取得了最先进的结果,ReVSI得分为62.8,超过最强比较基线8.7点。
查看arXiv页面 (https://arxiv.org/abs/2609.33616) 查看PDF (https://arxiv.org/pdf/2609.33616) 项目页面 (https://yangcaoai.github.io/SpatialSpeak/) GitHub3 (https://github.com/yangcaoai/SpatialSpeak-VLM) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.33616)
在您的智能体中获取此论文:
hf papers read 2609.33616
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
在模型README.md中引用arxiv.org/abs/2609.33616以从此页面链接。
引用此论文的数据集0
没有数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2609.33616以从此页面链接。
引用此论文的交互空间0
没有交互空间关联此论文
在交互空间README.md中引用arxiv.org/abs/2609.33616以从此页面链接。
包含此论文的合集0
没有合集包含此论文
将此论文添加至合集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。
SpatialCLI:先使用空间工具推理,再脱离工具
SpatialCLI 提出了一种框架,先训练视觉语言模型使用专业空间工具,再将这些能力内化,使 Qwen3-VL-8B-Instruct 在 MindCube 基准上从 29.3% 提升至 84.6%(使用工具时)。
超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理
本文提出GASP框架,通过深度监督结合对比损失和深度一致性损失将几何先验注入视觉语言模型,在3D空间推理基准上取得了显著提升,且无需使用3D VQA数据。
推理,然后重新推理:跨视角回顾提升空间推理
一种无需训练的空间推理框架,它利用由预测3D几何生成的合成新视角视频,实现对自我中心视频中结论的重新审视。
SpatialClaw: 重新思考智能体空间推理的动作接口
SpatialClaw是一个无需训练的框架,它采用代码作为动作接口,使视觉语言模型能够进行灵活、有状态的空间推理,在多种3D/4D空间推理任务上取得了卓越性能。