SpatialCORE:大型视觉-语言模型中置信度感知的接地空间推理
摘要
SpatialCORE 是一个后训练框架,将模型对其生成的边界框接地的置信度用作大型视觉-语言模型进行空间推理的学习信号,在空间推理基准测试中取得了开源模型中的最先进结果。
查看缓存全文
缓存时间: 2026/10/01 16:23
论文页面 - SpatialCORE:面向大型视觉-语言模型的置信度感知接地式空间推理
来源:https://huggingface.co/papers/2609.38716
摘要
大型视觉-语言模型(Large Vision-Language Models, LVLMs)在各类视觉感知任务上取得了显著进展,但空间推理始终是一项薄弱环节,尤其是在需要对视觉空间进行推理的问题上。近年来的空间推理方法引入了“生成式接地“(generated grounding)机制,即模型在推理过程中为与任务相关的对象预测边界框、掩码或其他定位输出。然而,这些方法通常只优化最终答案的正确性,导致即使模型并未基于置信定位的任务相关对象进行推理,其给出的正确答案仍会获得奖励。我们提出了 SpatialCORE(Spatially COnfident REasoning,置信式空间推理),一个后训练框架,它将模型对自身生成的接地结果的置信度转化为空间推理的学习信号。其核心思想是同时强化准确且高置信的接地,鼓励模型基于置信定位的任务相关对象进行推理。SpatialCORE 通过一种自调节的空间奖励实现这一目标:该奖励以每个预测边界框的坐标 token 置信度对其匹配质量进行加权。一个答案门控(answer gate)机制进一步将接地优化与最终答案的正确性绑定在一起。SpatialCORE 在多种基准测试上取得了开源模型及专用空间推理模型中最优(state-of-the-art)的结果,并能在零样本(zero-shot)设置下有效迁移至未见过的数据分布。源码见:https://github.com/rafiibnsultan/SpatialCORE。
查看 arXiv 页面 (https://arxiv.org/abs/2609.38716) 查看 PDF (https://arxiv.org/pdf/2609.38716) GitHub 0 (https://github.com/rafiibnsultan/SpatialCORE) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2609.38716)
在你的智能体中获取这篇论文:
hf papers read 2609.38716
还没有最新版 CLI?运行:curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无模型链接到此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.38716,即可从本页面链接到该模型。
引用此论文的数据集 0
暂无数据集链接到此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.38716,即可从本页面链接到该数据集。
引用此论文的 Space 0
暂无 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.38716,即可从本页面链接到该 Space。
包含此论文的合集 0
暂无合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection),即可从本页面链接到该合集。
相似文章
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。
SpatialCLI:先使用空间工具推理,再脱离工具
SpatialCLI 提出了一种框架,先训练视觉语言模型使用专业空间工具,再将这些能力内化,使 Qwen3-VL-8B-Instruct 在 MindCube 基准上从 29.3% 提升至 84.6%(使用工具时)。
软空间推理(Soft Spatial Reasoning)
本文提出 Soft Spatial Reasoning,一个针对大型视觉-语言模型(LVLM)空间任务的后训练框架,其引入自适应的"软思考"机制:在中间推理步骤中混合 token 嵌入,而非直接选定某个离散 token。AdaptSoft 控制器会根据隐藏状态与预测不确定性动态调整软化程度,在多个空间推理基准上超越了硬思考(hard)与固定软化程度的 CoT 基线。
SpatialSpeak:基于问答原生重建与局部和全局上下文的空间链式思考推理
SpatialSpeak 引入了一个两阶段框架,用于视觉语言模型中的空间推理,使用问答原生重建预训练和空间链式思考学习,以在基准测试中实现最先进的性能。
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。