ConsiSpace:几何一致性学习对视频空间推理至关重要
摘要
ConsiSpace是一个几何一致性感知的视频空间推理框架,通过使用几何一致性记忆和统一一致性自监督强化学习,在空间推理基准上提升了性能。
查看缓存全文
缓存时间: 2026/07/22 02:40
论文页 - ConsiSpace: 学习几何一致性对视频空间推理至关重要
来源:https://huggingface.co/papers/2607.17599
摘要
视频空间推理对于面向导航的感知和长视频问答至关重要,模型需在变化视角下跨长程推断空间关系。然而,现有大规模多模态语言模型(MLLMs)仍以语义为中心,通常无法从冗余的视频观测中可靠地聚合一致的空间证据,导致推理低效或不稳定。为解决这些问题,我们提出ConsiSpace,一个几何一致性感知框架,用于几何敏感的视频空间推理,将空间一致性同时转化为证据组织原则和显式的后SFT学习信号。我们构建了一个几何一致记忆(GCM),包含隐式证据标记和显式几何线索,并利用高效的组织策略紧凑保留任务相关的空间证据。此外,我们在监督微调后采用统一一致性自监督强化学习(UC-SSRL),通过答案、度量和拓扑一致性奖励来提升跨视角稳定性。在三个空间推理基准(VSI-Bench、OSI-Bench和MMSI-Video-Bench)上的大量实验显示出一致性的提升,在最强基线基础上平均得分提高12.6个百分点。
查看arXiv页面 (https://arxiv.org/abs/2607.17599)查看PDF (https://arxiv.org/pdf/2607.17599)项目页面 (https://believeht029.github.io/ConsiSpace/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.17599)
在您的智能体中获取本文:
hf papers read 2607.17599
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
没有模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2607.17599 即可从此页面链接。
引用本文的数据集0
没有数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2607.17599 即可从此页面链接。
引用本文的Space0
没有Space链接本文
在Space README.md 中引用 arxiv.org/abs/2607.17599 即可从此页面链接。
包含本文的收藏集0
没有收藏集包含本文
将本文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
质询的艺术:一致性增强空间推理中的事实性
本文提出一种自监督强化学习框架,利用一致性验证器(检查变换下几何和语义一致性的奖励函数)来提升大型推理模型的空间推理能力,无需真实标注。该方法接近监督微调的准确率,并能泛化到多种任务。
推理,然后重新推理:跨视角回顾提升空间推理
一种无需训练的空间推理框架,它利用由预测3D几何生成的合成新视角视频,实现对自我中心视频中结论的重新审视。
SpaR3D-MoE: 面向稀疏视图的自适应3D空间推理与几何归纳混合专家模型
介绍SpaR3D-MoE,这是一个端到端框架,用于从稀疏RGB视图中进行自适应3D空间推理,利用流形采样和几何归纳混合专家,在VSI-Bench、ScanQA和SQA3D上取得了最先进的性能。
从视频中学习几何表征以赋予多模态大语言模型空间智能
GeoVR 通过利用多个几何目标从3D基础模型中蒸馏几何知识,重构多模态大语言模型的语义潜空间,从而增强其3D感知能力。
迈向一致视频几何估计
ViGeo是一个基于Transformer的基础模型,使用动态分块注意力和基于补全的数据精炼框架,从视频中恢复密集且一致的3D几何,在多项任务上实现了最先进的性能。