ConsiSpace:几何一致性学习对视频空间推理至关重要

Hugging Face Daily Papers 论文

摘要

ConsiSpace是一个几何一致性感知的视频空间推理框架,通过使用几何一致性记忆和统一一致性自监督强化学习,在空间推理基准上提升了性能。

视频空间推理对于导航导向的感知和长视频问答至关重要,模型需要在变化的视角下推断长时域中的空间关系。然而,现有的多模态大语言模型(MLLMs)仍然以语义为中心,通常无法可靠地从冗余视频观测中聚合一致的空间证据,导致推理效率低下或不稳定。为了解决这些问题,我们提出了ConsiSpace,一个面向几何敏感视频空间推理的几何一致性感知框架,将空间一致性同时转化为证据组织原则和显式的后监督微调(SFT)学习信号。我们构建了一个包含隐式证据令牌和显式几何线索的几何一致性记忆(GCM),并利用高效的组织策略紧凑地保留任务相关的空间证据。此外,我们在监督微调后采用统一一致性自监督强化学习(UC-SSRL),通过答案一致性、度量一致性和拓扑一致性奖励提升跨视角稳定性。在三个空间推理基准(VSI-Bench、OSI-Bench和MMSI-Video-Bench)上的大量实验显示出一致的提升,平均得分比最强基线高出12.6个百分点。
查看原文
查看缓存全文

缓存时间: 2026/07/22 02:40

论文页 - ConsiSpace: 学习几何一致性对视频空间推理至关重要

来源:https://huggingface.co/papers/2607.17599

摘要

视频空间推理对于面向导航的感知和长视频问答至关重要,模型需在变化视角下跨长程推断空间关系。然而,现有大规模多模态语言模型(MLLMs)仍以语义为中心,通常无法从冗余的视频观测中可靠地聚合一致的空间证据,导致推理低效或不稳定。为解决这些问题,我们提出ConsiSpace,一个几何一致性感知框架,用于几何敏感的视频空间推理,将空间一致性同时转化为证据组织原则和显式的后SFT学习信号。我们构建了一个几何一致记忆(GCM),包含隐式证据标记和显式几何线索,并利用高效的组织策略紧凑保留任务相关的空间证据。此外,我们在监督微调后采用统一一致性自监督强化学习(UC-SSRL),通过答案、度量和拓扑一致性奖励来提升跨视角稳定性。在三个空间推理基准(VSI-Bench、OSI-Bench和MMSI-Video-Bench)上的大量实验显示出一致性的提升,在最强基线基础上平均得分提高12.6个百分点。

查看arXiv页面 (https://arxiv.org/abs/2607.17599)查看PDF (https://arxiv.org/pdf/2607.17599)项目页面 (https://believeht029.github.io/ConsiSpace/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.17599)

在您的智能体中获取本文:

hf papers read 2607.17599

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

没有模型链接本文

在模型 README.md 中引用 arxiv.org/abs/2607.17599 即可从此页面链接。

引用本文的数据集0

没有数据集链接本文

在数据集 README.md 中引用 arxiv.org/abs/2607.17599 即可从此页面链接。

引用本文的Space0

没有Space链接本文

在Space README.md 中引用 arxiv.org/abs/2607.17599 即可从此页面链接。

包含本文的收藏集0

没有收藏集包含本文

将本文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

质询的艺术:一致性增强空间推理中的事实性

arXiv cs.AI

本文提出一种自监督强化学习框架,利用一致性验证器(检查变换下几何和语义一致性的奖励函数)来提升大型推理模型的空间推理能力,无需真实标注。该方法接近监督微调的准确率,并能泛化到多种任务。

迈向一致视频几何估计

Hugging Face Daily Papers

ViGeo是一个基于Transformer的基础模型,使用动态分块注意力和基于补全的数据精炼框架,从视频中恢复密集且一致的3D几何,在多项任务上实现了最先进的性能。