从视频中学习几何表征以赋予多模态大语言模型空间智能
摘要
GeoVR 通过利用多个几何目标从3D基础模型中蒸馏几何知识,重构多模态大语言模型的语义潜空间,从而增强其3D感知能力。
查看缓存全文
缓存时间: 2026/06/05 18:09
论文页面 - 从视频学习几何表示以实现空间智能多模态大语言模型
来源: https://huggingface.co/papers/2606.05833
摘要
GeoVR 通过从3D基础模型进行几何知识蒸馏,利用多个几何目标重构多模态大语言模型的语义隐空间,从而增强其3D感知能力。
多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)在二维语义理解上表现出色,但缺乏内在的 3D感知能力 (https://huggingface.co/papers?q=3D%20awareness),导致其表示在视频帧间无法保持几何与空间一致性。鉴于大规模3D数据的稀缺,我们提出了 GeoVR,一个仅使用二维视频序列学习 几何表示 (https://huggingface.co/papers?q=geometric%20representations) 的新框架。该方法有效重构了 MLLM 内部的 语义隐空间 (https://huggingface.co/papers?q=semantic%20latent%20space),以解锁空间智能。GeoVR 并非采用表层的特征混合,而是通过从预训练的 3D基础模型 (https://huggingface.co/papers?q=3D%20foundation%20models) 蒸馏几何知识来重塑 MLLM 的内部表示。这通过一个由四个互补几何目标驱动的 多目标学习 (https://huggingface.co/papers?q=multi-objective%20learning) 策略实现:(1) 估计帧间 相机姿态 (https://huggingface.co/papers?q=camera%20poses) 以嵌入不同的视角动态,(2) 回归 密集深度图 (https://huggingface.co/papers?q=dense%20depth%20maps) 以锚定物理距离,(3) 预测 度量尺度因子 (https://huggingface.co/papers?q=metric%20scale%20factor) 以实现真实世界校准,(4) 蒸馏 多尺度3D特征 (https://huggingface.co/papers?q=multi-scale%203D%20features) 以对齐中间特征空间。在这些显式物理与几何约束的引导下,模型的内部表示自然形成了强大的 3D感知能力 (https://huggingface.co/papers?q=3D%20awareness)。在空间推理基准上的大量实验表明,GeoVR 达到了最先进的性能,为赋予基础模型空间智能建立了新范式。
查看 arXiv 页面 (https://arxiv.org/abs/2606.05833) · 查看 PDF (https://arxiv.org/pdf/2606.05833) · GitHub3 (https://github.com/WHB139426/GeoVR-MLLM) · 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.05833)
在你的 agent 中获取这篇论文:
hf papers read 2606.05833
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 (1)
WHB139426/GeoVR 更新于约3小时前 • 11 (https://huggingface.co/WHB139426/GeoVR)
引用本论文的数据集 (0)
无关联数据集
在数据集的 README.md 中引用 arxiv.org/abs/2606.05833 即可关联本页面。
引用本论文的 Spaces (0)
无关联 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2606.05833 即可关联本页面。
包含本论文的收藏 (0)
无收藏包含本论文
将本论文添加到 收藏 (https://huggingface.co/new-collection) 即可关联本页面。
相似文章
Stream3D-VLM:基于增量几何先验的在线3D空间理解
Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。
超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理
本文提出GASP框架,通过深度监督结合对比损失和深度一致性损失将几何先验注入视觉语言模型,在3D空间推理基准上取得了显著提升,且无需使用3D VQA数据。
哪种预训练范式更能服务于空间智能?视觉语言模型与视频生成模型的实证比较
本文通过系统性的冻结特征探测研究,比较了视觉语言模型(VLMs)和视频生成模型(VGMs)在空间智能任务上的表现。研究发现,VLMs在语义标签和实例分组方面表现优异,而VGMs则提供更好的密集几何和相机运动信号。两种模型的简单融合在所有维度上均展现出强劲性能。
Geo-Align: 基于度量几何奖励的视频生成对齐
Geo-Align 提出了一个用于相机可控视频重新渲染的强化学习框架,通过尺度感知的感知奖励和用于相机轨迹提取的度量三维估计来提高泛化能力。
GeoStack:一种用于VLMs中拟阿贝尔知识组合的框架
GeoStack 引入了一种几何框架,用于在视觉语言模型中组合独立训练的领域专家,而不会出现灾难性遗忘,实现了常数时间推理,并将几何误差降低了10倍。