从视频中学习几何表征以赋予多模态大语言模型空间智能

Hugging Face Daily Papers 论文

摘要

GeoVR 通过利用多个几何目标从3D基础模型中蒸馏几何知识,重构多模态大语言模型的语义潜空间,从而增强其3D感知能力。

多模态大语言模型(MLLMs)在二维语义理解方面表现出色,但缺乏内在的三维感知能力,导致其表征无法维持视频帧之间的几何和空间一致性。鉴于大规模三维数据的稀缺性,我们提出了 GeoVR,一个仅利用二维视频序列学习几何表征的新框架。该方法有效重构了 MLLM 内部的语义潜空间,从而解锁空间智能。GeoVR 并非采用浅层的特征混合,而是通过从预训练的三维基础模型中蒸馏几何知识,重塑 MLLM 的内部表征。这是通过一个由四个互补几何目标驱动的多目标学习策略实现的:(1) 估计帧间相机姿态以嵌入变化的视角动态,(2) 回归密集深度图以锚定物理距离,(3) 预测度量尺度因子以进行真实世界校准,以及 (4) 蒸馏多尺度三维特征以对齐中间特征空间。在这些明确的物理和几何约束的引导下,模型的内部表征自然发展出强大的三维感知能力。在空间推理基准上的大量实验表明,GeoVR 达到了最先进的性能,为赋予基础模型空间智能建立了新范式。
查看原文
查看缓存全文

缓存时间: 2026/06/05 18:09

论文页面 - 从视频学习几何表示以实现空间智能多模态大语言模型

来源: https://huggingface.co/papers/2606.05833

摘要

GeoVR 通过从3D基础模型进行几何知识蒸馏,利用多个几何目标重构多模态大语言模型的语义隐空间,从而增强其3D感知能力。

多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)在二维语义理解上表现出色,但缺乏内在的 3D感知能力 (https://huggingface.co/papers?q=3D%20awareness),导致其表示在视频帧间无法保持几何与空间一致性。鉴于大规模3D数据的稀缺,我们提出了 GeoVR,一个仅使用二维视频序列学习 几何表示 (https://huggingface.co/papers?q=geometric%20representations) 的新框架。该方法有效重构了 MLLM 内部的 语义隐空间 (https://huggingface.co/papers?q=semantic%20latent%20space),以解锁空间智能。GeoVR 并非采用表层的特征混合,而是通过从预训练的 3D基础模型 (https://huggingface.co/papers?q=3D%20foundation%20models) 蒸馏几何知识来重塑 MLLM 的内部表示。这通过一个由四个互补几何目标驱动的 多目标学习 (https://huggingface.co/papers?q=multi-objective%20learning) 策略实现:(1) 估计帧间 相机姿态 (https://huggingface.co/papers?q=camera%20poses) 以嵌入不同的视角动态,(2) 回归 密集深度图 (https://huggingface.co/papers?q=dense%20depth%20maps) 以锚定物理距离,(3) 预测 度量尺度因子 (https://huggingface.co/papers?q=metric%20scale%20factor) 以实现真实世界校准,(4) 蒸馏 多尺度3D特征 (https://huggingface.co/papers?q=multi-scale%203D%20features) 以对齐中间特征空间。在这些显式物理与几何约束的引导下,模型的内部表示自然形成了强大的 3D感知能力 (https://huggingface.co/papers?q=3D%20awareness)。在空间推理基准上的大量实验表明,GeoVR 达到了最先进的性能,为赋予基础模型空间智能建立了新范式。

查看 arXiv 页面 (https://arxiv.org/abs/2606.05833) · 查看 PDF (https://arxiv.org/pdf/2606.05833) · GitHub3 (https://github.com/WHB139426/GeoVR-MLLM) · 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.05833)

在你的 agent 中获取这篇论文:

hf papers read 2606.05833

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 (1)

WHB139426/GeoVR 更新于约3小时前 • 11 (https://huggingface.co/WHB139426/GeoVR)

引用本论文的数据集 (0)

无关联数据集

在数据集的 README.md 中引用 arxiv.org/abs/2606.05833 即可关联本页面。

引用本论文的 Spaces (0)

无关联 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2606.05833 即可关联本页面。

包含本论文的收藏 (0)

无收藏包含本论文

将本论文添加到 收藏 (https://huggingface.co/new-collection) 即可关联本页面。

相似文章

Stream3D-VLM:基于增量几何先验的在线3D空间理解

Hugging Face Daily Papers

Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。