Stream3D-VLM:基于增量几何先验的在线3D空间理解
摘要
Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。
查看缓存全文
缓存时间: 2026/06/08 07:14
论文页面 - Stream3D-VLM: 基于增量几何先验的在线3D空间理解
来源:https://huggingface.co/papers/2606.06891
摘要
一种在线3D视觉语言模型,通过自回归控制建模和高效的视觉标记压缩,实现从流式视频中实时理解空间信息。
尽管3D场景理解取得了进展,现有的3D大型多模态模型(https://huggingface.co/papers?q=3D%20Large%20Multimodal%20Models)仍以离线方式运行,需要完整的场景观测或预定义的视频片段。在本文中,我们提出了一种在线3D视觉语言模型,能够从流式视频中实现实时空间理解。我们的方法采用基于LLM的下一个标记预测目标(https://huggingface.co/papers?q=next-token%20prediction%20objective)的自回归流控制建模(https://huggingface.co/papers?q=autoregressive%20streaming%20control%20modeling)来学习何时响应,并使用轻量级的视觉-空间特征集成(https://huggingface.co/papers?q=Visual-Spatial%20Feature%20Integration)(VSFI)模块,逐步将时间对齐的几何先验注入视觉流中。为了缓解长上下文解码开销,我们提出了一个即插即用的几何自适应体素压缩(https://huggingface.co/papers?q=Geometry-Adaptive%20Voxel%20Compression)(GAVC)模块,用于高效的视觉标记压缩。针对流式3D语言数据稀缺的问题,我们进一步开发了一个可扩展的数据生成流程,精心策划了超过100万个在线时空3D问答对(https://huggingface.co/papers?q=spatio-temporal%203D%20QA%20pairs),并建立了一个涵盖29个任务的全面基准。大量实验表明,我们的方法在在线和离线3D空间理解、推理和定位任务上显著优于专有和开源模型。项目页面:https://stream3d-vlm.github.io/
查看arXiv页面(https://arxiv.org/abs/2606.06891) 查看PDF(https://arxiv.org/pdf/2606.06891) 项目页面(https://stream3d-vlm.github.io/) GitHub3(https://github.com/hanxunyu/Stream3D-VLM) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.06891)
社区
Stream3D-VLM是一种在线3D视觉语言模型,支持直接从流式视频中进行实时空间理解和交互。通过增量集成几何先验并使用几何自适应体素压缩,我们的方法实现了高效且连续的3D场景理解,无需离线处理或完整的场景观测。
通过拖拽文本输入、粘贴或点击此处上传图像、音频和视频。
点击或粘贴此处以上传图像
在您的智能体中获取该论文:
hf papers read 2606.06891
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型1
JonnyYu828/Stream3D-VLM-4B 图像-文本-到-文本 • 5B • 约3小时前更新 • 56 • 2 (https://huggingface.co/JonnyYu828/Stream3D-VLM-4B)
引用本论文的数据集2
JonnyYu828/Stream3D-1M-Dataset 预览 • 约3小时前更新 • 32 • 1 (https://huggingface.co/datasets/JonnyYu828/Stream3D-1M-Dataset)
JonnyYu828/Stream3D-Bench 查看器 • 约3小时前更新 • 10k • 18 • 1 (https://huggingface.co/datasets/JonnyYu828/Stream3D-Bench)
引用本论文的Space0
没有链接本论文的Space
在Space的README.md中引用 arxiv.org/abs/2606.06891 以从本页链接。
包含本论文的收藏0
没有包含本论文的收藏
将此论文添加到收藏(https://huggingface.co/new-collection)以从本页链接。
相似文章
超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理
本文提出GASP框架,通过深度监督结合对比损失和深度一致性损失将几何先验注入视觉语言模型,在3D空间推理基准上取得了显著提升,且无需使用3D VQA数据。
从视频中学习几何表征以赋予多模态大语言模型空间智能
GeoVR 通过利用多个几何目标从3D基础模型中蒸馏几何知识,重构多模态大语言模型的语义潜空间,从而增强其3D感知能力。
MetaSpatial:强化VLMs在元宇宙中的3D空间推理
MetaSpatial是一个强化学习框架,旨在增强视觉语言模型(VLMs)的3D空间推理能力,能够生成连贯且物理上合理的3D场景,无需硬编码优化。
用于流式 3D 重建的几何上下文 Transformer
介绍了 LingBot-Map,这是一种前馈式 3D 基础模型,采用几何上下文 Transformer 架构用于流式 3D 重建,能够在 20 FPS 的速率下实现稳定的实时性能。
OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。