Stream3D-VLM:基于增量几何先验的在线3D空间理解

Hugging Face Daily Papers 论文

摘要

Stream3D-VLM 是一款在线3D视觉-语言模型,通过增量整合几何先验并使用几何自适应体素压缩,能够从流式视频中实现实时空间理解,在3D空间理解任务上优于现有模型。

尽管3D场景理解取得了进展,现有的3D大型多模态模型仍以离线方式运行,需要完整的场景观察或预定义的视频片段。本文提出了一种在线3D视觉-语言模型,能够从流式视频中实现实时空间理解。我们的方法基于LLM的下一个词预测目标,采用自回归流控制建模来学习何时响应,并采用轻量级的视觉-空间特征融合(VSFI)模块,逐步将时间对齐的几何先验注入视觉流中。为缓解长上下文解码开销,我们提出了一种即插即用的几何自适应体素压缩(GAVC)模块,用于高效的视觉词元压缩。针对流式3D语言数据稀缺的问题,我们进一步开发了一个可扩展的数据生成流水线,收集了超过100万个在线时空3D问答对,并建立了一个涵盖29个任务的综合基准。大量实验表明,我们的方法在在线和离线3D空间理解、推理和定位任务上均显著优于专有模型和开源模型。项目页面可访问 https://stream3d-vlm.github.io/。
查看原文
查看缓存全文

缓存时间: 2026/06/08 07:14

论文页面 - Stream3D-VLM: 基于增量几何先验的在线3D空间理解

来源:https://huggingface.co/papers/2606.06891

摘要

一种在线3D视觉语言模型,通过自回归控制建模和高效的视觉标记压缩,实现从流式视频中实时理解空间信息。

尽管3D场景理解取得了进展,现有的3D大型多模态模型(https://huggingface.co/papers?q=3D%20Large%20Multimodal%20Models)仍以离线方式运行,需要完整的场景观测或预定义的视频片段。在本文中,我们提出了一种在线3D视觉语言模型,能够从流式视频中实现实时空间理解。我们的方法采用基于LLM的下一个标记预测目标(https://huggingface.co/papers?q=next-token%20prediction%20objective)的自回归流控制建模(https://huggingface.co/papers?q=autoregressive%20streaming%20control%20modeling)来学习何时响应,并使用轻量级的视觉-空间特征集成(https://huggingface.co/papers?q=Visual-Spatial%20Feature%20Integration)(VSFI)模块,逐步将时间对齐的几何先验注入视觉流中。为了缓解长上下文解码开销,我们提出了一个即插即用的几何自适应体素压缩(https://huggingface.co/papers?q=Geometry-Adaptive%20Voxel%20Compression)(GAVC)模块,用于高效的视觉标记压缩。针对流式3D语言数据稀缺的问题,我们进一步开发了一个可扩展的数据生成流程,精心策划了超过100万个在线时空3D问答对(https://huggingface.co/papers?q=spatio-temporal%203D%20QA%20pairs),并建立了一个涵盖29个任务的全面基准。大量实验表明,我们的方法在在线和离线3D空间理解、推理和定位任务上显著优于专有和开源模型。项目页面:https://stream3d-vlm.github.io/

查看arXiv页面(https://arxiv.org/abs/2606.06891) 查看PDF(https://arxiv.org/pdf/2606.06891) 项目页面(https://stream3d-vlm.github.io/) GitHub3(https://github.com/hanxunyu/Stream3D-VLM) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.06891)

社区

Stream3D-VLM是一种在线3D视觉语言模型,支持直接从流式视频中进行实时空间理解和交互。通过增量集成几何先验并使用几何自适应体素压缩,我们的方法实现了高效且连续的3D场景理解,无需离线处理或完整的场景观测。

通过拖拽文本输入、粘贴或点击此处上传图像、音频和视频。

点击或粘贴此处以上传图像

在您的智能体中获取该论文:

hf papers read 2606.06891

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型1

JonnyYu828/Stream3D-VLM-4B 图像-文本-到-文本 • 5B • 约3小时前更新 • 56 • 2 (https://huggingface.co/JonnyYu828/Stream3D-VLM-4B)

引用本论文的数据集2

JonnyYu828/Stream3D-1M-Dataset 预览 • 约3小时前更新 • 32 • 1 (https://huggingface.co/datasets/JonnyYu828/Stream3D-1M-Dataset)

JonnyYu828/Stream3D-Bench 查看器 • 约3小时前更新 • 10k • 18 • 1 (https://huggingface.co/datasets/JonnyYu828/Stream3D-Bench)

引用本论文的Space0

没有链接本论文的Space

在Space的README.md中引用 arxiv.org/abs/2606.06891 以从本页链接。

包含本论文的收藏0

没有包含本论文的收藏

将此论文添加到收藏(https://huggingface.co/new-collection)以从本页链接。

相似文章

用于流式 3D 重建的几何上下文 Transformer

Papers with Code Trending

介绍了 LingBot-Map,这是一种前馈式 3D 基础模型,采用几何上下文 Transformer 架构用于流式 3D 重建,能够在 20 FPS 的速率下实现稳定的实时性能。

OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试

Papers with Code Trending

OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。