迈向一致视频几何估计
摘要
ViGeo是一个基于Transformer的基础模型,使用动态分块注意力和基于补全的数据精炼框架,从视频中恢复密集且一致的3D几何,在多项任务上实现了最先进的性能。
查看缓存全文
缓存时间: 2026/05/29 11:01
论文页面 - 迈向一致视频几何估计
来源:https://huggingface.co/papers/2605.30060 发布于 5月28日
·
提交者 https://huggingface.co/pkqbajng
zhu (https://huggingface.co/pkqbajng) 于 5月29日
作者:
,
,
,
,
,
,
,
,
,
摘要
ViGeo 是一个基于 transformer 的基础模型,通过动态分块注意力机制和基于补全的数据精炼框架,从视频中恢复密集且一致的 3D 几何结构。
本文提出 ViGeo,一种前馈式基础模型,用于从视频序列中恢复空间密集且时间一致的几何结构。ViGeo 基于纯 transformer 架构(https://huggingface.co/papers?q=transformer%20architecture),无需针对特定任务的架构修改,即可在统一模型中支持流式、全序列和长视频推理。其关键设计是动态分块注意力(https://huggingface.co/papers?q=dynamic%20chunking%20attention),该机制在训练时让模型同时接触双向和因果时间上下文,并使其能够在测试时无需重新训练即可调整注意力模式。为了提升监督质量,我们进一步引入了一种基于补全的数据精炼框架。该框架训练一个视频深度补全(https://huggingface.co/papers?q=video%20depth%20completion)教师模型,以稀疏且带有噪声的标注为条件,利用视频/多视图上下文(https://huggingface.co/papers?q=multi-view%20context)生成密集、时间连贯且几何可靠的训练目标。除了深度图和点图,ViGeo 还在同一框架内预测表面法线(https://huggingface.co/papers?q=surface%20normals)。ViGeo 仅使用公开数据集进行训练,在在线、离线及长视频深度估计(https://huggingface.co/papers?q=depth%20estimation)、表面法线估计和视频点图估计(https://huggingface.co/papers?q=video%20point%20map%20estimation)中均达到了最先进的性能。
查看 arXiv 页面 (https://arxiv.org/abs/2605.30060)查看 PDF (https://arxiv.org/pdf/2605.30060)项目页面 (https://pkqbajng.github.io/ViGeo/)GitHub37 (https://github.com/aigc3d/ViGeo)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30060)
在您的智能体中获取本文:
hf papers read 2605\.30060
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本篇论文的模型2
pkqbajng/VideoLDCM 深度估计• 更新于约1小时前 • 1 (https://huggingface.co/pkqbajng/VideoLDCM)
pkqbajng/ViGeo 深度估计• 更新于约1小时前 • 1 (https://huggingface.co/pkqbajng/ViGeo)
引用本篇论文的数据集0
没有链接本篇论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2605.30060 以将其链接到此页面。
引用本篇论文的 Spaces0
没有链接本篇论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2605.30060 以将其链接到此页面。
包含本篇论文的收藏集0
没有包含本篇论文的收藏集
将本篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
ConsiSpace:几何一致性学习对视频空间推理至关重要
ConsiSpace是一个几何一致性感知的视频空间推理框架,通过使用几何一致性记忆和统一一致性自监督强化学习,在空间推理基准上提升了性能。
面向几何一致性的视频世界模型量化评估
引入PDI-Bench量化框架,通过单目重建与投影几何残差评估生成视频的几何一致性,揭示视频生成器中特有的几何失败模式。
从视频中学习几何表征以赋予多模态大语言模型空间智能
GeoVR 通过利用多个几何目标从3D基础模型中蒸馏几何知识,重构多模态大语言模型的语义潜空间,从而增强其3D感知能力。
ReViV:从单目第一人称视频中重建观看者与场景的四维动态
ReViV是一个统一的整体性第一人称4D重建框架,它通过掩码生成式第一人称Transformer,从单目RGB视频中同时重建观看者(身体、手、视线)和场景(深度、相机轨迹)的动态,实现了最先进的准确性和效率。
PermaVid: 通过解耦上下文记忆实现编辑间一致的视频生成
PermaVid 引入了一种多模态上下文记忆,将外观和几何结构解耦,从而在编辑操作后保持长期视频一致性,超越了此前的方法。