迈向一致视频几何估计

Hugging Face Daily Papers 论文

摘要

ViGeo是一个基于Transformer的基础模型,使用动态分块注意力和基于补全的数据精炼框架,从视频中恢复密集且一致的3D几何,在多项任务上实现了最先进的性能。

本文提出了ViGeo,一个前馈基础模型,用于从视频序列中恢复空间密集且时间一致的几何结构。ViGeo基于普通的Transformer架构构建,没有针对特定任务的架构修改,支持流式、全序列和长视频推理,且统一在一个模型中。关键设计是动态分块注意力,它在训练期间让模型接触双向和因果时间上下文,并允许在测试时无需重新训练即可调整其注意力模式。为了提高监督质量,我们进一步引入了基于补全的数据精炼框架。该框架训练一个视频深度补全教师模型,该模型以稀疏且带噪声的标注为条件,并利用视频/多视角上下文生成密集、时间连贯且几何可靠的训练目标。除深度图和点图外,ViGeo还在同一框架内预测表面法线。仅在公开数据集上训练,ViGeo在在线、离线和长视频深度估计、表面法线估计以及视频点图估计上均达到了最先进的性能。
查看原文
查看缓存全文

缓存时间: 2026/05/29 11:01

论文页面 - 迈向一致视频几何估计

来源:https://huggingface.co/papers/2605.30060 发布于 5月28日

·

提交者 https://huggingface.co/pkqbajng

zhu (https://huggingface.co/pkqbajng) 于 5月29日

作者:

摘要

ViGeo 是一个基于 transformer 的基础模型,通过动态分块注意力机制和基于补全的数据精炼框架,从视频中恢复密集且一致的 3D 几何结构。

本文提出 ViGeo,一种前馈式基础模型,用于从视频序列中恢复空间密集且时间一致的几何结构。ViGeo 基于纯 transformer 架构(https://huggingface.co/papers?q=transformer%20architecture),无需针对特定任务的架构修改,即可在统一模型中支持流式、全序列和长视频推理。其关键设计是动态分块注意力(https://huggingface.co/papers?q=dynamic%20chunking%20attention),该机制在训练时让模型同时接触双向和因果时间上下文,并使其能够在测试时无需重新训练即可调整注意力模式。为了提升监督质量,我们进一步引入了一种基于补全的数据精炼框架。该框架训练一个视频深度补全(https://huggingface.co/papers?q=video%20depth%20completion)教师模型,以稀疏且带有噪声的标注为条件,利用视频/多视图上下文(https://huggingface.co/papers?q=multi-view%20context)生成密集、时间连贯且几何可靠的训练目标。除了深度图和点图,ViGeo 还在同一框架内预测表面法线(https://huggingface.co/papers?q=surface%20normals)。ViGeo 仅使用公开数据集进行训练,在在线、离线及长视频深度估计(https://huggingface.co/papers?q=depth%20estimation)、表面法线估计和视频点图估计(https://huggingface.co/papers?q=video%20point%20map%20estimation)中均达到了最先进的性能。

查看 arXiv 页面 (https://arxiv.org/abs/2605.30060)查看 PDF (https://arxiv.org/pdf/2605.30060)项目页面 (https://pkqbajng.github.io/ViGeo/)GitHub37 (https://github.com/aigc3d/ViGeo)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30060)

在您的智能体中获取本文:

hf papers read 2605\.30060

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本篇论文的模型2

pkqbajng/VideoLDCM 深度估计• 更新于约1小时前 • 1 (https://huggingface.co/pkqbajng/VideoLDCM)

pkqbajng/ViGeo 深度估计• 更新于约1小时前 • 1 (https://huggingface.co/pkqbajng/ViGeo)

引用本篇论文的数据集0

没有链接本篇论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2605.30060 以将其链接到此页面。

引用本篇论文的 Spaces0

没有链接本篇论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2605.30060 以将其链接到此页面。

包含本篇论文的收藏集0

没有包含本篇论文的收藏集

将本篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 以将其链接到此页面。

相似文章