视频中定位万物:重新思考高效生成式时空视频定位

Hugging Face Daily Papers 论文

摘要

Parallel Tube Decoding 通过消除自回归依赖,实现高效的同步时空视频定位,减少延迟并提高准确性,优于标准方法。

时空视频定位(STVG)要求模型识别指称事件的发生时间,并在整个时间间隔内定位目标实体。现有的多模态大语言模型通常以自回归方式序列化密集的定位轨迹,导致解码延迟随管长度增加,并允许定位误差在时间上扩散。我们引入了 Parallel Tube Decoding(PTD),这是一种生成式方法,将定位分解为一个时间块,随后是时间条件下的空间块,同时解码。这消除了令牌级和轨迹级依赖,将顺序解码深度降低到固定的 1 + 1 轮,与管长度无关。为了实现并行空间生成,我们引入了 Decoupled Block Attention,它在保留对共享视频查询上下文访问的同时消除跨框依赖,以及用于时间边界和空间几何的定位感知策略优化。在 VidSTG 上,PTD 将管完成延迟降低了 79 倍,空间解码吞吐量提高了 92 倍,优于标准自回归解码,同时提高了定位准确性。通过紧凑的 4B 骨干网络,我们的模型在 VidSTG 和 HC-STVG 上表现良好,并能零样本泛化到时间定位、基于定位的视频问答和指称视频目标跟踪。我们的结果表明,parallel tube generation 是视频中自回归定位的一种高效且有效的替代方案。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:07

论文页面 - 在视频中定位万物:重新思考高效生成式时空视频定位

来源:https://huggingface.co/papers/2608.28192

摘要

并行管道解码通过消除自回归依赖,实现了时空视频定位的同步处理,显著降低了延迟并提升了准确性。

时空视频定位(https://huggingface.co/papers?q=Spatio-temporal%20video%20grounding)(STVG)要求模型识别指代事件发生的时间并定位目标实体在该时间区间内的位置。现有的多模态大语言模型通常以自回归方式序列化密集的定位轨迹,导致解码延迟随管道长度增长,且定位误差会随时间累积传播。我们提出了并行管道解码(https://huggingface.co/papers?q=Parallel%20Tube%20Decoding)(PTD),这是一种生成式框架,它将定位过程分解为一个时间块,随后是同时解码的时间条件空间块。这种方法移除了令牌级和轨迹级的依赖,将顺序解码深度固定为1+1轮,与管道长度无关。为实现并行空间生成,我们引入了解耦块注意力(https://huggingface.co/papers?q=Decoupled%20Block%20Attention),在保持对共享视频-查询上下文访问的同时消除了跨框依赖,结合了针对时间边界和空间几何的定位感知策略优化(https://huggingface.co/papers?q=localization-aware%20policy%20optimization)。在VidSTG数据集上,PTD相较于标准自回归解码(https://huggingface.co/papers?q=autoregressive%20decoding),将管道完成延迟(https://huggingface.co/papers?q=Tube%20Completion%20Latency)降低了79倍,空间解码吞吐量提升了92倍,同时提升了定位精度。使用紧凑的4B主干网络,我们的模型在VidSTG和HC-STVG上表现良好,并零样本泛化到时间定位、定位视频问答和指代视频目标跟踪任务中。我们的结果表明,并行管道生成是视频自回归定位的一种高效且有效的替代方案。

查看 arXiv 页面 (https://arxiv.org/abs/2608.28192)查看 PDF (https://arxiv.org/pdf/2608.28192)项目页面 (https://mbzuai-oryx.github.io/ParallelTubeDecoding/)GitHub18 (https://github.com/mbzuai-oryx/ParallelTubeDecoding)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.28192)

在你的智能体中获取此论文:

hf papers read 2608\.28192

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有链接到本文的模型

在模型的 README.md 中引用 arxiv.org/abs/2608.28192 以从该页面链接。

引用本文的数据集0

没有链接到本文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2608.28192 以从该页面链接。

引用本文的 Space0

没有链接到本文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2608.28192 以从该页面链接。

包含本文的收藏夹1

相似文章

自回归视频生成的投机解码

Hugging Face Daily Papers

SDVG 将投机解码引入自回归视频扩散,通过图像质量路由器在 MovieGenVideoBench 上实现最高 2.09× 加速,同时保留 95.7% 质量。

面向一对多时序定位

Hugging Face Daily Papers

本文介绍了一对多时序定位(OMTG)这一新任务,用于从单个文本查询中定位多个不连续的视频片段,同时提供了基准、评估指标、包含56k样本的数据集以及新颖的奖励函数,取得了最新最优的结果,优于Gemini 2.5 Pro和Seed-1.8。

超越像素:从视频先验到4D世界

Hugging Face Daily Papers

本文介绍了Latent-to-4D,一种直接从视频扩散潜变量生成4D场景的方法,无需跨生成器重新训练,在几何和时间稳定性上优于级联方法。

全模态密集视频字幕生成的并行自回归解码

Hugging Face Daily Papers

本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。