视频中定位万物:重新思考高效生成式时空视频定位
摘要
Parallel Tube Decoding 通过消除自回归依赖,实现高效的同步时空视频定位,减少延迟并提高准确性,优于标准方法。
查看缓存全文
缓存时间: 2026/09/01 12:07
论文页面 - 在视频中定位万物:重新思考高效生成式时空视频定位
来源:https://huggingface.co/papers/2608.28192
摘要
并行管道解码通过消除自回归依赖,实现了时空视频定位的同步处理,显著降低了延迟并提升了准确性。
时空视频定位(https://huggingface.co/papers?q=Spatio-temporal%20video%20grounding)(STVG)要求模型识别指代事件发生的时间并定位目标实体在该时间区间内的位置。现有的多模态大语言模型通常以自回归方式序列化密集的定位轨迹,导致解码延迟随管道长度增长,且定位误差会随时间累积传播。我们提出了并行管道解码(https://huggingface.co/papers?q=Parallel%20Tube%20Decoding)(PTD),这是一种生成式框架,它将定位过程分解为一个时间块,随后是同时解码的时间条件空间块。这种方法移除了令牌级和轨迹级的依赖,将顺序解码深度固定为1+1轮,与管道长度无关。为实现并行空间生成,我们引入了解耦块注意力(https://huggingface.co/papers?q=Decoupled%20Block%20Attention),在保持对共享视频-查询上下文访问的同时消除了跨框依赖,结合了针对时间边界和空间几何的定位感知策略优化(https://huggingface.co/papers?q=localization-aware%20policy%20optimization)。在VidSTG数据集上,PTD相较于标准自回归解码(https://huggingface.co/papers?q=autoregressive%20decoding),将管道完成延迟(https://huggingface.co/papers?q=Tube%20Completion%20Latency)降低了79倍,空间解码吞吐量提升了92倍,同时提升了定位精度。使用紧凑的4B主干网络,我们的模型在VidSTG和HC-STVG上表现良好,并零样本泛化到时间定位、定位视频问答和指代视频目标跟踪任务中。我们的结果表明,并行管道生成是视频自回归定位的一种高效且有效的替代方案。
查看 arXiv 页面 (https://arxiv.org/abs/2608.28192)查看 PDF (https://arxiv.org/pdf/2608.28192)项目页面 (https://mbzuai-oryx.github.io/ParallelTubeDecoding/)GitHub18 (https://github.com/mbzuai-oryx/ParallelTubeDecoding)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.28192)
在你的智能体中获取此论文:
hf papers read 2608\.28192
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有链接到本文的模型
在模型的 README.md 中引用 arxiv.org/abs/2608.28192 以从该页面链接。
引用本文的数据集0
没有链接到本文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2608.28192 以从该页面链接。
引用本文的 Space0
没有链接到本文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2608.28192 以从该页面链接。
包含本文的收藏夹1
相似文章
LocateAnything: 快速高质量的视觉-语言定位与并行框解码
LocateAnything 提出并行框解码用于统一视觉定位与目标检测,将几何元素解码为原子单元,以提高吞吐量和定位精度,并得到包含1.38亿样本的大规模数据集的支持。
自回归视频生成的投机解码
SDVG 将投机解码引入自回归视频扩散,通过图像质量路由器在 MovieGenVideoBench 上实现最高 2.09× 加速,同时保留 95.7% 质量。
面向一对多时序定位
本文介绍了一对多时序定位(OMTG)这一新任务,用于从单个文本查询中定位多个不连续的视频片段,同时提供了基准、评估指标、包含56k样本的数据集以及新颖的奖励函数,取得了最新最优的结果,优于Gemini 2.5 Pro和Seed-1.8。
超越像素:从视频先验到4D世界
本文介绍了Latent-to-4D,一种直接从视频扩散潜变量生成4D场景的方法,无需跨生成器重新训练,在几何和时间稳定性上优于级联方法。
全模态密集视频字幕生成的并行自回归解码
本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。