全模态密集视频字幕生成的并行自回归解码

Hugging Face Daily Papers 论文

摘要

本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。

密集视频字幕生成旨在为视频事件生成具有时间锚定的描述,有利于事件级别的视频理解和生成。在该领域,自回归视频大语言模型因其强大的生成能力和跨模态建模能力而成为主流范式。然而,在逐词生成的范式下生成密集字幕严重限制了推理效率,并且随着视频长度和事件密度的增加,阻碍了可扩展性。在这项工作中,我们提出了一个并行自回归框架,不仅提高了生成效率,还增强了时间锚定的字幕生成性能。我们的关键洞察是利用时间上不同事件之间的弱局部依赖关系来重构因果依赖图,从而实现无损并行生成。具体来说,跨事件依赖较弱的词元可以并行解码,而每个事件内部紧密耦合的词元则保留顺序解码以保持局部语义连贯性。为了实现这一洞察,我们引入了两个关键组件用于无损并行解码:(1)潜在全局规划机制,自动学习事件级结构并生成紧凑的词元,编码全局事件间因果关系,同时自适应地聚合事件级的视听语义,指导后续的依赖重构和并行解码;(2)事件分解的并行解码机制,有效平衡局部关注与全局事件间感知。在各种基准上的实验证明了我们的方法在全模态事件定位和字幕生成中在效率和性能上的明显优势。项目网站:https://github.com/showlab/PadCaptioner。
查看原文
查看缓存全文

缓存时间: 2026/07/08 06:48

论文页面 - 面向全模态密集视频描述的自回归并行解码

来源:https://huggingface.co/papers/2607.02963 我们提出了 PadCaptioner,一个 3B 参数的全模态密集视频描述模型,在高效性和强接地描述质量上超越 7B 量级同行,实现了优异性能。

核心思路是利用时间上不同事件之间的弱局部依赖关系,重构因果 token 依赖结构,从而实现无损并行生成。

我们设计了一种潜在规划机制,能够自动确定具有非局部感知能力的可并行化单元,指导后续并行解码,并提升事件接地与描述质量。

代码将在 https://github.com/showlab/PadCaptioner 开源。欢迎给我们 ⭐ 以获取最新动态!

相似文章

视频生成的并行解码(10分钟阅读)

TLDR AI

NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。

OmniScope:全模态大语言模型的模态解耦令牌压缩

Hugging Face Daily Papers

OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。