全模态密集视频字幕生成的并行自回归解码

Hugging Face Daily Papers 论文

摘要

本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。

密集视频字幕生成旨在为视频事件生成具有时间锚定的描述,有利于事件级别的视频理解和生成。在该领域,自回归视频大语言模型因其强大的生成能力和跨模态建模能力而成为主流范式。然而,在逐词生成的范式下生成密集字幕严重限制了推理效率,并且随着视频长度和事件密度的增加,阻碍了可扩展性。在这项工作中,我们提出了一个并行自回归框架,不仅提高了生成效率,还增强了时间锚定的字幕生成性能。我们的关键洞察是利用时间上不同事件之间的弱局部依赖关系来重构因果依赖图,从而实现无损并行生成。具体来说,跨事件依赖较弱的词元可以并行解码,而每个事件内部紧密耦合的词元则保留顺序解码以保持局部语义连贯性。为了实现这一洞察,我们引入了两个关键组件用于无损并行解码:(1)潜在全局规划机制,自动学习事件级结构并生成紧凑的词元,编码全局事件间因果关系,同时自适应地聚合事件级的视听语义,指导后续的依赖重构和并行解码;(2)事件分解的并行解码机制,有效平衡局部关注与全局事件间感知。在各种基准上的实验证明了我们的方法在全模态事件定位和字幕生成中在效率和性能上的明显优势。项目网站:https://github.com/showlab/PadCaptioner。
查看原文
查看缓存全文

缓存时间: 2026/07/08 06:48

论文页面 - 面向全模态密集视频描述的自回归并行解码

来源:https://huggingface.co/papers/2607.02963 我们提出了 PadCaptioner,一个 3B 参数的全模态密集视频描述模型,在高效性和强接地描述质量上超越 7B 量级同行,实现了优异性能。

核心思路是利用时间上不同事件之间的弱局部依赖关系,重构因果 token 依赖结构,从而实现无损并行生成。

我们设计了一种潜在规划机制,能够自动确定具有非局部感知能力的可并行化单元,指导后续并行解码,并提升事件接地与描述质量。

代码将在 https://github.com/showlab/PadCaptioner 开源。欢迎给我们 ⭐ 以获取最新动态!

相似文章

Video2LoRA: 视觉-语言模型的参数化视频内化

Hugging Face Daily Papers

本文介绍Video2LoRA,一种直接从视频表示预测低秩适配(LoRA)权重的方法,能够在冻结的视觉-语言模型中实现高效的视频处理。它将视觉令牌负载降低最多1500倍,查询TTFT降低6-80倍,同时在视频摘要和字幕生成基准上保持性能。

AdaCodec:面向视频多模态大模型的预测性视觉编码

Hugging Face Daily Papers

AdaCodec 通过仅在场景预测失败时传输完整视觉标记,否则使用紧凑的帧间变化描述,从而减少多模态大模型中的视频编码冗余。在匹配的标记预算下,它优于逐帧 RGB 基线,并且在使用显著更少标记的情况下取得更好或相当的结果,将首令牌延迟从 9.26 秒降至 1.62 秒。

LoomVideo:统一多模态输入的视频生成与编辑

Hugging Face Daily Papers

LoomVideo提出了一种5B参数的统一架构用于视频生成和编辑,通过新颖的条件机制和多模态对齐减少计算开销,实现了具有竞争力的性能和更快的推理速度。