全模态密集视频字幕生成的并行自回归解码
摘要
本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。
查看缓存全文
缓存时间: 2026/07/08 06:48
论文页面 - 面向全模态密集视频描述的自回归并行解码
来源:https://huggingface.co/papers/2607.02963 我们提出了 PadCaptioner,一个 3B 参数的全模态密集视频描述模型,在高效性和强接地描述质量上超越 7B 量级同行,实现了优异性能。
核心思路是利用时间上不同事件之间的弱局部依赖关系,重构因果 token 依赖结构,从而实现无损并行生成。
我们设计了一种潜在规划机制,能够自动确定具有非局部感知能力的可并行化单元,指导后续并行解码,并提升事件接地与描述质量。
代码将在 https://github.com/showlab/PadCaptioner 开源。欢迎给我们 ⭐ 以获取最新动态!
相似文章
OmniCap-IF:全模态视频字幕生成中指令跟随能力的基准测试与提升
介绍了OmniCap-IF,这是首个用于评估全模态视频字幕生成中指令跟随能力的综合性基准,揭示了格式-内容权衡,并提出了改进的模型和数据集。
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。
视频中定位万物:重新思考高效生成式时空视频定位
Parallel Tube Decoding 通过消除自回归依赖,实现高效的同步时空视频定位,减少延迟并提高准确性,优于标准方法。
视频生成的并行解码(10分钟阅读)
NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。
OmniScope:全模态大语言模型的模态解耦令牌压缩
OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。