全模态密集视频字幕生成的并行自回归解码
摘要
本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。
查看缓存全文
缓存时间: 2026/07/08 06:48
论文页面 - 面向全模态密集视频描述的自回归并行解码
来源:https://huggingface.co/papers/2607.02963 我们提出了 PadCaptioner,一个 3B 参数的全模态密集视频描述模型,在高效性和强接地描述质量上超越 7B 量级同行,实现了优异性能。
核心思路是利用时间上不同事件之间的弱局部依赖关系,重构因果 token 依赖结构,从而实现无损并行生成。
我们设计了一种潜在规划机制,能够自动确定具有非局部感知能力的可并行化单元,指导后续并行解码,并提升事件接地与描述质量。
代码将在 https://github.com/showlab/PadCaptioner 开源。欢迎给我们 ⭐ 以获取最新动态!
相似文章
OmniCap-IF:全模态视频字幕生成中指令跟随能力的基准测试与提升
介绍了OmniCap-IF,这是首个用于评估全模态视频字幕生成中指令跟随能力的综合性基准,揭示了格式-内容权衡,并提出了改进的模型和数据集。
LatentOmni:通过统一视听潜在推理重新思考全模态理解
LatentOmni提出了一种用于视听推理的统一潜在空间,避免了基于文本的思维链带来的信息损失。在视听推理基准测试中,它在开源模型中达到了最先进的性能。
Video2LoRA: 视觉-语言模型的参数化视频内化
本文介绍Video2LoRA,一种直接从视频表示预测低秩适配(LoRA)权重的方法,能够在冻结的视觉-语言模型中实现高效的视频处理。它将视觉令牌负载降低最多1500倍,查询TTFT降低6-80倍,同时在视频摘要和字幕生成基准上保持性能。
AdaCodec:面向视频多模态大模型的预测性视觉编码
AdaCodec 通过仅在场景预测失败时传输完整视觉标记,否则使用紧凑的帧间变化描述,从而减少多模态大模型中的视频编码冗余。在匹配的标记预算下,它优于逐帧 RGB 基线,并且在使用显著更少标记的情况下取得更好或相当的结果,将首令牌延迟从 9.26 秒降至 1.62 秒。
LoomVideo:统一多模态输入的视频生成与编辑
LoomVideo提出了一种5B参数的统一架构用于视频生成和编辑,通过新颖的条件机制和多模态对齐减少计算开销,实现了具有竞争力的性能和更快的推理速度。