dense-video-captioning

标签

Cards List
#dense-video-captioning

全模态密集视频字幕生成的并行自回归解码

Hugging Face Daily Papers · 2026-07-03 缓存

本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈