video-captioning

标签

Cards List
#video-captioning

少读多写:一种用于流式多模态解码器的闭式带宽调节器

arXiv cs.CL ↗ · 6天前 缓存

本文介绍了ZENDAYA,这是一种用于流式多模态解码器的闭式带宽调节器,它动态调整输入读取以提高实时文本生成性能。研究表明,在视频和音频基准测试中,减少输入消耗可以增强流式设置下的质量和效率。

0 人收藏 0 人点赞
#video-captioning

RefCaptioner:多参考图像 grounded 视频字幕生成

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。

0 人收藏 0 人点赞
#video-captioning

PEEK:通过高效知识蒸馏选取关键帧

Hugging Face Daily Papers ↗ · 2026-05-29 缓存

介绍PEEK,一种高效动态帧采样方法,它从教师模型中蒸馏出字幕条件帧相关性排名,并将其融入轻量级时序模型,在视频字幕生成中优于最先进方法,同时保持计算效率。

0 人收藏 0 人点赞
#video-captioning

NemoStation/Marlin-2B

Hugging Face Models Trending ↗ · 2026-05-13

NemoStation/Marlin-2B 是基于 Qwen3.5-2B 微调的模型,用于视频-文本到文本任务,支持视频字幕生成和时间定位。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈