RefCaptioner:多参考图像 grounded 视频字幕生成
摘要
介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。
查看缓存全文
缓存时间: 2026/07/31 05:53
论文页面 - RefCaptioner:多参考图像锚定的视频描述生成
来源: https://huggingface.co/papers/2607.28509 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
现有视频描述生成模型能够生成视频内容的自然语言描述,但无法将局部视觉元素显式地锚定到多个参考图像。我们引入了多参考图像锚定的视频描述生成(multi-reference image-grounded video captioning),这一新任务要求生成事实性视频描述并进行短语级别的参考锚定,并为此提出了RefCaptioner,一个两阶段后训练框架。RefCaptioner结合混合数据SFT与层级覆盖折扣GRPO(Hierarchical Coverage-Discounted GRPO),在保持通用视频描述能力的同时,联合提升参考选择、短语级绑定、干扰项拒绝和跨参考一致性。为支持训练,我们构建了一个包含20,000个视频和171,354张参考图像的语料库。我们还引入了MRVBench,一个用于在真实世界和AI生成的视频上评估描述事实性和多参考锚定能力的基准。实验表明,RefCaptioner在开源模型中取得了最佳整体性能,同时在标准视频描述基准上保持竞争力。人工评估进一步证实,其描述更受标注者青睐,并且在使用开源和专有视频生成器时,能够实现更忠实于原始资源的视频重建。
查看arXiv页面 (https://arxiv.org/abs/2607.28509)查看PDF (https://arxiv.org/pdf/2607.28509)GitHub1 (https://github.com/pkucs-Ltf/RefCaptioner)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28509)
引用此论文的模型1
TengfeiLiuCoder/RefCaptioner 图像-文本到文本 • 9B • 更新于24分钟前 (https://huggingface.co/TengfeiLiuCoder/RefCaptioner)
引用此论文的数据集0
没有链接到此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2607.28509 以从此页面链接它。
引用此论文的 Spaces0
没有链接到此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2607.28509 以从此页面链接它。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
MultiRef-Compass: 迈向多参考到音频视频生成的全面评估
本文介绍了MultiRef-Compass,这是针对多参考到音频视频生成的全面基准,包含350个精心挑选的样本和评估协议,涵盖四个维度:基础质量、参考一致性、音视频一致性和指令遵循。
PANORAMA: 通过掩码提案选择实现的全景定位描述
本文提出了 PANORAMA,一个用于全景定位描述的视觉-语言模型,该模型通过掩码提案选择利用像素级掩码为描述进行定位,并引入了 PanoCaps 基准进行评估。
CapMem:基于字幕的第一人称视频情景记忆基准测试
CapMem 是一个用于第一人称视频情景记忆的人工标注基准测试,使用字幕进行标注。研究表明,在长视频上,基于字幕的问答性能优于直接视频问答。
BalCapRL:一种用于基于强化学习的 MLLM 图像描述生成的平衡框架
本文介绍了 BalCapRL,这是一种针对多模态大语言模型(MLLM)的平衡强化学习框架,旨在联合优化图像描述生成中的准确性、覆盖率和语言质量。通过奖励解耦和长度条件屏蔽来解决实用性与流畅性之间的权衡,该方法在性能上优于现有方法。
将视觉-语言接地视为双向概念对应
本文介绍了ConCor-1,一种接地模型,将视觉-语言接地视为双向概念对应,无需预设短语即可联合恢复文本跨度、图像片段和跨模态匹配。它统一了短语接地、指称表达接地和开放词汇检测,在长标题和零样本LVIS基准上实现了显著的F1提升。