RefCaptioner:多参考图像 grounded 视频字幕生成

Hugging Face Daily Papers 论文

摘要

介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。

现有的视频字幕生成模型能够生成视频内容的自然语言描述,但无法将局部视觉元素显式地连接到多张参考图像。我们提出了多参考图像 grounded 视频字幕生成这一新任务,要求生成具有短语级参考 grounded 的事实性视频描述,并为此任务提出了 RefCaptioner,一个两阶段后训练框架。RefCaptioner 结合了混合数据 SFT 和分层覆盖率折扣 GRPO,在保持通用视频字幕能力的同时,联合改进参考选择、短语级绑定、干扰项拒绝和跨参考一致性。为了支持训练,我们构建了一个包含 20,000 个视频和 171,354 张参考图像的语料库。我们还介绍了 MRVBench,一个用于在真实世界和 AI 生成视频上评估字幕事实性和多参考图像 grounding 的基准。实验表明,RefCaptioner 在开源模型中取得了最佳总体性能,同时在标准视频字幕基准上保持竞争力。人工评估进一步证实,其字幕更受标注者青睐,并且在使用开源和专有视频生成器时,能够实现更忠实于源的视频重建。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:53

论文页面 - RefCaptioner:多参考图像锚定的视频描述生成

来源: https://huggingface.co/papers/2607.28509 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

现有视频描述生成模型能够生成视频内容的自然语言描述,但无法将局部视觉元素显式地锚定到多个参考图像。我们引入了多参考图像锚定的视频描述生成(multi-reference image-grounded video captioning),这一新任务要求生成事实性视频描述并进行短语级别的参考锚定,并为此提出了RefCaptioner,一个两阶段后训练框架。RefCaptioner结合混合数据SFT与层级覆盖折扣GRPO(Hierarchical Coverage-Discounted GRPO),在保持通用视频描述能力的同时,联合提升参考选择、短语级绑定、干扰项拒绝和跨参考一致性。为支持训练,我们构建了一个包含20,000个视频和171,354张参考图像的语料库。我们还引入了MRVBench,一个用于在真实世界和AI生成的视频上评估描述事实性和多参考锚定能力的基准。实验表明,RefCaptioner在开源模型中取得了最佳整体性能,同时在标准视频描述基准上保持竞争力。人工评估进一步证实,其描述更受标注者青睐,并且在使用开源和专有视频生成器时,能够实现更忠实于原始资源的视频重建。

查看arXiv页面 (https://arxiv.org/abs/2607.28509)查看PDF (https://arxiv.org/pdf/2607.28509)GitHub1 (https://github.com/pkucs-Ltf/RefCaptioner)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28509)

引用此论文的模型1

TengfeiLiuCoder/RefCaptioner 图像-文本到文本 • 9B • 更新于24分钟前 (https://huggingface.co/TengfeiLiuCoder/RefCaptioner)

引用此论文的数据集0

没有链接到此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2607.28509 以从此页面链接它。

引用此论文的 Spaces0

没有链接到此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2607.28509 以从此页面链接它。

包含此论文的收藏0

没有包含此论文的收藏

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

BalCapRL:一种用于基于强化学习的 MLLM 图像描述生成的平衡框架

Hugging Face Daily Papers

本文介绍了 BalCapRL,这是一种针对多模态大语言模型(MLLM)的平衡强化学习框架,旨在联合优化图像描述生成中的准确性、覆盖率和语言质量。通过奖励解耦和长度条件屏蔽来解决实用性与流畅性之间的权衡,该方法在性能上优于现有方法。

GAVEL:有依据的描述错误验证与定位

arXiv cs.CL

GAVEL 提出了一个新任务,用于验证、解释和定位图像-文本对中的错误,并附带一个数据集和基准。一个监督基线显示出相对于强闭源模型的改进。