RefCaptioner:多参考图像 grounded 视频字幕生成
摘要
介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。
查看缓存全文
缓存时间: 2026/07/31 05:53
论文页面 - RefCaptioner:多参考图像锚定的视频描述生成
来源: https://huggingface.co/papers/2607.28509 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
现有视频描述生成模型能够生成视频内容的自然语言描述,但无法将局部视觉元素显式地锚定到多个参考图像。我们引入了多参考图像锚定的视频描述生成(multi-reference image-grounded video captioning),这一新任务要求生成事实性视频描述并进行短语级别的参考锚定,并为此提出了RefCaptioner,一个两阶段后训练框架。RefCaptioner结合混合数据SFT与层级覆盖折扣GRPO(Hierarchical Coverage-Discounted GRPO),在保持通用视频描述能力的同时,联合提升参考选择、短语级绑定、干扰项拒绝和跨参考一致性。为支持训练,我们构建了一个包含20,000个视频和171,354张参考图像的语料库。我们还引入了MRVBench,一个用于在真实世界和AI生成的视频上评估描述事实性和多参考锚定能力的基准。实验表明,RefCaptioner在开源模型中取得了最佳整体性能,同时在标准视频描述基准上保持竞争力。人工评估进一步证实,其描述更受标注者青睐,并且在使用开源和专有视频生成器时,能够实现更忠实于原始资源的视频重建。
查看arXiv页面 (https://arxiv.org/abs/2607.28509)查看PDF (https://arxiv.org/pdf/2607.28509)GitHub1 (https://github.com/pkucs-Ltf/RefCaptioner)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28509)
引用此论文的模型1
TengfeiLiuCoder/RefCaptioner 图像-文本到文本 • 9B • 更新于24分钟前 (https://huggingface.co/TengfeiLiuCoder/RefCaptioner)
引用此论文的数据集0
没有链接到此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2607.28509 以从此页面链接它。
引用此论文的 Spaces0
没有链接到此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2607.28509 以从此页面链接它。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
MultiRef-Compass: 迈向多参考到音频视频生成的全面评估
本文介绍了MultiRef-Compass,这是针对多参考到音频视频生成的全面基准,包含350个精心挑选的样本和评估协议,涵盖四个维度:基础质量、参考一致性、音视频一致性和指令遵循。
BalCapRL:一种用于基于强化学习的 MLLM 图像描述生成的平衡框架
本文介绍了 BalCapRL,这是一种针对多模态大语言模型(MLLM)的平衡强化学习框架,旨在联合优化图像描述生成中的准确性、覆盖率和语言质量。通过奖励解耦和长度条件屏蔽来解决实用性与流畅性之间的权衡,该方法在性能上优于现有方法。
GAVEL:有依据的描述错误验证与定位
GAVEL 提出了一个新任务,用于验证、解释和定位图像-文本对中的错误,并附带一个数据集和基准。一个监督基线显示出相对于强闭源模型的改进。
OmniCap-IF:全模态视频字幕生成中指令跟随能力的基准测试与提升
介绍了OmniCap-IF,这是首个用于评估全模态视频字幕生成中指令跟随能力的综合性基准,揭示了格式-内容权衡,并提出了改进的模型和数据集。
CAPEval:一种跨越理解与生成的解耦式图像描述评估方法
介绍了CAPEval,一个将覆盖率和精确度解耦的图像描述评估框架,表明覆盖率能更好地预测视觉-语言理解性能,而精确度则能更好地预测文本到图像生成性能。