image-grounded

标签

Cards List
#image-grounded

RefCaptioner:多参考图像 grounded 视频字幕生成

Hugging Face Daily Papers · 2026-07-30 缓存

介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈