CAPEval:一种跨越理解与生成的解耦式图像描述评估方法
摘要
介绍了CAPEval,一个将覆盖率和精确度解耦的图像描述评估框架,表明覆盖率能更好地预测视觉-语言理解性能,而精确度则能更好地预测文本到图像生成性能。
查看缓存全文
缓存时间: 2026/08/05 05:43
论文页面 - CAPEval:一种将字幕评估解耦为理解与生成的方法
来源:https://huggingface.co/papers/2608.02589 代码:https://github.com/liuzhipenggg/CAPEval
假设一张图片包含 10 个事实性陈述:字幕 A 涵盖了其中 9 个,但其中 2 个表述有误,而字幕 B 只提到了 5 个,且全部事实正确。哪个字幕质量更高?
你可能会感到困惑。
这个问题很难用一个单一的聚合分数来解决,因为每个字幕各有优点。字幕 A 的优势在于其全面性,而字幕 B 的优势在于事实准确性。
在过去几年中,越来越多的研究工作使用视觉语言模型来重新生成训练图像的字幕,旨在通过更丰富、更准确的字幕来提高数据集质量。字幕在多模态模型训练中的重要性现已得到广泛认可。
然而,正如开头的例子所展示的,一个更根本的问题仍然未被充分理解:什么样的字幕才能真正有益于下游模型的训练?
为了解决这个问题,我们提出了一个新的字幕评估框架:CAPEval(Coverage And Precision Evaluation,覆盖度与精确度评估)。与以往孤立评估字幕的基准不同,我们进一步训练视觉语言模型和文生图模型,使用由不同字幕模型生成的字幕。通过控制变量实验,我们考察了字幕的不同质量属性最终如何影响下游模型性能。
我们的论文发现了一个清晰的任务相关解耦:覆盖度是理解性能的更强相关因素,而精确度是生成性能的主导预测因素。
相似文章
RefCaptioner:多参考图像 grounded 视频字幕生成
介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。
PEEK:通过高效知识蒸馏选取关键帧
介绍PEEK,一种高效动态帧采样方法,它从教师模型中蒸馏出字幕条件帧相关性排名,并将其融入轻量级时序模型,在视频字幕生成中优于最先进方法,同时保持计算效率。
EvalVerse:面向专业电影级视频生成的流水线感知与专家校准基准测试
EvalVerse是一个面向专业电影级视频生成的全面评估框架,它利用专家校准的视觉语言模型和多阶段评估,弥合人类审美判断与机器评分之间的鸿沟。
CaVe-VLM-CoT:一个可解释的视觉-语言模型框架
CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。
GAVEL:有依据的描述错误验证与定位
GAVEL 提出了一个新任务,用于验证、解释和定位图像-文本对中的错误,并附带一个数据集和基准。一个监督基线显示出相对于强闭源模型的改进。