CAPEval:一种跨越理解与生成的解耦式图像描述评估方法

Hugging Face Daily Papers 论文

摘要

介绍了CAPEval,一个将覆盖率和精确度解耦的图像描述评估框架,表明覆盖率能更好地预测视觉-语言理解性能,而精确度则能更好地预测文本到图像生成性能。

图像描述(Captions)是多模态理解和文本到图像生成的主要监督信号。然而,先前的评估将描述质量视为单一的标量目标,这混淆了两个不同的属性:(1)描述覆盖了多少视觉信息;(2)图像支撑描述中陈述断言的可靠性。为此,我们设计了一个解耦的描述评估基准——CAPEval(覆盖率和精确率评估),其中包含人工编写的真值描述(ground-truth captions)和人工验证的原子清单项。具体而言,CAPEval 将描述质量分解为覆盖率(Coverage)和精确率(Precision)。前者量化描述覆盖真实事实内容的彻底程度,后者反映描述中所有声明的实际正确率。我们选取了10个描述生成器(captioners),并进一步使用它们从四个模型族开展受控的下游端到端实验,其中描述来源是唯一变量。经验上,我们发现一种一致的任务依赖分离:覆盖率是理解性能的更强相关性指标,而精确率是生成性能的主导预测指标。这种解耦评估范式不仅提供更细粒度的描述质量诊断,还为针对不同下游任务选择和优化描述生成器提供了可操作的指导。
查看原文
查看缓存全文

缓存时间: 2026/08/05 05:43

论文页面 - CAPEval:一种将字幕评估解耦为理解与生成的方法

来源:https://huggingface.co/papers/2608.02589 代码:https://github.com/liuzhipenggg/CAPEval

假设一张图片包含 10 个事实性陈述:字幕 A 涵盖了其中 9 个,但其中 2 个表述有误,而字幕 B 只提到了 5 个,且全部事实正确。哪个字幕质量更高?

你可能会感到困惑。

这个问题很难用一个单一的聚合分数来解决,因为每个字幕各有优点。字幕 A 的优势在于其全面性,而字幕 B 的优势在于事实准确性

在过去几年中,越来越多的研究工作使用视觉语言模型来重新生成训练图像的字幕,旨在通过更丰富、更准确的字幕来提高数据集质量。字幕在多模态模型训练中的重要性现已得到广泛认可。

然而,正如开头的例子所展示的,一个更根本的问题仍然未被充分理解:什么样的字幕才能真正有益于下游模型的训练?

为了解决这个问题,我们提出了一个新的字幕评估框架:CAPEvalCoverage And Precision Evaluation,覆盖度与精确度评估)。与以往孤立评估字幕的基准不同,我们进一步训练视觉语言模型和文生图模型,使用由不同字幕模型生成的字幕。通过控制变量实验,我们考察了字幕的不同质量属性最终如何影响下游模型性能。

我们的论文发现了一个清晰的任务相关解耦:覆盖度是理解性能的更强相关因素,而精确度是生成性能的主导预测因素。

相似文章

RefCaptioner:多参考图像 grounded 视频字幕生成

Hugging Face Daily Papers

介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。

PEEK:通过高效知识蒸馏选取关键帧

Hugging Face Daily Papers

介绍PEEK,一种高效动态帧采样方法,它从教师模型中蒸馏出字幕条件帧相关性排名,并将其融入轻量级时序模型,在视频字幕生成中优于最先进方法,同时保持计算效率。

CaVe-VLM-CoT:一个可解释的视觉-语言模型框架

arXiv cs.AI

CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。

GAVEL:有依据的描述错误验证与定位

arXiv cs.CL

GAVEL 提出了一个新任务,用于验证、解释和定位图像-文本对中的错误,并附带一个数据集和基准。一个监督基线显示出相对于强闭源模型的改进。