CLIP-CC-Bench: 评估视频-语言模型中的段落级视频描述

Hugging Face Daily Papers 论文

摘要

介绍了CLIP-CC-Bench,一个用于评估视频-语言模型在电影片段段落级描述上的基准,包含200个片段和人工参考段落。测试了17个模型,发现长格式视频描述仍未解决。

基准测试视频-语言模型主要集中在短视频片段和单句指标上,这留下了一个问题:当前系统能否生成准确的、长格式的段落级描述。我们引入了CLIP-CC-Bench,这是一个用于长格式视频描述的评估套件,基于5小时的电影内容,分割成90秒的片段,每个片段都配有专家撰写的段落式参考。该评估套件使用五个最先进的基于LLM的嵌入模型集成,以提高可靠性并减少单一模型的偏差,并采用两种互补的方法:(i) 粗粒度语义匹配和 (ii) 细粒度语义匹配,将模型生成的描述与CLIP-CC-Bench参考进行比较。使用该框架,我们评估了17个最先进的视频-语言模型,并报告它们在CLIP-CC-Bench上的Borda聚合排名和平均分数。我们进一步通过评估者间一致性和bootstrap排名稳定性来量化协议的内部可靠性。我们在https://github.com/Multimodal-Intelligence-Lab/CLIP-CC-Bench发布了标准化评估脚本、模型输出和聚合工具,以支持可重复性。CLIP-CC-Bench为长格式视频描述提供了一个实用的评估框架,填补了现有短视频片段和仅问答基准留下的空白。
查看原文
查看缓存全文

缓存时间: 2026/08/10 22:17

论文主页 - CLIP-CC-Bench:评估视频语言模型中的段落级视频描述

Source: https://huggingface.co/papers/2608.04302 视频语言模型能就一分钟的电影写出忠实的段落吗?

视频基准测试仍然依赖短视频片段、单句标题和多项选择问答——这些都无法测试长形式描述。CLIP-CC-Bench 做到了。

🎬 200个电影片段(每个约90秒,总计5小时,涵盖1959年至2024年的140多部影片),每个片段配有一段人工叙述的参考段落,平均约400字。叙述者只描述屏幕上的内容——不使用专有名词——因此识别出电影对模型没有任何好处。

⚖️ 17个视频语言模型5个嵌入评分器的集成进行评分,将段落级(粗粒度)和句子级(细粒度)匹配结合为一个调和平均数,并通过波达计数法进行聚合。

📉 模型掌握了情节,而不是细节。 几乎每个模型的粗粒度分数都优于细粒度分数,最佳系统的平均HM-CF仅为0.67——长形式视频描述远未解决。

🔁 我们还对协议本身进行了压力测试:五个评分器在排名上的平均斯皮尔曼相关系数为0.98,并且在片段集的1,000次自助重采样中,顶级模型每次都保持第一——因此排行榜是任务本身的性质,而不是我们恰好选择了哪200个片段。

数据集、全部17个模型的每个片段分数以及完整评估流程均已发布。

相似文章

CoVEBench:视频编辑模型能否处理复杂指令?

Hugging Face Daily Papers

引入CoVEBench,这是一个用于评估组合视频编辑能力的新基准,解决了现有模型在处理复杂多步骤指令时的局限性。该基准包含416个视频、626条指令和9,990个检查项,揭示当前模型在组合编辑任务中表现不佳。