CLIP-CC-Bench: 评估视频-语言模型中的段落级视频描述
摘要
介绍了CLIP-CC-Bench,一个用于评估视频-语言模型在电影片段段落级描述上的基准,包含200个片段和人工参考段落。测试了17个模型,发现长格式视频描述仍未解决。
查看缓存全文
缓存时间: 2026/08/10 22:17
论文主页 - CLIP-CC-Bench:评估视频语言模型中的段落级视频描述
Source: https://huggingface.co/papers/2608.04302 视频语言模型能就一分钟的电影写出忠实的段落吗?
视频基准测试仍然依赖短视频片段、单句标题和多项选择问答——这些都无法测试长形式描述。CLIP-CC-Bench 做到了。
🎬 200个电影片段(每个约90秒,总计5小时,涵盖1959年至2024年的140多部影片),每个片段配有一段人工叙述的参考段落,平均约400字。叙述者只描述屏幕上的内容——不使用专有名词——因此识别出电影对模型没有任何好处。
⚖️ 17个视频语言模型由5个嵌入评分器的集成进行评分,将段落级(粗粒度)和句子级(细粒度)匹配结合为一个调和平均数,并通过波达计数法进行聚合。
📉 模型掌握了情节,而不是细节。 几乎每个模型的粗粒度分数都优于细粒度分数,最佳系统的平均HM-CF仅为0.67——长形式视频描述远未解决。
🔁 我们还对协议本身进行了压力测试:五个评分器在排名上的平均斯皮尔曼相关系数为0.98,并且在片段集的1,000次自助重采样中,顶级模型每次都保持第一——因此排行榜是任务本身的性质,而不是我们恰好选择了哪200个片段。
数据集、全部17个模型的每个片段分数以及完整评估流程均已发布。
相似文章
Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力
Video-IFBench 介绍了一个综合基准,用于评估多模态大语言模型在视频理解任务中遵循多样化指令的能力,涵盖多种约束条件和任务类型。
VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。
Video-MME-Logical: 一种用于视频时间逻辑推理的受控诊断基准
提出 Video-MME-Logical,一个用于评估多模态大语言模型中视频时间逻辑推理的受控基准,揭示了一个显著的人机差距。
AnyGroundBench: 视觉语言模型中视频定位的专业领域基准
介绍 AnyGroundBench,这是一个面向时空视频定位的领域自适应基准,评估了五个专业领域的15个视觉语言模型,发现当前模型在零样本和上下文学习适应中均失败。
CoVEBench:视频编辑模型能否处理复杂指令?
引入CoVEBench,这是一个用于评估组合视频编辑能力的新基准,解决了现有模型在处理复杂多步骤指令时的局限性。该基准包含416个视频、626条指令和9,990个检查项,揭示当前模型在组合编辑任务中表现不佳。