ViMU:视频隐喻理解基准
摘要
ViMU是首个旨在评估视频理解模型超越字面视觉理解、解读隐喻、讽刺及社会意义能力的基准,采用无提示的开放式和多项选择题。
查看缓存全文
缓存时间: 2026/05/15 12:25
论文页面 - ViMU:视频隐喻理解基准
来源:https://huggingface.co/papers/2605.14607
摘要
视频理解模型缺乏解释字面视觉理解之外的隐含意义和社会语境的能力,因此需要新的基准评测方法。
任何新媒介一经出现,其用途就远超单纯传递表面内容。它所承载的信息通常在两个层面运作:一是直接呈现的内容,二是其下的潜台词——创作者试图通过媒介传达的隐含思想和意图。同样,自从视频技术被广泛采用以来,视频不仅成为记录和传播视觉信息的强大工具,也成为了承载情感、态度和社会意义的载体,而这些往往难以明确表达。因此,许多视频的真正含义并不仅仅存在于屏幕上所展示的内容中,而是常常嵌入在语境、表达风格以及观看者的社会经验之中。某些形式的视频潜台词是幽默的,而另一些则带有讽刺、嘲弄或批评。这些隐含意义在不同文化背景和社会群体中也可能被截然不同地解读。然而,现有的大多数视频理解模型仍然主要关注字面的视觉理解,例如识别对象、动作或时序关系,缺乏系统性地理解视频中嵌入的隐喻、讽刺和社会意义的能力。为弥补这一不足,我们提出了ViMU,这是第一个专门用于系统评估前沿模型在视频中潜台词理解能力的基准。ViMU评估视频理解模型是否能够超越字面感知,推断隐含意义,同时将其解读建立在多模态证据之上,并回答开放式和多项选择题。重要的是,所有问题均为无提示设计,确保在回答前不会向模型透露任何关键证据。
查看arXiv页面 (https://arxiv.org/abs/2605.14607)查看PDF (https://arxiv.org/pdf/2605.14607)项目页面 (https://liqiiiii.github.io/Video-Metaphorical-Understanding/)GitHub10 (https://github.com/LiQiiiii/Video-Metaphorical-Understanding)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.14607)
在你的代理中获取此论文:
hf papers read 2605\.14607
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.14607 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.14607 以从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.14607 以从此页面链接。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
MetaphorVU:面向隐喻视频理解
本文介绍了MetaphorVU-Bench,这是首个针对隐喻视频理解的系统化基准,并提出了MetaphorBoost,一种推理时增强框架,可改善多模态大语言模型中的跨域映射。
Video-MME-Logical: 一种用于视频时间逻辑推理的受控诊断基准
提出 Video-MME-Logical,一个用于评估多模态大语言模型中视频时间逻辑推理的受控基准,揭示了一个显著的人机差距。
VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。
多模态视频理解中视觉状态追踪的基准测试
介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。
@samsja19:很棒的基准
介绍 VGI-Bench,这是一个多模态基准测试,通过 550 个人工策划的问题来评估 12 种不同的视觉和视听技能,旨在暴露当今视频基准测试中的不足。