ViMU:视频隐喻理解基准

Hugging Face Daily Papers 论文

摘要

ViMU是首个旨在评估视频理解模型超越字面视觉理解、解读隐喻、讽刺及社会意义能力的基准,采用无提示的开放式和多项选择题。

任何新媒介,一旦出现,其用途就不仅仅局限于传递显性内容。它所承载的信息通常分为两个层面:一是直接呈现的内容,二是其下的潜台词——创作者试图通过媒介传达的隐含意图和理念。同样,自从视频技术被广泛采用以来,视频不仅成为记录和交流视觉信息的强大工具,也成为情感、态度和社会意义的载体,这些往往难以明确言说。因此,许多视频的真正含义并不单纯在于屏幕所展示的内容,而常常嵌入于语境、表达方式以及观看者的社会经验之中。这类视频潜台词有些是幽默的,有些则带有讽刺、嘲弄或批评意味。这些隐含意义在不同文化背景和社会群体中的解读也可能大相径庭。然而,现有的视频理解模型大多仍主要关注字面的视觉理解,例如识别物体、动作或时序关系,缺乏系统性理解视频中隐喻、讽刺和社会意义的能力。为弥补这一空白,我们提出了ViMU,这是首个旨在系统评估前沿模型在视频中理解潜台词能力的基准。ViMU评估视频理解模型是否能超越字面感知,推断隐含意义,同时将其解释植根于多模态证据,并回答开放式和多项选择题。重要的是,所有问题均设计为无提示,确保在回答前不向模型透露任何关键证据。
查看原文
查看缓存全文

缓存时间: 2026/05/15 12:25

论文页面 - ViMU:视频隐喻理解基准

来源:https://huggingface.co/papers/2605.14607

摘要

视频理解模型缺乏解释字面视觉理解之外的隐含意义和社会语境的能力,因此需要新的基准评测方法。

任何新媒介一经出现,其用途就远超单纯传递表面内容。它所承载的信息通常在两个层面运作:一是直接呈现的内容,二是其下的潜台词——创作者试图通过媒介传达的隐含思想和意图。同样,自从视频技术被广泛采用以来,视频不仅成为记录和传播视觉信息的强大工具,也成为了承载情感、态度和社会意义的载体,而这些往往难以明确表达。因此,许多视频的真正含义并不仅仅存在于屏幕上所展示的内容中,而是常常嵌入在语境、表达风格以及观看者的社会经验之中。某些形式的视频潜台词是幽默的,而另一些则带有讽刺、嘲弄或批评。这些隐含意义在不同文化背景和社会群体中也可能被截然不同地解读。然而,现有的大多数视频理解模型仍然主要关注字面的视觉理解,例如识别对象、动作或时序关系,缺乏系统性地理解视频中嵌入的隐喻、讽刺和社会意义的能力。为弥补这一不足,我们提出了ViMU,这是第一个专门用于系统评估前沿模型在视频中潜台词理解能力的基准。ViMU评估视频理解模型是否能够超越字面感知,推断隐含意义,同时将其解读建立在多模态证据之上,并回答开放式和多项选择题。重要的是,所有问题均为无提示设计,确保在回答前不会向模型透露任何关键证据。

查看arXiv页面 (https://arxiv.org/abs/2605.14607)查看PDF (https://arxiv.org/pdf/2605.14607)项目页面 (https://liqiiiii.github.io/Video-Metaphorical-Understanding/)GitHub10 (https://github.com/LiQiiiii/Video-Metaphorical-Understanding)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.14607)

在你的代理中获取此论文:

hf papers read 2605\.14607

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.14607 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.14607 以从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.14607 以从此页面链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

MetaphorVU:面向隐喻视频理解

Hugging Face Daily Papers

本文介绍了MetaphorVU-Bench,这是首个针对隐喻视频理解的系统化基准,并提出了MetaphorBoost,一种推理时增强框架,可改善多模态大语言模型中的跨域映射。

多模态视频理解中视觉状态追踪的基准测试

Hugging Face Daily Papers

介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。

@samsja19:很棒的基准

X AI KOLs Following

介绍 VGI-Bench,这是一个多模态基准测试,通过 550 个人工策划的问题来评估 12 种不同的视觉和视听技能,旨在暴露当今视频基准测试中的不足。