Video-MME-Logical: 一种用于视频时间逻辑推理的受控诊断基准

Hugging Face Daily Papers 论文

摘要

提出 Video-MME-Logical,一个用于评估多模态大语言模型中视频时间逻辑推理的受控基准,揭示了一个显著的人机差距。

近期对多模态大语言模型(MLLMs)的关注引发了一个核心问题:它们能否对动态视觉证据进行推理,而不仅仅是识别单个帧中的物体或事件?我们将这种能力称为视频时间逻辑推理,它要求模型在帧间视觉状态演变时维护、更新和组合证据。现有的视频基准常常将这一能力与场景复杂度、静态识别或不受控的时间变化混为一谈。为了隔离这一能力,我们提出了 Video-MME-Logical,一个围绕五种时间逻辑操作组织的受控基准:状态跟踪、顺序计数、时间排序、动态空间性和结构组成。该基准包含25个细粒度任务类别,通过受控的对象状态、转换、时间依赖和逻辑组合生成。它通过改变时间跨度和推理复杂度实现难度可控的最终答案评估,并通过验证模型在生成最终答案前是否恢复所需的逻辑推理轨迹来支持中间状态诊断。使用最先进的多模态大语言模型进行的实验揭示了一个显著的人机差距,尤其是在时间逻辑复杂度增加时。对多达50万生成样本进行有监督微调可以提升性能,但仍不足以弥合推理差距,这使得 Video-MME-Logical 成为分析和改进多模态大语言模型中时间逻辑推理的可扩展测试平台。
查看原文
查看缓存全文

缓存时间: 2026/06/30 07:35

论文页面 - Video-MME-Logical:面向视频时间-逻辑推理的受控诊断基准

来源:https://huggingface.co/papers/2606.27828

摘要

一个新的基准通过受控的时间-逻辑操作(而非简单的物体识别),评估多模态大语言模型对动态视觉证据进行推理的能力。

当前对多模态大语言模型 (MLLMs)(https://huggingface.co/papers?q=multimodal%20large%20language%20models)的研究兴趣引发了一个核心问题:它们能否对动态视觉证据进行推理,而不仅仅是识别单帧中的物体或事件?我们将这种能力称为视频时间-逻辑推理(https://huggingface.co/papers?q=video%20temporal-logical%20reasoning),它要求模型在视觉状态随帧演变时维持、更新并组合证据。现有视频基准常将这种能力与场景复杂度、静态识别或不受控的时间变化混为一谈。为了分离并评估这种能力,我们提出了 Video-MME-Logical(https://huggingface.co/papers?q=Video-MME-Logical),一个围绕五种时间-逻辑操作(https://huggingface.co/papers?q=temporal-logical%20operations)组织的受控基准:状态追踪(https://huggingface.co/papers?q=state%20tracking)、顺序计数(https://huggingface.co/papers?q=sequential%20counting)、时间排序(https://huggingface.co/papers?q=temporal%20ordering)、动态空间关系(https://huggingface.co/papers?q=dynamic%20spatiality)和结构组合(https://huggingface.co/papers?q=structural%20composition)。该基准包含25个细粒度任务类别,通过受控的物体状态、转换、时间依赖和逻辑组合生成。它允许通过改变时间范围和推理复杂度进行难度可控的最终答案评估,并支持中间状态诊断——验证模型在产生最终答案之前是否恢复了所需的逻辑推理轨迹。对当前最先进 MLLMs 的实验揭示了显著的人机差距,尤其是在时间-逻辑复杂度增加时。在多达50万个生成样本上进行的有监督微调(https://huggingface.co/papers?q=Supervised%20fine-tuning)虽能提升性能,但不足以弥合推理鸿沟,将 Video-MME-Logical(https://huggingface.co/papers?q=Video-MME-Logical)定位为分析和改进 MLLMs 时间-逻辑推理的可扩展测试平台。

查看 arXiv 页面 (https://arxiv.org/abs/2606.27828)
查看 PDF (https://arxiv.org/pdf/2606.27828)
项目页面 (https://mrakas.github.io/video-mme-logical)
GitHub 0 (https://github.com/Mrakas/video-mme-logical)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.27828)

在你的 agent 中获取该论文:

hf papers read 2606.27828

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 0

无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.27828,以便从此页面链接。

引用本论文的数据集 0

无数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.27828,以便从此页面链接。

引用本论文的 Spaces 0

无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.27828,以便从此页面链接。

包含本论文的合集 0

无合集包含此论文

请将该论文添加到一个合集(https://huggingface.co/new-collection)中,以便从此页面链接。

相似文章

OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试

Papers with Code Trending

OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。

视觉语言模型真的能进行视觉推理吗?模态差距的严格研究

arXiv cs.CL

本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。

多模态视频理解中视觉状态追踪的基准测试

Hugging Face Daily Papers

介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。