Video-MME-Logical: 一种用于视频时间逻辑推理的受控诊断基准
摘要
提出 Video-MME-Logical,一个用于评估多模态大语言模型中视频时间逻辑推理的受控基准,揭示了一个显著的人机差距。
查看缓存全文
缓存时间: 2026/06/30 07:35
论文页面 - Video-MME-Logical:面向视频时间-逻辑推理的受控诊断基准
来源:https://huggingface.co/papers/2606.27828
摘要
一个新的基准通过受控的时间-逻辑操作(而非简单的物体识别),评估多模态大语言模型对动态视觉证据进行推理的能力。
当前对多模态大语言模型 (MLLMs)(https://huggingface.co/papers?q=multimodal%20large%20language%20models)的研究兴趣引发了一个核心问题:它们能否对动态视觉证据进行推理,而不仅仅是识别单帧中的物体或事件?我们将这种能力称为视频时间-逻辑推理(https://huggingface.co/papers?q=video%20temporal-logical%20reasoning),它要求模型在视觉状态随帧演变时维持、更新并组合证据。现有视频基准常将这种能力与场景复杂度、静态识别或不受控的时间变化混为一谈。为了分离并评估这种能力,我们提出了 Video-MME-Logical(https://huggingface.co/papers?q=Video-MME-Logical),一个围绕五种时间-逻辑操作(https://huggingface.co/papers?q=temporal-logical%20operations)组织的受控基准:状态追踪(https://huggingface.co/papers?q=state%20tracking)、顺序计数(https://huggingface.co/papers?q=sequential%20counting)、时间排序(https://huggingface.co/papers?q=temporal%20ordering)、动态空间关系(https://huggingface.co/papers?q=dynamic%20spatiality)和结构组合(https://huggingface.co/papers?q=structural%20composition)。该基准包含25个细粒度任务类别,通过受控的物体状态、转换、时间依赖和逻辑组合生成。它允许通过改变时间范围和推理复杂度进行难度可控的最终答案评估,并支持中间状态诊断——验证模型在产生最终答案之前是否恢复了所需的逻辑推理轨迹。对当前最先进 MLLMs 的实验揭示了显著的人机差距,尤其是在时间-逻辑复杂度增加时。在多达50万个生成样本上进行的有监督微调(https://huggingface.co/papers?q=Supervised%20fine-tuning)虽能提升性能,但不足以弥合推理鸿沟,将 Video-MME-Logical(https://huggingface.co/papers?q=Video-MME-Logical)定位为分析和改进 MLLMs 时间-逻辑推理的可扩展测试平台。
查看 arXiv 页面 (https://arxiv.org/abs/2606.27828)
查看 PDF (https://arxiv.org/pdf/2606.27828)
项目页面 (https://mrakas.github.io/video-mme-logical)
GitHub 0 (https://github.com/Mrakas/video-mme-logical)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.27828)
在你的 agent 中获取该论文:
hf papers read 2606.27828
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 0
无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.27828,以便从此页面链接。
引用本论文的数据集 0
无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.27828,以便从此页面链接。
引用本论文的 Spaces 0
无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.27828,以便从此页面链接。
包含本论文的合集 0
无合集包含此论文
请将该论文添加到一个合集(https://huggingface.co/new-collection)中,以便从此页面链接。
相似文章
观看、记忆、推理:基于MLLMs的人类视角视频理解
一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。
OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。
视觉语言模型真的能进行视觉推理吗?模态差距的严格研究
本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。
WorldBench:一个具有挑战性且视觉多样化的多模态推理基准
介绍WorldBench,一个视觉多样化的多模态推理基准,揭示了当前多模态大语言模型在视觉理解方面的显著局限性。
多模态视频理解中视觉状态追踪的基准测试
介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。