Video-Oasis: 重新思考视频理解的评估

Hugging Face Daily Papers 论文

摘要

Video-Oasis 揭示,现有视频基准测试中 55% 可以在没有视觉输入的情况下解决,暴露了当前视频理解模型的显著能力差距。最先进的模型在剩余的视频原生挑战上仅略高于随机猜测。

视频理解的固有复杂性使得难以确定 Video-LLM 基准性能是源于视觉感知、语言推理还是先验知识。尽管出现了许多评估高层推理的基准,但共享的视频理解评估标准在很大程度上仍被忽视。我们并未引入另一个基准,而是退一步重新审视视频理解的评估标准。在这项工作中,我们引入了 Video-Oasis,一个可持续的诊断套件,用于系统性地审计现有的视频理解基准。该审计揭示,现有基准样本中有 55% 可以在没有视觉输入或时间上下文的情况下解决。在过滤这些捷径后,剩余的视频原生挑战暴露了显著的能力差距:最先进的模型性能仅略高于随机猜测。基于这些发现,我们将提炼后的挑战作为测试平台,研究哪些算法设计选择有助于稳健的视频理解。我们希望我们的工作能为构建严格的视频基准和评估未来的 Video-LLM 提供实用基础。代码可从 https://github.com/sejong-rcv/Video-Oasis 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:15

论文页面 - Video-Oasis: 重新思考视频理解评估

来源:https://huggingface.co/papers/2603.29616

摘要

Video-Oasis 诊断结果显示,现有视频基准测试中有一半无需视觉输入即可解答,揭示了当前视频理解模型存在显著的能力差距。

视频理解(https://huggingface.co/papers?q=video%20understanding)固有的复杂性,使得难以判断 Video-LLM(https://huggingface.co/papers?q=Video-LLM)基准测试的性能究竟源于视觉感知(https://huggingface.co/papers?q=visual%20perception)、语言推理(https://huggingface.co/papers?q=linguistic%20reasoning)还是知识先验(https://huggingface.co/papers?q=knowledge%20priors)。尽管已涌现出许多评估高层推理的基准,但视频理解(https://huggingface.co/papers?q=video%20understanding)评估的共享标准仍被普遍忽视。我们并未引入新的基准,而是退一步重新审视视频理解(https://huggingface.co/papers?q=video%20understanding)的评估标准。在这项工作中,我们提出了 Video-Oasis,一个可持续的诊断套件(https://huggingface.co/papers?q=diagnostic%20suite),用于系统性地审计现有的视频理解(https://huggingface.co/papers?q=video%20understanding)基准。审计结果显示,现有基准样本中 55% 无需视觉输入或时间上下文即可解答。过滤掉这些捷径后,剩余的视频原生挑战(https://huggingface.co/papers?q=video-native%20challenges)暴露了巨大的能力差距:最先进模型的性能仅略高于随机猜测。基于这些发现,我们利用提炼后的挑战作为测试平台,研究哪些算法设计选择(https://huggingface.co/papers?q=algorithmic%20design%20choices)有助于提升鲁棒的视频理解(https://huggingface.co/papers?q=video%20understanding)。我们希望这项工作能为构建严格的视频基准以及评估未来的 Video-LLM(https://huggingface.co/papers?q=Video-LLM)提供实用基础。代码可在 https://github.com/sejong-rcv/Video-Oasis 获取。

查看 arXiv 页面(https://arxiv.org/abs/2603.29616)查看 PDF(https://arxiv.org/pdf/2603.29616)项目页面(https://limgeuntaekk.github.io/Video-Oasis/)GitHub14(https://github.com/sejong-rcv/Video-Oasis)加入收藏(https://huggingface.co/login?next=%2Fpapers%2F2603.29616)

在你的代理中获取此论文:

hf papers read 2603.29616

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

暂无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2603.29616 以从此页面链接。

引用此论文的数据集0

暂无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2603.29616 以从此页面链接。

引用此论文的 Spaces0

暂无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2603.29616 以从此页面链接。

包含此论文的收藏集0

暂无收藏集包含此论文

请将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。

相似文章

VideoGAIA: 通用AI助手智能视频理解基准

Hugging Face Daily Papers

VideoGAIA引入了一个基准,用于通过复杂的多轮任务评估多模态模型中的智能视频理解,揭示即使是像GPT-5.5这样的前沿模型也仅达到不到60%的准确率。

VideoKR:面向知识和推理密集型视频理解

Hugging Face Daily Papers

VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。

OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试

Papers with Code Trending

OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。