Video-Oasis: 重新思考视频理解的评估
摘要
Video-Oasis 揭示,现有视频基准测试中 55% 可以在没有视觉输入的情况下解决,暴露了当前视频理解模型的显著能力差距。最先进的模型在剩余的视频原生挑战上仅略高于随机猜测。
查看缓存全文
缓存时间: 2026/07/10 06:15
论文页面 - Video-Oasis: 重新思考视频理解评估
来源:https://huggingface.co/papers/2603.29616
摘要
Video-Oasis 诊断结果显示,现有视频基准测试中有一半无需视觉输入即可解答,揭示了当前视频理解模型存在显著的能力差距。
视频理解(https://huggingface.co/papers?q=video%20understanding)固有的复杂性,使得难以判断 Video-LLM(https://huggingface.co/papers?q=Video-LLM)基准测试的性能究竟源于视觉感知(https://huggingface.co/papers?q=visual%20perception)、语言推理(https://huggingface.co/papers?q=linguistic%20reasoning)还是知识先验(https://huggingface.co/papers?q=knowledge%20priors)。尽管已涌现出许多评估高层推理的基准,但视频理解(https://huggingface.co/papers?q=video%20understanding)评估的共享标准仍被普遍忽视。我们并未引入新的基准,而是退一步重新审视视频理解(https://huggingface.co/papers?q=video%20understanding)的评估标准。在这项工作中,我们提出了 Video-Oasis,一个可持续的诊断套件(https://huggingface.co/papers?q=diagnostic%20suite),用于系统性地审计现有的视频理解(https://huggingface.co/papers?q=video%20understanding)基准。审计结果显示,现有基准样本中 55% 无需视觉输入或时间上下文即可解答。过滤掉这些捷径后,剩余的视频原生挑战(https://huggingface.co/papers?q=video-native%20challenges)暴露了巨大的能力差距:最先进模型的性能仅略高于随机猜测。基于这些发现,我们利用提炼后的挑战作为测试平台,研究哪些算法设计选择(https://huggingface.co/papers?q=algorithmic%20design%20choices)有助于提升鲁棒的视频理解(https://huggingface.co/papers?q=video%20understanding)。我们希望这项工作能为构建严格的视频基准以及评估未来的 Video-LLM(https://huggingface.co/papers?q=Video-LLM)提供实用基础。代码可在 https://github.com/sejong-rcv/Video-Oasis 获取。
查看 arXiv 页面(https://arxiv.org/abs/2603.29616)查看 PDF(https://arxiv.org/pdf/2603.29616)项目页面(https://limgeuntaekk.github.io/Video-Oasis/)GitHub14(https://github.com/sejong-rcv/Video-Oasis)加入收藏(https://huggingface.co/login?next=%2Fpapers%2F2603.29616)
在你的代理中获取此论文:
hf papers read 2603.29616
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
暂无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2603.29616 以从此页面链接。
引用此论文的数据集0
暂无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2603.29616 以从此页面链接。
引用此论文的 Spaces0
暂无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2603.29616 以从此页面链接。
包含此论文的收藏集0
暂无收藏集包含此论文
请将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
VGI-BENCH: 探测视频生成模型中的视觉智能
VGI-BENCH 通过27项任务评估视频生成模型中的视觉推理,揭示当前系统在可靠性和自我纠正方面的局限性。
VideoGAIA: 通用AI助手智能视频理解基准
VideoGAIA引入了一个基准,用于通过复杂的多轮任务评估多模态模型中的智能视频理解,揭示即使是像GPT-5.5这样的前沿模型也仅达到不到60%的准确率。
VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。
VideoKR:面向知识和推理密集型视频理解
VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。
OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。