VideoGAIA: 通用AI助手智能视频理解基准

Hugging Face Daily Papers 论文

摘要

VideoGAIA引入了一个基准,用于通过复杂的多轮任务评估多模态模型中的智能视频理解,揭示即使是像GPT-5.5这样的前沿模型也仅达到不到60%的准确率。

视频理解是评估多模态大语言模型(MLLMs)能力的基本任务。然而,现有的领先模型在Video-MME排行榜上已达到约90%的准确率,表明传统的单轮视频理解任务日益饱和,不足以评估先进MLLMs的智能性。为此,我们引入了VideoGAIA,这是一个面向通用人工智能(AI)助手的智能视频理解基准。超越一次性视频问答,VideoGAIA将视频理解构建为一个多轮、工具增强的交互过程,其中模型必须迭代地感知视频、调用外部工具、收集补充信息,并跨轮次整合多模态证据。VideoGAIA包含271个模型-人类共同设计的任务,涵盖多样且复杂的现实场景。每个视频-问题-答案实例由三名人类专家独立验证,以确保正确性和适当的难度。所有评估的MLLMs,包括像GPT-5.5和Kimi-K3这样的前沿模型,在VideoGAIA上的准确率均低于60%,突显了其作为评估下一代MLLMs的高质量且及时基准的价值。我们希望VideoGAIA能促进从传统视频理解向智能视频理解的过渡。
查看原文
查看缓存全文

缓存时间: 2026/08/18 03:50

论文页面 - VideoGAIA:通用AI助手的智能体视频理解基准

来源:https://huggingface.co/papers/2608.14718

摘要

VideoGAIA 推出了一个多轮、工具增强的基准,通过复杂的真实世界任务评估先进多模态模型的智能体视频理解能力。

视频理解是评估多模态大语言模型(https://huggingface.co/papers?q=multimodal%20large%20language%20models)(MLLMs)能力的基础任务。然而,现有领先模型在 Video-MME 排行榜上已达到约 90% 的准确率,这表明传统的单轮视频理解任务正变得日益饱和,不足以评估先进 MLLMs 的智能水平。为此,我们推出了 VideoGAIA(https://huggingface.co/papers?q=VideoGAIA),这是一个面向通用人工智能(AI)助手的智能体视频理解(https://huggingface.co/papers?q=agentic%20video%20understanding)基准。VideoGAIA(https://huggingface.co/papers?q=VideoGAIA)超越了单次视频问答,将视频理解构建为一个多轮、工具增强的交互(https://huggingface.co/papers?q=tool-augmented%20interaction)过程,模型必须迭代地感知视频、调用外部工具、收集补充信息,并在不同轮次间整合多模态证据。VideoGAIA(https://huggingface.co/papers?q=VideoGAIA)包含 271 个由模型与人类共同设计的任务,覆盖了多样化且复杂的真实世界场景。每个视频-问题-答案实例都经过三位人类专家的独立验证,以确保其正确性和适当的难度。所有评估的 MLLMs,包括前沿模型如 GPT-5.5 和 Kimi-K3,在 VideoGAIA(https://huggingface.co/papers?q=VideoGAIA)上的准确率均低于 60%,这凸显了其作为评估下一代 MLLMs 的高质量且及时基准的价值。我们希望 VideoGAIA(https://huggingface.co/papers?q=VideoGAIA)能促进从传统视频理解向智能体视频理解(https://huggingface.co/papers?q=agentic%20video%20understanding)的过渡。

查看 arXiv 页面 (https://arxiv.org/abs/2608.14718) 查看 PDF (https://arxiv.org/pdf/2608.14718) GitHub (https://github.com/zfkarl/VideoGAIA) 添加至收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.14718)

在您的智能体中获取本文:

hf papers read 2608\.14718

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无模型关联此论文 在模型的 README.md 中引用 arxiv.org/abs/2608.14718 以从此页面链接到该模型。

引用本文的数据集 0

无数据集关联此论文 在数据集的 README.md 中引用 arxiv.org/abs/2608.14718 以从此页面链接到该数据集。

引用本文的 Space 0

无 Space 关联此论文 在 Space 的 README.md 中引用 arxiv.org/abs/2608.14718 以从此页面链接到该 Space。

包含本文的收藏集 0

无收藏集包含此论文 将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到它。

相似文章

Video-Oasis: 重新思考视频理解的评估

Hugging Face Daily Papers

Video-Oasis 揭示,现有视频基准测试中 55% 可以在没有视觉输入的情况下解决,暴露了当前视频理解模型的显著能力差距。最先进的模型在剩余的视频原生挑战上仅略高于随机猜测。

OmnilingualGAIA2:评估前沿AI智能体的多语言差距

arXiv cs.CL

本文介绍了OmnilingualGAIA2,这是GAIA2智能体基准在十种语言上的多语言扩展,揭示了8.8–18.4 pass@3点的普遍跨语言性能差距,该差距由模型驱动并随规模持续存在。作者认为,多语言智能体评估应成为全球部署智能体的标准。

Video-DeepResearch:迈向下一代多模态深度研究智能体

Hugging Face Daily Papers

Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。