VideoGAIA: 通用AI助手智能视频理解基准
摘要
VideoGAIA引入了一个基准,用于通过复杂的多轮任务评估多模态模型中的智能视频理解,揭示即使是像GPT-5.5这样的前沿模型也仅达到不到60%的准确率。
查看缓存全文
缓存时间: 2026/08/18 03:50
论文页面 - VideoGAIA:通用AI助手的智能体视频理解基准
来源:https://huggingface.co/papers/2608.14718
摘要
VideoGAIA 推出了一个多轮、工具增强的基准,通过复杂的真实世界任务评估先进多模态模型的智能体视频理解能力。
视频理解是评估多模态大语言模型(https://huggingface.co/papers?q=multimodal%20large%20language%20models)(MLLMs)能力的基础任务。然而,现有领先模型在 Video-MME 排行榜上已达到约 90% 的准确率,这表明传统的单轮视频理解任务正变得日益饱和,不足以评估先进 MLLMs 的智能水平。为此,我们推出了 VideoGAIA(https://huggingface.co/papers?q=VideoGAIA),这是一个面向通用人工智能(AI)助手的智能体视频理解(https://huggingface.co/papers?q=agentic%20video%20understanding)基准。VideoGAIA(https://huggingface.co/papers?q=VideoGAIA)超越了单次视频问答,将视频理解构建为一个多轮、工具增强的交互(https://huggingface.co/papers?q=tool-augmented%20interaction)过程,模型必须迭代地感知视频、调用外部工具、收集补充信息,并在不同轮次间整合多模态证据。VideoGAIA(https://huggingface.co/papers?q=VideoGAIA)包含 271 个由模型与人类共同设计的任务,覆盖了多样化且复杂的真实世界场景。每个视频-问题-答案实例都经过三位人类专家的独立验证,以确保其正确性和适当的难度。所有评估的 MLLMs,包括前沿模型如 GPT-5.5 和 Kimi-K3,在 VideoGAIA(https://huggingface.co/papers?q=VideoGAIA)上的准确率均低于 60%,这凸显了其作为评估下一代 MLLMs 的高质量且及时基准的价值。我们希望 VideoGAIA(https://huggingface.co/papers?q=VideoGAIA)能促进从传统视频理解向智能体视频理解(https://huggingface.co/papers?q=agentic%20video%20understanding)的过渡。
查看 arXiv 页面 (https://arxiv.org/abs/2608.14718) 查看 PDF (https://arxiv.org/pdf/2608.14718) GitHub (https://github.com/zfkarl/VideoGAIA) 添加至收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.14718)
在您的智能体中获取本文:
hf papers read 2608\.14718
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无模型关联此论文 在模型的 README.md 中引用 arxiv.org/abs/2608.14718 以从此页面链接到该模型。
引用本文的数据集 0
无数据集关联此论文 在数据集的 README.md 中引用 arxiv.org/abs/2608.14718 以从此页面链接到该数据集。
引用本文的 Space 0
无 Space 关联此论文 在 Space 的 README.md 中引用 arxiv.org/abs/2608.14718 以从此页面链接到该 Space。
包含本文的收藏集 0
无收藏集包含此论文 将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到它。
相似文章
VideoSeeker: 通过原生智能体工具调用激励实例级视频理解
VideoSeeker 引入了一种实例级视频理解的新范式,将智能体推理与视觉提示相结合,通过自动化数据合成和强化学习实现卓越性能,超越了 GPT-4o 和 Gemini-2.5-Pro。
Video-Oasis: 重新思考视频理解的评估
Video-Oasis 揭示,现有视频基准测试中 55% 可以在没有视觉输入的情况下解决,暴露了当前视频理解模型的显著能力差距。最先进的模型在剩余的视频原生挑战上仅略高于随机猜测。
通过通用关键帧提取桥接VideoQA与视频引导的代理任务
本文介绍了VG-GUIBench,一个用于评估基于MLLM的GUI代理遵循视频教程能力的基准,并提出了TASKER,一种关键帧提取方法,可提升VideoQA和视频引导的代理任务的性能。
OmnilingualGAIA2:评估前沿AI智能体的多语言差距
本文介绍了OmnilingualGAIA2,这是GAIA2智能体基准在十种语言上的多语言扩展,揭示了8.8–18.4 pass@3点的普遍跨语言性能差距,该差距由模型驱动并随规模持续存在。作者认为,多语言智能体评估应成为全球部署智能体的标准。
Video-DeepResearch:迈向下一代多模态深度研究智能体
Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。