Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力

Hugging Face Daily Papers 论文

摘要

Video-IFBench 介绍了一个综合基准,用于评估多模态大语言模型在视频理解任务中遵循多样化指令的能力,涵盖多种约束条件和任务类型。

多模态大语言模型在视频理解方面已展现出强大性能。然而,它们在此领域遵循指令的能力仍未得到充分探索。现实世界的视频理解不仅要求模型正确解读视频内容,还要求其满足用户指定的各种约束条件。现有基准主要关注任务准确性而非指令遵循度,导致这一能力评估不足。为填补这一空白,我们推出了Video-IFBench——一个用于评估视频理解中指令遵循能力的综合基准。在该基准中,模型必须满足用户指定的各类约束条件,包括基于视觉和音频内容的约束。我们开发了一个包含四种模板的指令分类体系,涵盖单任务、多任务、选择和嵌套指令,覆盖32种任务类型和39个手动设计的约束类别,横跨语义与格式要求。为降低标注成本,我们构建了结合多模态大语言模型、程序化处理和人工验证的半自动数据构建流水线,共生成1.5K个样本。我们对20多个近期多模态大语言模型进行了大规模评估,结果表明视频指令遵循对当前模型仍具挑战性,尤其对于包含大量约束、语义约束或需要根据视频内容选择正确分支或路径的复杂条件结构。我们希望本研究能促进未来对视频理解场景中指令遵循能力的研究。
查看原文
查看缓存全文

缓存时间: 2026/08/27 07:18

论文页面 - Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力

来源:https://huggingface.co/papers/2608.25529
发布于 8 月 26 日

·

由 https://huggingface.co/zpy777 提交

zpy(https://huggingface.co/zpy777)于 8 月 27 日

作者:

摘要

一个新的基准测试评估多模态语言模型遵循包含视觉、音频和结构约束的多样化视频指令的能力。

多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)在视频理解(https://huggingface.co/papers?q=video%20understanding)方面表现出色。然而,它们在这一领域遵循指令的能力仍有待深入探索。现实世界的视频理解(https://huggingface.co/papers?q=video%20understanding)不仅要求模型正确解读视频内容,还需要满足多样化的用户指定约束。现有基准测试主要关注任务准确性,而非指令遵循度,导致这一能力未能得到充分评估。为弥补这一差距,我们推出了 Video-IFBench(https://huggingface.co/papers?q=Video-IFBench),这是一个用于评估视频理解(https://huggingface.co/papers?q=video%20understanding)中指令遵循(https://huggingface.co/papers?q=instruction%20following)的综合基准,要求模型满足多样化的用户指定约束,包括基于视觉和音频内容的约束。我们开发了一个包含四种模板的指令分类体系(https://huggingface.co/papers?q=instruction%20taxonomy),包括单任务、多任务、选择和嵌套指令,涵盖 32 种任务类型和 39 种人工设计的约束类别,涉及语义和格式要求(https://huggingface.co/papers?q=format%20requirements)。为降低标注成本,我们构建了一个半自动数据构建流程,结合 MLLMs、程序化处理和人工验证,生成了 1.5K 个样本。我们对 20 多个最新的 MLLMs 进行了大规模评估,结果表明视频指令遵循(https://huggingface.co/papers?q=instruction%20following)对当前模型来说仍具挑战性,尤其是那些包含大量约束、语义约束(https://huggingface.co/papers?q=semantic%20constraints)或需要基于视频内容选择正确分支或路径的复杂条件结构(https://huggingface.co/papers?q=conditional%20structures)的指令。我们希望这项工作能促进未来关于视频理解(https://huggingface.co/papers?q=video%20understanding)场景中指令遵循(https://huggingface.co/papers?q=instruction%20following)的研究。

查看 arXiv 页面(https://arxiv.org/abs/2608.25529)查看 PDF(https://arxiv.org/pdf/2608.25529)项目页面(https://alexios-hub.github.io/Video-IFBench/)GitHub0(https://github.com/Alexios-hub/Video-IFBench)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2608.25529)

在您的代理中获取此论文:

hf papers read 2608.25529

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

暂无模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.25529 以从此页面链接。

引用此论文的数据集0

暂无数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.25529 以从此页面链接。

引用此论文的空间0

暂无空间关联此论文

在空间的 README.md 中引用 arxiv.org/abs/2608.25529 以从此页面链接。

包含此论文的收藏夹0

暂无收藏夹包含此论文

将此论文添加到收藏夹(https://huggingface.co/new-collection)以从此页面链接。

相似文章

VCIFBench:评估视频理解中的复杂指令遵循能力

arXiv cs.CL

VCIFBench 是一个用于评估视频理解中复杂指令遵循能力的新基准,包含 306 条带有内容、格式、风格和结构约束的测试指令,以及一个 DPO 偏好数据集。针对 10 个 MLLM 的实验表明,同时满足多项约束仍具挑战性,而基于该基准数据进行 DPO 训练可提升指令遵循性能。

多模态视频理解中视觉状态追踪的基准测试

Hugging Face Daily Papers

介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。