Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力
摘要
Video-IFBench 介绍了一个综合基准,用于评估多模态大语言模型在视频理解任务中遵循多样化指令的能力,涵盖多种约束条件和任务类型。
查看缓存全文
缓存时间: 2026/08/27 07:18
论文页面 - Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力
来源:https://huggingface.co/papers/2608.25529
发布于 8 月 26 日
·
由 https://huggingface.co/zpy777 提交
zpy(https://huggingface.co/zpy777)于 8 月 27 日
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
一个新的基准测试评估多模态语言模型遵循包含视觉、音频和结构约束的多样化视频指令的能力。
多模态大语言模型(https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)在视频理解(https://huggingface.co/papers?q=video%20understanding)方面表现出色。然而,它们在这一领域遵循指令的能力仍有待深入探索。现实世界的视频理解(https://huggingface.co/papers?q=video%20understanding)不仅要求模型正确解读视频内容,还需要满足多样化的用户指定约束。现有基准测试主要关注任务准确性,而非指令遵循度,导致这一能力未能得到充分评估。为弥补这一差距,我们推出了 Video-IFBench(https://huggingface.co/papers?q=Video-IFBench),这是一个用于评估视频理解(https://huggingface.co/papers?q=video%20understanding)中指令遵循(https://huggingface.co/papers?q=instruction%20following)的综合基准,要求模型满足多样化的用户指定约束,包括基于视觉和音频内容的约束。我们开发了一个包含四种模板的指令分类体系(https://huggingface.co/papers?q=instruction%20taxonomy),包括单任务、多任务、选择和嵌套指令,涵盖 32 种任务类型和 39 种人工设计的约束类别,涉及语义和格式要求(https://huggingface.co/papers?q=format%20requirements)。为降低标注成本,我们构建了一个半自动数据构建流程,结合 MLLMs、程序化处理和人工验证,生成了 1.5K 个样本。我们对 20 多个最新的 MLLMs 进行了大规模评估,结果表明视频指令遵循(https://huggingface.co/papers?q=instruction%20following)对当前模型来说仍具挑战性,尤其是那些包含大量约束、语义约束(https://huggingface.co/papers?q=semantic%20constraints)或需要基于视频内容选择正确分支或路径的复杂条件结构(https://huggingface.co/papers?q=conditional%20structures)的指令。我们希望这项工作能促进未来关于视频理解(https://huggingface.co/papers?q=video%20understanding)场景中指令遵循(https://huggingface.co/papers?q=instruction%20following)的研究。
查看 arXiv 页面(https://arxiv.org/abs/2608.25529)查看 PDF(https://arxiv.org/pdf/2608.25529)项目页面(https://alexios-hub.github.io/Video-IFBench/)GitHub0(https://github.com/Alexios-hub/Video-IFBench)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2608.25529)
在您的代理中获取此论文:
hf papers read 2608.25529
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
暂无模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.25529 以从此页面链接。
引用此论文的数据集0
暂无数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.25529 以从此页面链接。
引用此论文的空间0
暂无空间关联此论文
在空间的 README.md 中引用 arxiv.org/abs/2608.25529 以从此页面链接。
包含此论文的收藏夹0
暂无收藏夹包含此论文
将此论文添加到收藏夹(https://huggingface.co/new-collection)以从此页面链接。
相似文章
VCIFBench:评估视频理解中的复杂指令遵循能力
VCIFBench 是一个用于评估视频理解中复杂指令遵循能力的新基准,包含 306 条带有内容、格式、风格和结构约束的测试指令,以及一个 DPO 偏好数据集。针对 10 个 MLLM 的实验表明,同时满足多项约束仍具挑战性,而基于该基准数据进行 DPO 训练可提升指令遵循性能。
VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。
OmniCap-IF:全模态视频字幕生成中指令跟随能力的基准测试与提升
介绍了OmniCap-IF,这是首个用于评估全模态视频字幕生成中指令跟随能力的综合性基准,揭示了格式-内容权衡,并提出了改进的模型和数据集。
观看、记忆、推理:基于MLLMs的人类视角视频理解
一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。
多模态视频理解中视觉状态追踪的基准测试
介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。