VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
摘要
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。
查看缓存全文
缓存时间: 2026/07/20 09:42
论文页面 - VIABench:面向视障人士辅助的多模态视频综合基准数据集
来源:https://huggingface.co/papers/2607.14660
我们提出VIABench,这是一个综合性、时间对齐的视频基准数据集,用于评估多模态大语言模型(MLLMs)在真实世界视障人士辅助场景中的表现。
VIABench 包含 761 个视频、14,526 条人工标注以及 46.9 小时的总时长。它覆盖三个互补任务:主动提醒(Proactive Reminder)、视觉问答(Visual Question Answering) 和视觉引导交互(Vision-Guided Interaction)。我们还提出了Token级别提示激活解码(Token-Level Prompt Activation Decoding,TPAD),这是一个两阶段框架,用于在在线和离线两种场景下评估主动辅助能力。
我们的评估表明,当前 MLLMs 在可靠的现实辅助任务中仍存在不足,尤其是在预判导航关键事件并实时响应方面。我们希望 VIABench 能推动辅助视觉工具朝着更安全、更实用的方向发展。
代码与数据:https://github.com/MCG-NJU/VIABench
相似文章
WorldBench:一个具有挑战性且视觉多样化的多模态推理基准
介绍WorldBench,一个视觉多样化的多模态推理基准,揭示了当前多模态大语言模型在视觉理解方面的显著局限性。
VEFX-Bench:通用视频编辑与视觉特效的全方位基准
VEFX-Bench 引入了一个大规模人工标注的视频编辑数据集(5,049个样本),包含多维质量标签,以及一个专门用于标准化评估视频编辑系统的奖励模型。该论文针对AI辅助视频创作中缺乏全面基准的问题,提供了VEFX-Dataset、VEFX-Reward和一个300个视频提示对的基准测试,揭示了当前编辑模型中的差距。
多模态视频理解中视觉状态追踪的基准测试
介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。
MSAVBench:迈向多镜头音视频生成的全面可靠评估
MSAVBench是首个面向多镜头音视频生成的综合基准与自适应评估框架,评估了19个模型在多样化任务上的表现,并与人类判断实现了高度对齐。
Almieyar-Oryx-BloomBench:一种用于认知驱动评估视觉语言模型的双语多模态基准
BloomBench是一个基于认知理论的双语(英语-阿拉伯语)多模态视觉语言模型基准,系统评估基于布鲁姆分类学的六个认知层次。实验揭示了当前模型中显著的认知不对称和跨语言性能差距。