VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
摘要
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。
查看缓存全文
缓存时间: 2026/07/20 09:42
论文页面 - VIABench:面向视障人士辅助的多模态视频综合基准数据集
来源:https://huggingface.co/papers/2607.14660
我们提出VIABench,这是一个综合性、时间对齐的视频基准数据集,用于评估多模态大语言模型(MLLMs)在真实世界视障人士辅助场景中的表现。
VIABench 包含 761 个视频、14,526 条人工标注以及 46.9 小时的总时长。它覆盖三个互补任务:主动提醒(Proactive Reminder)、视觉问答(Visual Question Answering) 和视觉引导交互(Vision-Guided Interaction)。我们还提出了Token级别提示激活解码(Token-Level Prompt Activation Decoding,TPAD),这是一个两阶段框架,用于在在线和离线两种场景下评估主动辅助能力。
我们的评估表明,当前 MLLMs 在可靠的现实辅助任务中仍存在不足,尤其是在预判导航关键事件并实时响应方面。我们希望 VIABench 能推动辅助视觉工具朝着更安全、更实用的方向发展。
代码与数据:https://github.com/MCG-NJU/VIABench
相似文章
@samsja19:很棒的基准
介绍 VGI-Bench,这是一个多模态基准测试,通过 550 个人工策划的问题来评估 12 种不同的视觉和视听技能,旨在暴露当今视频基准测试中的不足。
WorldBench:一个具有挑战性且视觉多样化的多模态推理基准
介绍WorldBench,一个视觉多样化的多模态推理基准,揭示了当前多模态大语言模型在视觉理解方面的显著局限性。
VisEditBench:视觉语言模型能否根据多模态反馈编辑可视化代码?
介绍了VisEditBench,这是一个包含1,395个人工标注的可视化代码编辑任务的基准,面向视觉语言模型,涵盖反馈引导的修复和参考引导的重新样式化。评估了20个VLM,并提出了VisEditAgent,一个基于渲染的编辑框架,将通过率从55.75%提升到67.99%。
VGI-BENCH: 探测视频生成模型中的视觉智能
VGI-BENCH 通过27项任务评估视频生成模型中的视觉推理,揭示当前系统在可靠性和自我纠正方面的局限性。
Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力
Video-IFBench 介绍了一个综合基准,用于评估多模态大语言模型在视频理解任务中遵循多样化指令的能力,涵盖多种约束条件和任务类型。