VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助

Hugging Face Daily Papers 论文

摘要

介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。

视障人士由于获取视觉信息有限,在日常中面临重大挑战。尽管多模态大语言模型(MLLMs)在通用视觉和语言任务上取得了显著成果,但其在真实视障辅助场景中的实用性仍尚待探索。为填补这一空白,我们提出了VIABench,一个专门用于评估MLLMs在视障人士辅助场景中表现的综合视频基准,该基准使用视障人士自身录制或分享的第一人称视角视频。VIABench定义了三个核心任务,每个任务针对视觉辅助中的不同需求:Proactive Reminder(主动提醒)——评估模型在理解正在进行的视频内容的同时,主动预测并口头描述即将到来的导航关键事件的能力;Visual Question Answering(VQA,视觉问答)——评估模型回答用户关于视频中环境或物体问题的能力;Vision-Guided Interaction(视觉引导交互)——测试模型在用户与环境之间进行有意图交互时的上下文感知推理能力。为确保评估的稳健和公平,我们提出了一套严格的基准测试流程,同时支持在线(实时)和离线设置。我们的实验表明,当前的MLLMs仍难以全面支持视障人士,尤其是在Proactive Reminder任务上,该任务要求准确的预测和实时响应。我们希望VIABench能够推动未来研究,开发针对真实辅助场景的定制化MLLMs,最终改善视障人士的导航和交互体验。代码和数据将在 https://github.com/MCG-NJU/VIABench 上发布。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:42

论文页面 - VIABench:面向视障人士辅助的多模态视频综合基准数据集

来源:https://huggingface.co/papers/2607.14660

我们提出VIABench,这是一个综合性、时间对齐的视频基准数据集,用于评估多模态大语言模型(MLLMs)在真实世界视障人士辅助场景中的表现。

VIABench 包含 761 个视频14,526 条人工标注以及 46.9 小时的总时长。它覆盖三个互补任务:主动提醒(Proactive Reminder)视觉问答(Visual Question Answering)视觉引导交互(Vision-Guided Interaction)。我们还提出了Token级别提示激活解码(Token-Level Prompt Activation Decoding,TPAD),这是一个两阶段框架,用于在在线和离线两种场景下评估主动辅助能力。

我们的评估表明,当前 MLLMs 在可靠的现实辅助任务中仍存在不足,尤其是在预判导航关键事件并实时响应方面。我们希望 VIABench 能推动辅助视觉工具朝着更安全、更实用的方向发展。

代码与数据:https://github.com/MCG-NJU/VIABench

相似文章

VEFX-Bench:通用视频编辑与视觉特效的全方位基准

Hugging Face Daily Papers

VEFX-Bench 引入了一个大规模人工标注的视频编辑数据集(5,049个样本),包含多维质量标签,以及一个专门用于标准化评估视频编辑系统的奖励模型。该论文针对AI辅助视频创作中缺乏全面基准的问题,提供了VEFX-Dataset、VEFX-Reward和一个300个视频提示对的基准测试,揭示了当前编辑模型中的差距。

多模态视频理解中视觉状态追踪的基准测试

Hugging Face Daily Papers

介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。