OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
摘要
OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。
查看缓存全文
缓存时间: 2026/06/05 02:14
论文页面 - OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
来源:https://huggingface.co/papers/2606.03890
摘要
OVO-S-Bench 提出了一个综合性基准测试,通过跨多个抽象层级的人工标注问题,评估多模态语言模型的流式空间智能能力。
机器人、AR 和自动驾驶领域的多模态智能体必须能够从连续的自我中心视角流中推断场所与布局,且往往需要利用当前视野之外的信息。现有基准测试要么针对完整视频进行离线评估,要么关注事件而非空间结构。我们提出 OVO-S-Bench,这是一个针对流式空间智能的全人工标注基准测试,包含 348 个源视频上的 1,680 道问题。标注工作由 12 名经过培训的标注员完成,每位标注员同时担任盲评交叉审核员,累计投入约 804 人时进行多轮质量保证。每道问题均附有查询时间戳和证据区间,评估时模型仅能看到查询时刻之前的视频前缀。问题涵盖四个递进抽象层级:即时自我中心感知、时空上下文追踪、空间模拟与推理,以及异中心映射。在 38 个商业和开源多模态大语言模型的测评中,Gemini-3.1-Pro 落后人类专家 27 分(59.2 vs. 86.6),其中异中心映射是最主要的瓶颈。值得注意的是,经过流式处理和空间微调的多模态大语言模型表现反而不及其自身的基础模型。我们还发现,当思维链推理缺乏视频流的真实依据时,会进一步放大空间错误。通过揭示这些局限性,OVO-S-Bench 为下一代流式空间多模态大语言模型建立了一个极具挑战性的测试平台。
查看 arXiv 页面 查看 PDF 项目主页 GitHub30 添加到收藏
引用本文的模型 0
暂无模型关联本文
在模型的 README.md 中引用 arxiv.org/abs/2606.03890 即可从本页面链接该模型。
引用本文的数据集 0
暂无数据集关联本文
在数据集的 README.md 中引用 arxiv.org/abs/2606.03890 即可从本页面链接该数据集。
引用本文的 Space 0
暂无 Space 关联本文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.03890 即可从本页面链接该 Space。
收录本文的合集 0
暂无合集收录本文
将本文添加到合集即可从本页面链接该合集。
相似文章
Video-MME-Logical: 一种用于视频时间逻辑推理的受控诊断基准
提出 Video-MME-Logical,一个用于评估多模态大语言模型中视频时间逻辑推理的受控基准,揭示了一个显著的人机差距。
SpatialWorld: 多模态智能体在真实世界任务中的交互式空间推理基准测试
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。
SVI-Bench:战略视频智能的动态微世界
介绍了SVI-Bench,这是一个利用团队运动进行战略视频智能的大规模基准,旨在评估模型在动态场景理解、因果推理、战略模拟和代理综合方面的能力。该基准揭示了一个能力断崖:模型在感知任务上表现良好,但在更高层次的战略推理上急剧下降。
MultiView-Bench:一种面向VLMs的世界中心多视角集成诊断基准
MultiView-Bench是一个诊断基准,用于评估视觉语言模型将多个视角整合为一致3D心智模型的能力,揭示了3D空间推理中的系统性失败,并引入了ViewNavigator以缓解这些问题。
Almieyar-Oryx-BloomBench:一种用于认知驱动评估视觉语言模型的双语多模态基准
BloomBench是一个基于认知理论的双语(英语-阿拉伯语)多模态视觉语言模型基准,系统评估基于布鲁姆分类学的六个认知层次。实验揭示了当前模型中显著的认知不对称和跨语言性能差距。