OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试

Papers with Code Trending 论文

摘要

OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。

机器人、AR 和自动驾驶领域的多模态智能体需要从连续的第一视角视频流中对场所和空间布局进行推理,且往往需要利用当前视野之外的历史信息。现有基准测试要么对完整视频进行离线评估,要么聚焦于事件检测而非空间结构理解。为此,我们提出 OVO-S-Bench——一个专为流式空间智能设计的全人工标注基准测试,包含 348 个源视频中的 1,680 道问题。标注工作由 12 名经过培训的标注员完成,每位标注员同时担任盲审交叉审核员,累计投入约 804 人时进行多轮质量保障。每道问题均附有查询时间戳和证据时间区间,模型在评估时仅能看到查询时刻之前的视频前缀。问题涵盖四个抽象层次递进的类别:即时自我中心感知、时空上下文追踪、空间模拟与推理,以及以他者为中心的空间映射。在对 38 个商业及开源多模态大语言模型的评测中,Gemini-3.1-Pro 比人类专家低 27 分(59.2 分 vs. 86.6 分),其中以他者为中心的空间映射是最主要的瓶颈。值得注意的是,针对流式场景和空间任务微调的多模态大语言模型,其表现反而不及其基础模型。我们还发现,当思维链推理缺乏视频流的实际依据时,会进一步加剧空间错误。OVO-S-Bench 通过揭示这些局限性,为下一代流式空间多模态大语言模型的研究提供了极具挑战性的测试平台。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:14

论文页面 - OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试

来源:https://huggingface.co/papers/2606.03890

摘要

OVO-S-Bench 提出了一个综合性基准测试,通过跨多个抽象层级的人工标注问题,评估多模态语言模型的流式空间智能能力。

机器人、AR 和自动驾驶领域的多模态智能体必须能够从连续的自我中心视角流中推断场所与布局,且往往需要利用当前视野之外的信息。现有基准测试要么针对完整视频进行离线评估,要么关注事件而非空间结构。我们提出 OVO-S-Bench,这是一个针对流式空间智能的全人工标注基准测试,包含 348 个源视频上的 1,680 道问题。标注工作由 12 名经过培训的标注员完成,每位标注员同时担任盲评交叉审核员,累计投入约 804 人时进行多轮质量保证。每道问题均附有查询时间戳和证据区间,评估时模型仅能看到查询时刻之前的视频前缀。问题涵盖四个递进抽象层级:即时自我中心感知、时空上下文追踪、空间模拟与推理,以及异中心映射。在 38 个商业和开源多模态大语言模型的测评中,Gemini-3.1-Pro 落后人类专家 27 分(59.2 vs. 86.6),其中异中心映射是最主要的瓶颈。值得注意的是,经过流式处理和空间微调的多模态大语言模型表现反而不及其自身的基础模型。我们还发现,当思维链推理缺乏视频流的真实依据时,会进一步放大空间错误。通过揭示这些局限性,OVO-S-Bench 为下一代流式空间多模态大语言模型建立了一个极具挑战性的测试平台。

查看 arXiv 页面 查看 PDF 项目主页 GitHub30 添加到收藏

引用本文的模型 0

暂无模型关联本文

在模型的 README.md 中引用 arxiv.org/abs/2606.03890 即可从本页面链接该模型。

引用本文的数据集 0

暂无数据集关联本文

在数据集的 README.md 中引用 arxiv.org/abs/2606.03890 即可从本页面链接该数据集。

引用本文的 Space 0

暂无 Space 关联本文

在 Space 的 README.md 中引用 arxiv.org/abs/2606.03890 即可从本页面链接该 Space。

收录本文的合集 0

暂无合集收录本文

将本文添加到合集即可从本页面链接该合集。

相似文章

SVI-Bench:战略视频智能的动态微世界

Hugging Face Daily Papers

介绍了SVI-Bench,这是一个利用团队运动进行战略视频智能的大规模基准,旨在评估模型在动态场景理解、因果推理、战略模拟和代理综合方面的能力。该基准揭示了一个能力断崖:模型在感知任务上表现良好,但在更高层次的战略推理上急剧下降。