WorldAuditBench:基于多模态智能体的交互式3D世界审计

Hugging Face Daily Papers 论文

摘要

WorldAuditBench 是一个包含213个异常审计任务的基准,涵盖13个基于 Unreal Engine 5 / Three.js 构建的交互式3D环境,用于评估多模态智能体能否将动作与视觉推理有效耦合。前沿模型的成功率仅为6.6%–42.3%,远低于人类的83.4%,凸显出当前在证据收集与解读方面的局限性。

随着交互式3D世界越来越多地用于研究智能行为,在这些仿真环境中高效地识别异常(如悬浮物体、可穿行的墙体、或与周围场景不一致的物体)变得至关重要。包括视觉-语言模型(VLM)和视觉-语言-动作模型(VLA)在内的多模态AI系统在该任务的自动化方面展现出潜力。然而,3D世界审计十分复杂,需要将两种截然不同的能力紧密结合:动作能力,即在3D世界中导航并系统、高效地搜索异常;以及视觉推理能力,即理解环境并从多模态观测中识别异常。多模态智能体能否有效耦合这两种能力——利用视觉推理识别潜在异常并采取动作加以验证——目前仍基本未被探索。在本文中,我们提出 WorldAuditBench,一个用于3D世界审计的基准,包含分布在13个基于 Unreal Engine 5 和 Three.js 构建的环境中的213个异常任务,涵盖五大异常类别。我们在固定的探索预算下,采用两种审计范式评估了五个前沿模型:基于VLA的探索后接基于VLM的异常识别,以及一个端到端的VLM智能体,其中视觉推理直接指导动作选择。在所评估的模型与两种范式下,成功率介于6.6%至42.3%之间,远低于人类表现(83.4%)。通过世界审计这一任务,WorldAuditBench 为研究多模态智能体在交互式3D环境中如何耦合动作与视觉推理提供了测试平台,同时揭示了它们在探索过程中收集与解读证据能力的当前局限。
查看原文
查看缓存全文

缓存时间: 2026/10/01 04:21

论文页面 - WorldAuditBench:借助多模态智能体实现交互式 3D 世界审计

来源:https://huggingface.co/papers/2609.40325

摘要

随着交互式 3D 世界被越来越多地用于研究智能行为,开发高效的流水线来识别这些仿真环境中的异常变得十分重要,例如悬浮物体、可穿过的墙壁,或与周围场景不一致的物体。包括视觉-语言模型(VLMs)和视觉-语言-动作模型(VLAs)在内的多模态 AI 系统,已在自动化这一任务方面展现出潜力。然而,3D 世界审计十分复杂,需要两种不同能力的紧密耦合:动作能力——在 3D 世界中导航,并系统、高效地搜寻异常;以及视觉推理能力——理解环境,并从多模态观测中识别异常。多模态智能体能否有效地耦合这两种能力——利用视觉推理识别潜在异常,同时通过采取行动来验证这些异常——在很大程度上仍未被探索。本文提出 WorldAuditBench,一个用于 3D 世界审计的基准,包含 213 个异常任务,分布在 13 个由 Unreal Engine 5 和 Three.js 构建的环境中,涵盖五类异常。我们在固定的探索预算下,采用两种审计范式评估了五个前沿模型:基于 VLA 的探索加上基于 VLM 的异常识别,以及一个端到端的 VLM 智能体,其中视觉推理直接指导动作选择。在所评估的模型和两种范式中,成功率介于 6.6% 到 42.3% 之间,远低于人类表现(83.4%)。通过世界审计这一任务,WorldAuditBench 为研究多模态智能体如何在交互式 3D 环境中耦合动作与视觉推理提供了一个试验平台,同时也凸显了它们当前在探索过程中收集和解读证据能力上的局限。

查看 arXiv 页面 (https://arxiv.org/abs/2609.40325) 查看 PDF (https://arxiv.org/pdf/2609.40325) 项目页面 (https://ucsb-nlp-chang.github.io/WorldAuditBench/) GitHub2 (https://github.com/UCSB-NLP-Chang/WorldAuditBench) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2609.40325)

引用本文的模型0

没有模型关联本文

在模型 README.md 中引用 arxiv.org/abs/2609.40325,即可将本文链接到本页面。

引用本文的数据集0

没有数据集关联本文

在数据集 README.md 中引用 arxiv.org/abs/2609.40325,即可将本文链接到本页面。

引用本文的 Spaces0

没有 Space 关联本文

在 Space README.md 中引用 arxiv.org/abs/2609.40325,即可将本文链接到本页面。

包含本文的合集0

没有合集包含本文

将本文添加到合集 (https://huggingface.co/new-collection),即可从本页面链接到它。

相似文章

WBench:面向交互式视频世界模型评估的综合多轮基准

Hugging Face Daily Papers

WBench是一个全面的多轮基准,用于评估交互式世界模型在五个维度上的表现,包含289个测试用例和1,058次交互轮次,提供自动子指标和诊断洞察。它揭示了没有单一模型能在所有维度上都表现优异。

WorldMemArena:通过动作-世界交互评估多模态智能体记忆

Hugging Face Daily Papers

WorldMemArena 是一个新的基准测试,包含400个多会话多模态任务,用于评估多模态智能体记忆,比较了长上下文、RAG和基于框架的记忆方法,揭示了更好的记忆写入并不保证更好的性能,并且系统在处理视觉证据方面存在困难。