WorldAuditBench:基于多模态智能体的交互式3D世界审计
摘要
WorldAuditBench 是一个包含213个异常审计任务的基准,涵盖13个基于 Unreal Engine 5 / Three.js 构建的交互式3D环境,用于评估多模态智能体能否将动作与视觉推理有效耦合。前沿模型的成功率仅为6.6%–42.3%,远低于人类的83.4%,凸显出当前在证据收集与解读方面的局限性。
查看缓存全文
缓存时间: 2026/10/01 04:21
论文页面 - WorldAuditBench:借助多模态智能体实现交互式 3D 世界审计
来源:https://huggingface.co/papers/2609.40325
摘要
随着交互式 3D 世界被越来越多地用于研究智能行为,开发高效的流水线来识别这些仿真环境中的异常变得十分重要,例如悬浮物体、可穿过的墙壁,或与周围场景不一致的物体。包括视觉-语言模型(VLMs)和视觉-语言-动作模型(VLAs)在内的多模态 AI 系统,已在自动化这一任务方面展现出潜力。然而,3D 世界审计十分复杂,需要两种不同能力的紧密耦合:动作能力——在 3D 世界中导航,并系统、高效地搜寻异常;以及视觉推理能力——理解环境,并从多模态观测中识别异常。多模态智能体能否有效地耦合这两种能力——利用视觉推理识别潜在异常,同时通过采取行动来验证这些异常——在很大程度上仍未被探索。本文提出 WorldAuditBench,一个用于 3D 世界审计的基准,包含 213 个异常任务,分布在 13 个由 Unreal Engine 5 和 Three.js 构建的环境中,涵盖五类异常。我们在固定的探索预算下,采用两种审计范式评估了五个前沿模型:基于 VLA 的探索加上基于 VLM 的异常识别,以及一个端到端的 VLM 智能体,其中视觉推理直接指导动作选择。在所评估的模型和两种范式中,成功率介于 6.6% 到 42.3% 之间,远低于人类表现(83.4%)。通过世界审计这一任务,WorldAuditBench 为研究多模态智能体如何在交互式 3D 环境中耦合动作与视觉推理提供了一个试验平台,同时也凸显了它们当前在探索过程中收集和解读证据能力上的局限。
查看 arXiv 页面 (https://arxiv.org/abs/2609.40325) 查看 PDF (https://arxiv.org/pdf/2609.40325) 项目页面 (https://ucsb-nlp-chang.github.io/WorldAuditBench/) GitHub2 (https://github.com/UCSB-NLP-Chang/WorldAuditBench) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2609.40325)
引用本文的模型0
没有模型关联本文
在模型 README.md 中引用 arxiv.org/abs/2609.40325,即可将本文链接到本页面。
引用本文的数据集0
没有数据集关联本文
在数据集 README.md 中引用 arxiv.org/abs/2609.40325,即可将本文链接到本页面。
引用本文的 Spaces0
没有 Space 关联本文
在 Space README.md 中引用 arxiv.org/abs/2609.40325,即可将本文链接到本页面。
包含本文的合集0
没有合集包含本文
将本文添加到合集 (https://huggingface.co/new-collection),即可从本页面链接到它。
相似文章
SpatialWorld: 多模态智能体在真实世界任务中的交互式空间推理基准测试
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。
AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准
介绍了AutoWorldModel-Bench,这是一个闭环基准测试,用于评估AI编程代理在八个游戏环境中进行自主世界模型研究的能力。该基准测试表明,Codex-5.4和Claude Opus 4.6等前沿代理在大多数会话中进行了非平凡的研究型改进。
WBench:面向交互式视频世界模型评估的综合多轮基准
WBench是一个全面的多轮基准,用于评估交互式世界模型在五个维度上的表现,包含289个测试用例和1,058次交互轮次,提供自动子指标和诊断洞察。它揭示了没有单一模型能在所有维度上都表现优异。
WorldMemArena:通过动作-世界交互评估多模态智能体记忆
WorldMemArena 是一个新的基准测试,包含400个多会话多模态任务,用于评估多模态智能体记忆,比较了长上下文、RAG和基于框架的记忆方法,揭示了更好的记忆写入并不保证更好的性能,并且系统在处理视觉证据方面存在困难。
TOBench:面向真实世界工具使用智能体的任务导向全模态基准
TOBench是一个新的基准测试,用于评估AI智能体在真实世界、任务导向的工具使用中的表现,涉及多模态输入和闭环验证。实验表明,像Qwen 3.5 Plus这样的顶级模型仅达到41%的成功率,远低于94%的人类基准,凸显了显著的差距。