360CityArena:面向具身智能体的逼真虚拟城市导航基准

Hugging Face Daily Papers 论文

摘要

360CityArena 是一个基于东京秋叶原地区360度视频构建的照片级逼真城市导航基准。它评估具身智能体的环境理解、路径推理和空间推理能力,结果表明,即使是像 Gemini 2.5 Flash 这样强大的基于LMM的智能体,其表现也远低于人类水平。

我们提出了 360CityArena,这是一个用于评估具身智能体在由360度视频构建的逼真环境中进行城市探索能力的基准。现有的户外基准要么缺乏足够的照片级真实感,要么缺乏复杂性,导致与现实世界城市环境之间存在相当大的差距。360CityArena 基于日本东京秋叶原地区的真实重建,使用了覆盖85条街道的602段360度视频,并由175个精心人工设计的任务组成。它包含三个任务类别:环境理解、路径推理和空间推理,涵盖了城市探索所需的基本能力,如定位、地标搜索、路径规划和关系空间推理,从而能够在真实城市场景中进行全面评估。我们使用最先进的基于LMM的智能体进行的评估表明,即使是最强的模型 Gemini 2.5 Flash,其表现也远低于人类水平(人类:77.3% vs. Gemini 2.5 Flash:17.1%),这揭示了城市规模的具身导航和推理仍然存在的巨大挑战。360CityArena 为逼真的城市区域导航和空间推理提供了一个必要且具有挑战性的测试平台。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:18

论文页面 - 360CityArena:面向具身智能体的逼真虚拟城市导航基准

来源:https://huggingface.co/papers/2608.08814

摘要

一个新的逼真城市场景基准揭示了具身智能体在城市规模导航和空间推理方面的巨大性能差距。

我们提出了 360CityArena,一个用于在由 360 度视频构建的逼真环境中评估具身智能体城市探索能力的基准。现有的户外基准要么缺乏足够的逼真度,要么缺乏复杂性,导致与现实世界城市场景之间存在较大差距。360CityArena 基于日本东京秋叶原地区的真实重建,使用覆盖 85 条街道的 602 个 360 度视频片段,包含 175 个精心人工设计的任务。它涵盖三个任务类别:环境理解、路径推理和空间推理,覆盖了城市探索所需的基本能力,如定位、地标搜索、路径规划和关系空间推理,从而能够在真实城市场景中进行全面评估。我们使用最先进的基于 LMM 的智能体进行的评估表明,即使是最强的模型 Gemini 2.5 Flash,其表现也远低于人类水平(人类:77.3% 对比 Gemini 2.5 Flash:17.1%),揭示了城市规模具身导航和推理中仍然存在的巨大挑战。360CityArena 为逼真的城市区域导航和空间推理提供了一个必要且具有挑战性的试验平台。

查看 arXiv 页面 (https://arxiv.org/abs/2608.08814) 查看 PDF (https://arxiv.org/pdf/2608.08814) 项目页面 (https://360mm-team.github.io/360CityArena/) GitHub5 (https://github.com/360MM-Team/360CityArena) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.08814)

在你的智能体中获取此论文:

hf papers read 2608\.08814

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接到该论文

在模型 README.md 中引用 arxiv.org/abs/2608.08814,即可从此页面链接到该论文。

引用此论文的数据集 0

没有数据集链接到该论文

在数据集 README.md 中引用 arxiv.org/abs/2608.08814,即可从此页面链接到它。

引用此论文的 Space 0

没有 Space 链接到该论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.08814,即可从此页面链接到它。

包含此论文的收藏集 0

没有收藏集包含该论文

将此论文添加到收藏集,即可从此页面链接到它。

相似文章

WorldAuditBench:基于多模态智能体的交互式3D世界审计

Hugging Face Daily Papers

WorldAuditBench 是一个包含213个异常审计任务的基准,涵盖13个基于 Unreal Engine 5 / Three.js 构建的交互式3D环境,用于评估多模态智能体能否将动作与视觉推理有效耦合。前沿模型的成功率仅为6.6%–42.3%,远低于人类的83.4%,凸显出当前在证据收集与解读方面的局限性。