360CityArena:面向具身智能体的逼真虚拟城市导航基准
摘要
360CityArena 是一个基于东京秋叶原地区360度视频构建的照片级逼真城市导航基准。它评估具身智能体的环境理解、路径推理和空间推理能力,结果表明,即使是像 Gemini 2.5 Flash 这样强大的基于LMM的智能体,其表现也远低于人类水平。
查看缓存全文
缓存时间: 2026/08/12 08:18
论文页面 - 360CityArena:面向具身智能体的逼真虚拟城市导航基准
来源:https://huggingface.co/papers/2608.08814
摘要
一个新的逼真城市场景基准揭示了具身智能体在城市规模导航和空间推理方面的巨大性能差距。
我们提出了 360CityArena,一个用于在由 360 度视频构建的逼真环境中评估具身智能体城市探索能力的基准。现有的户外基准要么缺乏足够的逼真度,要么缺乏复杂性,导致与现实世界城市场景之间存在较大差距。360CityArena 基于日本东京秋叶原地区的真实重建,使用覆盖 85 条街道的 602 个 360 度视频片段,包含 175 个精心人工设计的任务。它涵盖三个任务类别:环境理解、路径推理和空间推理,覆盖了城市探索所需的基本能力,如定位、地标搜索、路径规划和关系空间推理,从而能够在真实城市场景中进行全面评估。我们使用最先进的基于 LMM 的智能体进行的评估表明,即使是最强的模型 Gemini 2.5 Flash,其表现也远低于人类水平(人类:77.3% 对比 Gemini 2.5 Flash:17.1%),揭示了城市规模具身导航和推理中仍然存在的巨大挑战。360CityArena 为逼真的城市区域导航和空间推理提供了一个必要且具有挑战性的试验平台。
查看 arXiv 页面 (https://arxiv.org/abs/2608.08814) 查看 PDF (https://arxiv.org/pdf/2608.08814) 项目页面 (https://360mm-team.github.io/360CityArena/) GitHub5 (https://github.com/360MM-Team/360CityArena) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.08814)
在你的智能体中获取此论文:
hf papers read 2608\.08814
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接到该论文
在模型 README.md 中引用 arxiv.org/abs/2608.08814,即可从此页面链接到该论文。
引用此论文的数据集 0
没有数据集链接到该论文
在数据集 README.md 中引用 arxiv.org/abs/2608.08814,即可从此页面链接到它。
引用此论文的 Space 0
没有 Space 链接到该论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.08814,即可从此页面链接到它。
包含此论文的收藏集 0
没有收藏集包含该论文
将此论文添加到收藏集,即可从此页面链接到它。
相似文章
UrbanGround:从局部感知到空间能动性在真实城市中的研究
UrbanGround评估了多模态语言模型代理是否能在逼真的3D城市复制品中保持可靠的导航和空间推理能力,发现局部感知技能无法组合成扩展的目标导向行为。
WildCity: 一个真实世界城市规模的渲染、仿真与空间智能测试平台
WildCity 引入了由自动驾驶车队收集的大规模多模态数据集,用于城市规模的导航与空间表征。该数据集包含 18 条长轨迹,并建立了重建与闭环仿真的基线,以推动能够感知和推理城市规模环境的 AI 系统发展。
CityRAG:基于空间锚定的视频生成,步入真实城市
CityRAG 提出一种视频生成模型,利用地理注册数据生成长时、物理一致、3D 连贯的真实城市视频,为机器人与自动驾驶提供可导航、可仿真的逼真环境。
WorldAuditBench:基于多模态智能体的交互式3D世界审计
WorldAuditBench 是一个包含213个异常审计任务的基准,涵盖13个基于 Unreal Engine 5 / Three.js 构建的交互式3D环境,用于评估多模态智能体能否将动作与视觉推理有效耦合。前沿模型的成功率仅为6.6%–42.3%,远低于人类的83.4%,凸显出当前在证据收集与解读方面的局限性。
一个AI代理在实时物理模拟中成功堆叠方块——为具身AI打造开放基准测试竞技场
一个早期项目正在构建一个开放的、基于浏览器的竞技场,供AI代理在实时物理推理任务中竞争。演示中,一个AI代理在方块堆叠模拟中达到了100%的任务完成率和高空间准确率。