UrbanGround:从局部感知到空间能动性在真实城市中的研究

Hugging Face Daily Papers 论文

摘要

UrbanGround评估了多模态语言模型代理是否能在逼真的3D城市复制品中保持可靠的导航和空间推理能力,发现局部感知技能无法组合成扩展的目标导向行为。

多模态大型语言模型(MLLMs)可以解读街景,但城市能动性取决于代理开始移动后这些局部证据是否仍然有用。本文研究了当前MLLM代理在复杂的真实规模城市中能将多少局部城市感知转化为可靠行动。我们提出了UrbanGround,这是一个沙盒平台,利用全港3D地理空间数据构建物理约束的香港复制品,使这一问题变得可测试。UrbanGround支持从第一人称视角进行闭环交互,并提供交互式地图用于导航。代理可以直接进入3D城市,从第一人称视角进行探索。我们的分析通过三个研究问题来探讨空间问题的增长。首先,我们测试代理是否能够充分理解局部场景以回答主动观察后的空间问题。然后,我们探讨这种理解是否支持导航,即使目的地变得更远且更不明确。最后,我们检查在路线可用性和行人运动变化的情况下,由此产生的行为是否仍然有效。当代MLLM代理通常在视觉识别和短程空间推理方面表现出有用的原子能力,而定位和行人感知运动仍然不可靠。其主要失败出现在扩展探索中,局部能力无法组合成持续的目标导向行为,错误在没有有效纠正的情况下累积。我们希望UrbanGround能够支持更广泛的研究,探讨当前MLLM代理在复杂开放式城市环境中能可靠探索到什么程度。
查看原文
查看缓存全文

缓存时间: 2026/08/28 03:23

论文页面 - UrbanGround:从局部感知到真实尺度城市中的空间能动性

来源:https://huggingface.co/papers/2608.27456 发布于 8 月 27 日

#3 当日热门论文 (https://huggingface.co/papers/date/2026-08-28) 作者: , , , , , , , , , , , , , , , ,

摘要

UrbanGround 评估了多模态语言模型智能体能否在逼真的 3D 城市副本中维持可靠的导航和空间推理能力,揭示了局部感知技能无法有效组合成有目的的长程行为。

多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20large%20language%20models)(MLLMs) 能够解读街景,但城市的能动性取决于当智能体开始移动后,此类局部信息是否仍然有效。在本文中,我们研究了当前的MLLM 智能体 (https://huggingface.co/papers?q=MLLM%20agents)能在多大程度上,在复杂且真实尺度的城市中,将局部城市感知转化为可靠的行动。我们提出了UrbanGround (https://huggingface.co/papers?q=UrbanGround),这是首个基于全境3D 地理空间数据 (https://huggingface.co/papers?q=3D%20geospatial%20data)构建的、物理约束下的香港副本,使这个问题变得可测试的沙盒环境。UrbanGround (https://huggingface.co/papers?q=UrbanGround) 支持从第一人称视角 (https://huggingface.co/papers?q=first-person%20view)进行闭环交互 (https://huggingface.co/papers?q=closed-loop%20interaction),并提供交互式地图用于导航。智能体可以直接进入 3D 城市,并从第一人称视角 (https://huggingface.co/papers?q=first-person%20view)进行探索。我们的分析围绕空间问题的递进设置了三个研究问题。首先,我们测试智能体能否在主动观察后,对局部场景进行充分定位以回答空间问题。接着,我们探究当目的地变得更远且更不明确时,这种定位能力是否支持导航。最后,我们考察在路线可用性和行人运动发生变化时,产生的行为是否依然有效。当代MLLM 智能体 (https://huggingface.co/papers?q=MLLM%20agents)通常在视觉识别和短距离空间推理 (https://huggingface.co/papers?q=spatial%20reasoning)方面展现出有用的原子能力,而方向判断和行人感知运动 (https://huggingface.co/papers?q=pedestrian-aware%20movement)仍不可靠。它们的核心失败出现在长程探索中,即局部能力无法组合成持续的、有目的的行为 (https://huggingface.co/papers?q=goal-directed%20behavior),错误会累积且得不到有效修正。我们希望UrbanGround (https://huggingface.co/papers?q=UrbanGround)能支持更广泛的研究,探索当前MLLM 智能体 (https://huggingface.co/papers?q=MLLM%20agents)在复杂、开放式的城市场景中可靠探索的程度。

查看 arXiv 页面 (https://arxiv.org/abs/2608.27456)查看 PDF (https://arxiv.org/pdf/2608.27456)项目页面 (https://urbanground.github.io/)GitHub17 (https://github.com/UrbanGround/UrbanGround)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.27456)

在你的智能体中获取这篇论文:

hf papers read 2608\.27456

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.27456 以从本页链接到它。

引用本文的数据集0

无数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.27456 以从本页链接到它。

引用本文的 Spaces0

无 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.27456 以从本页链接到它。

包含本文的收藏夹0

无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从本页链接到它。

相似文章

360CityArena:面向具身智能体的逼真虚拟城市导航基准

Hugging Face Daily Papers

360CityArena 是一个基于东京秋叶原地区360度视频构建的照片级逼真城市导航基准。它评估具身智能体的环境理解、路径推理和空间推理能力,结果表明,即使是像 Gemini 2.5 Flash 这样强大的基于LMM的智能体,其表现也远低于人类水平。

SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力

Hugging Face Daily Papers

SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。