UrbanGround:从局部感知到空间能动性在真实城市中的研究
摘要
UrbanGround评估了多模态语言模型代理是否能在逼真的3D城市复制品中保持可靠的导航和空间推理能力,发现局部感知技能无法组合成扩展的目标导向行为。
查看缓存全文
缓存时间: 2026/08/28 03:23
论文页面 - UrbanGround:从局部感知到真实尺度城市中的空间能动性
来源:https://huggingface.co/papers/2608.27456 发布于 8 月 27 日
#3 当日热门论文 (https://huggingface.co/papers/date/2026-08-28) 作者: , , , , , , , , , , , , , , , ,
摘要
UrbanGround 评估了多模态语言模型智能体能否在逼真的 3D 城市副本中维持可靠的导航和空间推理能力,揭示了局部感知技能无法有效组合成有目的的长程行为。
多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20large%20language%20models)(MLLMs) 能够解读街景,但城市的能动性取决于当智能体开始移动后,此类局部信息是否仍然有效。在本文中,我们研究了当前的MLLM 智能体 (https://huggingface.co/papers?q=MLLM%20agents)能在多大程度上,在复杂且真实尺度的城市中,将局部城市感知转化为可靠的行动。我们提出了UrbanGround (https://huggingface.co/papers?q=UrbanGround),这是首个基于全境3D 地理空间数据 (https://huggingface.co/papers?q=3D%20geospatial%20data)构建的、物理约束下的香港副本,使这个问题变得可测试的沙盒环境。UrbanGround (https://huggingface.co/papers?q=UrbanGround) 支持从第一人称视角 (https://huggingface.co/papers?q=first-person%20view)进行闭环交互 (https://huggingface.co/papers?q=closed-loop%20interaction),并提供交互式地图用于导航。智能体可以直接进入 3D 城市,并从第一人称视角 (https://huggingface.co/papers?q=first-person%20view)进行探索。我们的分析围绕空间问题的递进设置了三个研究问题。首先,我们测试智能体能否在主动观察后,对局部场景进行充分定位以回答空间问题。接着,我们探究当目的地变得更远且更不明确时,这种定位能力是否支持导航。最后,我们考察在路线可用性和行人运动发生变化时,产生的行为是否依然有效。当代MLLM 智能体 (https://huggingface.co/papers?q=MLLM%20agents)通常在视觉识别和短距离空间推理 (https://huggingface.co/papers?q=spatial%20reasoning)方面展现出有用的原子能力,而方向判断和行人感知运动 (https://huggingface.co/papers?q=pedestrian-aware%20movement)仍不可靠。它们的核心失败出现在长程探索中,即局部能力无法组合成持续的、有目的的行为 (https://huggingface.co/papers?q=goal-directed%20behavior),错误会累积且得不到有效修正。我们希望UrbanGround (https://huggingface.co/papers?q=UrbanGround)能支持更广泛的研究,探索当前MLLM 智能体 (https://huggingface.co/papers?q=MLLM%20agents)在复杂、开放式的城市场景中可靠探索的程度。
查看 arXiv 页面 (https://arxiv.org/abs/2608.27456)查看 PDF (https://arxiv.org/pdf/2608.27456)项目页面 (https://urbanground.github.io/)GitHub17 (https://github.com/UrbanGround/UrbanGround)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.27456)
在你的智能体中获取这篇论文:
hf papers read 2608\.27456
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.27456 以从本页链接到它。
引用本文的数据集0
无数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.27456 以从本页链接到它。
引用本文的 Spaces0
无 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.27456 以从本页链接到它。
包含本文的收藏夹0
无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从本页链接到它。
相似文章
360CityArena:面向具身智能体的逼真虚拟城市导航基准
360CityArena 是一个基于东京秋叶原地区360度视频构建的照片级逼真城市导航基准。它评估具身智能体的环境理解、路径推理和空间推理能力,结果表明,即使是像 Gemini 2.5 Flash 这样强大的基于LMM的智能体,其表现也远低于人类水平。
CityRAG:基于空间锚定的视频生成,步入真实城市
CityRAG 提出一种视频生成模型,利用地理注册数据生成长时、物理一致、3D 连贯的真实城市视频,为机器人与自动驾驶提供可导航、可仿真的逼真环境。
SpatialWorld: 多模态智能体在真实世界任务中的交互式空间推理基准测试
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。
SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力
SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。
WildCity: 一个真实世界城市规模的渲染、仿真与空间智能测试平台
WildCity 引入了由自动驾驶车队收集的大规模多模态数据集,用于城市规模的导航与空间表征。该数据集包含 18 条长轨迹,并建立了重建与闭环仿真的基线,以推动能够感知和推理城市规模环境的 AI 系统发展。