基于多智能体协作推理与工具增强证据的城市区域画像

arXiv cs.AI 论文

摘要

本文提出 UrbanAgent,一个将城市区域画像重新定义为基于推理的推断问题的智能体框架,利用多智能体协作推理和工具增强的证据检索。在全球城市数据集上的碳排放、GDP和人口估算任务中,该框架优于基线方法,R²平均提升8.1%。

arXiv:2607.13558v1 公告类型:新论文 摘要:城市区域画像是城市计算中的核心问题,支持人口估算、经济评估和环境监测等应用。现有方法通常将该任务建模为多模态表示学习,将异构城市数据(如卫星图像、兴趣点、文本描述和3D建筑信息)融合成潜在嵌入以进行预测。然而,这些方法主要基于相关性驱动,假设跨模态一致性,并依赖静态流水线,限制了其在异构或未知城市区域的鲁棒性。我们提出 UrbanAgent,一个将城市区域画像重新定义为基于推理的推断问题的智能体框架。UrbanAgent 为每种数据模态实例化一个独立智能体,并执行结构化的多智能体协作推理,以明确解决跨模态不一致性问题,而不是将其吸收到单一表示中。此外,UrbanAgent 将指标预测扩展为一个主动证据获取和迭代推理的闭环过程,使智能体能够通过工具增强的外部知识检索来验证不确定的推断,并通过强化学习进行优化。在全球城市数据集上的碳排放、GDP和人口估算实验表明,UrbanAgent 一致优于现有基线方法,R²平均提升8.1%,并在未知城市设置中展现出强大的泛化性能。
查看原文
查看缓存全文

缓存时间: 2026/07/16 04:24

# 基于工具增强证据的多智能体协同推理实现城市区域画像 来源:https://arxiv.org/html/2607.13558 郝曦萱 香港科技大学(广州) 广州 中国 [email protected] (https://arxiv.org/html/2607.13558v1/mailto:[email protected]) 蒋雨田 香港科技大学(广州) 广州 中国 [email protected] (https://arxiv.org/html/2607.13558v1/mailto:[email protected]) 刘佳博 香港科技大学(广州) 广州 中国 [email protected] (https://arxiv.org/html/2607.13558v1/mailto:[email protected]) 杨一航 华盛顿大学 西雅图 美国 [email protected] (https://arxiv.org/html/2607.13558v1/mailto:[email protected]) 金广印 长安大学 西安 中国 [email protected] (https://arxiv.org/html/2607.13558v1/mailto:[email protected]) 宋歌 威斯康星大学麦迪逊分校 麦迪逊 美国 [email protected] (https://arxiv.org/html/2607.13558v1/mailto:[email protected]) 梁宇轩 香港科技大学(广州) 广州 中国 [email protected] (https://arxiv.org/html/2607.13558v1/mailto:[email protected]) (2026) ###### 摘要。城市区域画像是城市计算的核心问题,支持人口估算、经济评估和环境监测等应用。现有方法通常将此任务构建为多模态表示学习问题,即融合异构城市数据——例如卫星图像、兴趣点、文本描述和3D建筑信息——形成潜在嵌入以进行预测。然而,这些方法本质上是相关性驱动的,假设跨模态一致性,并依赖于静态流程,这限制了它们在异构或未见城市区域中的鲁棒性。我们提出UrbanAgent,一个智能体框架,将城市区域画像重新定义为推理驱动的推断问题。UrbanAgent为每种数据模式实例化一个独立的智能体,并执行结构化的多智能体协同推理,以明确处理跨模态不一致性,而不是将其吸收到单一表示中。此外,UrbanAgent将指标预测扩展为主动证据获取和迭代推理的闭环过程,使智能体能够通过工具增强的外部知识检索来验证不确定的推断,并通过强化学习进行优化。在碳排放、GDP和人口估算的全球城市数据集上进行的大量实验表明,UrbanAgent始终优于现有基线,在R2R^2指标上平均提升8.1%,并在未见城市场景中表现出强大的泛化能力。††期刊年份:2026††版权:cc††会议:第32届ACM SIGKDD知识发现与数据挖掘会议V.2;2026年8月9-13日,韩国济州岛††书籍名称:第32届ACM SIGKDD知识发现与数据挖掘会议V.2 (KDD '26),2026年8月9-13日,韩国济州岛††doi:10.1145/3770855.3818068††isbn:979-8-4007-2259-2/2026/08## 1. 引言 从数据中理解城市区域是城市计算中的一个基本挑战(Zou等人, 2025a (https://arxiv.org/html/2607.13558#bib.bib121)),广泛应用于人口估算、经济评估和环境监测。随着异构城市数据的日益丰富,最近的研究探索了城市区域画像(Hao等人, 2025c (https://arxiv.org/html/2607.13558#bib.bib110)),旨在通过联合利用包括卫星图像、兴趣点(POIs)、文本描述和3D建筑信息在内的多模态数据来推断区域级属性。近年来,大多数现有方法将此任务构建为表示学习问题(Hao等人, 2025c (https://arxiv.org/html/2607.13558#bib.bib110)),其中多模态输入被编码为潜在表示,并通过深度学习(DL)技术映射到目标属性(Zou等人, 2024 (https://arxiv.org/html/2607.13558#bib.bib162); Yeh等人, 2020 (https://arxiv.org/html/2607.13558#bib.bib158); Yan等人, 2024 (https://arxiv.org/html/2607.13558#bib.bib105); Hao等人, 2025a (https://arxiv.org/html/2607.13558#bib.bib106); Li等人, 2023a (https://arxiv.org/html/2607.13558#bib.bib163); Yong和Zhou, 2024a (https://arxiv.org/html/2607.13558#bib.bib164); Li等人, 2024 (https://arxiv.org/html/2607.13558#bib.bib177); Chan和Ren, 2023 (https://arxiv.org/html/2607.13558#bib.bib178); Hao等人, 2025b (https://arxiv.org/html/2607.13558#bib.bib186))。参见图注图1。城市区域画像的概念与挑战。我们的UrbanAgent是在该任务上首次使用多智能体协同推理的开创性研究。虽然在特定场景中有效,但这种范式在应用于复杂城市系统时表现出固有的局限性(Li等人, 2025b (https://arxiv.org/html/2607.13558#bib.bib184))。特别是,以往基于深度学习的画像方法依赖于潜在融合空间,假设强模态模式,并在静态对齐流程中运作。因此,这些模型本质上是相关性驱动的:它们从训练数据中学习统计关联,但缺乏推理矛盾证据、适应新环境或验证不确定推断的能力。这些局限性在异构或以前未见过的城市区域中尤为突出(Zhong等人, 2024 (https://arxiv.org/html/2607.13558#bib.bib179); Zou等人, 2024 (https://arxiv.org/html/2607.13558#bib.bib162))。在这项工作中,我们认为城市区域画像的挑战不仅仅是表示学习的技术问题,而是反映了学习范式与城市数据复杂本质之间的更深层次错配。如图1 (https://arxiv.org/html/2607.13558#S1.F1)所示,我们识别出两个基本挑战,推动从静态的、相关性驱动的建模转向智能体式的、推理驱动的城市推断: ✦城市模态间的不一致性。城市区域通过多种异构数据模态观测,如卫星图像、POI记录、3D建筑和文本。这些模态捕捉了城市现实的不同方面,包括物理形态、功能用途和语义感知,因此常常为同一区域提供不一致的信号。例如,卫星图像可能描绘出一个低密度住宅区,而POI数据则显示密集的商业活动;3D建筑模型可能只显示少数高层建筑,而文本描述可能将同一区域标记为“新兴商业区”。这种差异在现实城市中很常见,反映了其混合用途的性质而非噪声。然而,大多数现有的多模态画像方法假设异构信号可以对齐并融合成一个统一的表示。当模态不一致时,误导性信号被合并而未被明确识别,导致跨模态不一致性被吸收到融合表示中,最终导致不准确且不可靠的城市评估。 ✦相关性驱动的城市推断。城市区域画像模型很大程度上依赖于从数据中学到的相关性来推断复杂属性。在实践中,易于观察的线索,包括建筑高度、夜间灯光强度、POI密度,通常与高层属性如国内生产总值(GDP)、人口或城市功能相关联。虽然这种相关性在平均情况下可能成立,但在不同的城市背景下并非普遍可靠。例如,旅游区可能表现出强烈的夜间活动但常住人口不高,而建筑高度和天际线密度在不同城市背景下可能是GDP不可靠的代理指标。尽管如此,相关性驱动的模型倾向于统一地在所有区域应用学到的关联,即使局部背景与训练时所见的不同。这可能导致自信但依据薄弱的预测,尤其是在异构或以前未见过的区域。 表1. 传统基于深度学习的城市区域画像方法与UrbanAgent之间的范式级比较。方面基于深度学习的画像 UrbanAgent(本文)融合空间 潜在嵌入 语义推理模式依赖性 强 弱/无处理流程 静态 智能体适应性 有限 通用建模范式 相关性驱动 推理驱动总体而言,这些挑战表明城市区域画像不能充分地被框定为静态特征融合任务。相反,它需要一种以推理为中心的范式,能够处理异构的城市证据,放宽强模式假设,并根据不同的城市背景调整推断行为,而不是仅仅依赖从训练数据中学到的相关性。表1 (https://arxiv.org/html/2607.13558#S1.T1)提炼了这些挑战并激发了对以推理为中心的范式的需求。在本文中,我们提出UrbanAgent,一个用于多模态城市区域画像的智能体框架。UrbanAgent通过显式的多智能体协同推理和结构化的智能体间关系来解决模态不一致性,而不是将所有输入联合嵌入到一个统一的潜在表示中。这种设计使得城市模态间的不一致性能够被明确处理,而不是被隐含吸收。此外,UrbanAgent通过将城市指标预测扩展为主动证据获取和迭代推理的闭环过程来缓解相关性驱动的推断。UrbanAgent不是统一应用从训练数据中学到的相关性,而是使推断行为能够自适应地整合外部的、基于事实的知识作为补充证据,从而减少在异构或以前未见过的城市区域中对脆弱的表面线索的依赖。我们的贡献总结如下: - •多智能体协同推理框架。我们提出UrbanAgent,一个智能体AI框架,将多模态城市画像重新定义为语义推理问题而非潜在嵌入任务。通过将每种模态建模为独立智能体,UrbanAgent实现了灵活的跨模态交互,无需强模式假设。 - •工具增强的智能体学习。UrbanAgent引入了一种工具增强的智能体学习范式,使智能体能够通过工具使用主动获取和验证外部证据。通过将城市指标预测过程扩展为闭环推理过程,并利用强化学习优化工具使用,我们的方法有效缓解了相关性驱动的推断和对LLM内部先验的过度依赖。 - •广泛的实证研究。我们在涵盖碳排放、GDP和人口的全球城市数据集上进行了全面的实验,包括领域内和未见城市场景。结果表明,UrbanAgent在R2R^2指标上始终优于现有的深度学习和多智能体基线8.1%,验证了协同推理和证据驱动推断在城市区域画像中的有效性。参见图注图2。UrbanAgent的总体框架。 ## 2. 预备知识 ### 2.1. 问题形式化 形式化地,对于一个包含NN个城市区域\{ui\}i=1N\\{u_i\\}_{i=1}^N的数据集,给定一组多模态输入Xui=\{xuisat,xuitext,xuipoi,xui3d\}\mathcal{X}_{u_i}=\{x_{u_i}^{\mathrm{sat}}, x_{u_i}^{\mathrm{text}}, x_{u_i}^{\mathrm{poi}}, x_{u_i}^{\mathrm{3d}}\},其中xuisat∈RH×W×Cx_{u_i}^{\mathrm{sat}} \in \mathbb{R}^{H \times W \times C}表示空间分辨率为H×WH \times W、CC通道的卫星图像块;xuitextx_{u_i}^{\mathrm{text}}表示描述该区域的文本信息;xuipoi∈RPui×Mx_{u_i}^{\mathrm{poi}} \in \mathbb{R}^{P_{u_i} \times M}表示区域uiu_i的POI类别信息,其中PuiP_{u_i}表示该区域内POI实例的数量,每一行是POI类别集上的MM维独热向量;xui3d=\{ (Pi,hi) \}x_{u_i}^{\mathrm{3d}} = \{ (\mathcal{P}_i, h_i) \},其中Pi\mathcal{P}_i表示区域ii的平面足迹多边形,hih_i表示其测量高度。因此,城市区域画像(URP)问题是学习一个映射F:Xui→Yui\mathcal{F}: \mathcal{X}_{u_i} \rightarrow \text{Y}_{u_i},以推断DD个城市指标Yui∈RD\text{Y}_{u_i} \in \mathbb{R}^D。 ### 2.2. 相关工作 #### 2.2.1. 城市区域画像 URP旨在从异构的城市观测中预测区域级社会经济指标,核心挑战是捕捉城市环境的多面性。早期研究从人类移动性和POIs中学习区域表示(Luo等人, 2022 (https://arxiv.org/html/2607.13558#bib.bib122); Zhang等人, 2024b (https://arxiv.org/html/2607.13558#bib.bib123); Wen和Zhou, 2024 (https://arxiv.org/html/2607.13558#bib.bib124); Li等人, 2024 (https://arxiv.org/html/2607.13558#bib.bib177); Chan和Ren, 2023 (https://arxiv.org/html/2607.13558#bib.bib178); Zhou等人, 2023 (https://arxiv.org/html/2607.13558#bib.bib181); Hao等人, 2026 (https://arxiv.org/html/2607.13558#bib.bib185); Zou等人, 2024 (https://arxiv.org/html/2607.13558#bib.bib162)),刻画城市空间中的人类活动模式。一些工作通过卫星或街景图像将物理环境线索纳入模型以描绘城市的外观(Liu等人, 2025b (https://arxiv.org/html/2607.13558#bib.bib119); Jenkins等人, 2019 (https://arxiv.org/html/2607.13558#bib.bib129); Jean等人, 2019 (https://arxiv.org/html/2607.13558#bib.bib130); Liu等人, 2023 (https://arxiv.org/html/2607.13558#bib.bib167); Xi等人, 2022 (https://arxiv.org/html/2607.13558#bib.bib182); Zou等人, 2024 (https://arxiv.org/html/2607.13558#bib.bib162); Li等人, 2023b (https://arxiv.org/html/2607.13558#bib.bib183))。后续研究进一步整合了视觉、人类活动和语义信号,以注入更高层次的城市概念(Mühlematter等人, 2025 (https://arxiv.org/html/2607.13558#bib.bib125); Zhao等人, 2025 (https://arxiv.org/html/2607.13558#bib.bib127); Yan等人, 2024 (https://arxiv.org/html/2607.13558#bib.bib105); Hao等人, 2025a (https://arxiv.org/html/2607.13558#bib.bib106))。最近,自监督预训练和多模态基础模型已被探索用于城市分析(Xiao等人, 2024 (https://arxiv.org/html/2607.13558#bib.bib128); Yong和Zhou, 2024b (https://arxiv.org/html/2607.13558#bib.bib126); Liu等人, 2026 (https://arxiv.org/html/2607.13558#bib.bib180); Zhang等人, 2026 (https://arxiv.org/html/2607.13558#bib.bib111); Cao等人, 2026 (https://arxiv.org/html/2607.13558#bib.bib112))。然而,简单地将可能冲突的模态压缩成统一表示会导致语义稀释和逻辑断层。在这项工作中,我们提出了一个结构化的推理框架,明确保留并协调异构的城市模态,实现可验证、可解释的城市区域画像。 #### 2.2.2. 智能体强化学习(RL) 智能体RL将LLMs重新定位为能够进行多步推理和环境交互的操作性智能体(Zhang等人, 2025b (https://arxiv.org/html/2607.13558#bib.bib131)),并得到诸如GRPO等稳定策略优化方法的支持(Guo等人, 2025 (https://arxiv.org

相似文章

UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks

arXiv cs.AI

UrbanAgent is a tool-augmented agent framework that uses LLMs with code execution, API calls, and MCP to handle cross-system urban requests. The authors also introduce UrbanEval, a benchmark for evaluating task results and execution quality, achieving 71% success rate over baselines.

基础模型中的集体智能

arXiv cs.CL

本文提出了一种多智能体推理框架,其中多个基础模型通过结构化批评和聚合进行协作,表明模型异构性显著提高了逐步推理的准确性并减少了跨领域的方差。

多元证据,更优预测:信息不对称下的多智能体协商

arXiv cs.AI

本文介绍了InfoDelphi框架,该框架利用信息不对称(将证据划分为共享的公共子集和不相交的私有子集)来改进多智能体LLM的协商与预测。在PolyGym基准测试上,它在Brier得分上比单智能体和多智能体基线提升12-18%,在准确率上提升4-8个百分点,证明了多样化证据是有效多智能体推理的关键。