CityBehavEx: 一个可扩展且经实证验证的LLM辅助城市仿真平台

arXiv cs.CL 论文

摘要

CityBehavEx是一个可扩展的LLM辅助城市仿真平台,它结合了成熟的人类移动模型与微调后的交叉编码器,为城市规模的人口生成真实且经实证验证的移动模式。在单个消费级GPU上,不到一小时即可模拟100,000个智能体在75天内的行为。

arXiv:2607.12086v1 公告类型:新 摘要:近年来基于LLM的多智能体城市仿真器能够生成语义丰富的城市日常行为,但它们在扩展时成本高昂,且往往缺乏对实证移动模式的充分验证。我们提出了CityBehavEx,一个交互式LLM辅助城市仿真平台,可扩展至城市规模的人口,暴露智能体行为以供检查,支持实证验证,并生成更符合真实世界空间、时间和语义分布的移动模式。CityBehavEx并非对每个智能体动作都调用大型语言模型,而是将成熟的人类移动模型与微调后的交叉编码器相结合,这些编码器用于估计智能体档案、日程安排和活动转换之间的语义对齐。这种设计实现了大规模仿真,如在单个消费级GPU上,不到一小时即可模拟100,000个智能体在75天内的行为的案例研究所展示的那样。该平台允许用户定义仿真区域、启动实验、检查轨迹和活动痕迹、调试不合理行为,并针对现实世界的移动、时间使用和语义指标验证生成的日常行为。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:22

# CityBehavEx:一种可扩展且经实证验证的LLM辅助城市仿真平台
来源:https://arxiv.org/html/2607.12086
Gustavo H. Santos1,2,Aline Carneiro Viana2,Thiago H. Silva1,3 1巴西UTFPR,2法国Inria,3加拿大多伦多大学

###### 摘要

近年来基于LLM的多智能体城市仿真器能够生成语义丰富的城市日常行为,但它们在扩展性方面成本高昂,并且往往缺乏对经验性移动模式的严格验证。我们提出CityBehavEx,一个交互式LLM辅助城市仿真平台,可扩展至城市规模的人口,支持智能体行为检查,支持经验性验证,并生成更符合真实世界空间、时间和语义分布的移动模式。CityBehavEx并未对每个智能体的每个动作调用大型语言模型,而是将成熟的人类移动模型与微调的交叉编码器相结合,后者用于估计智能体画像、日程安排和活动转换之间的语义对齐度。这种设计使得大规模仿真成为可能,正如一项案例研究所展示的:在单张消费级GPU上,不到一小时内即可模拟100,000个智能体在75天内的行为。该平台允许用户定义仿真区域、启动实验、检查轨迹和活动痕迹、调试不合理行为,并根据真实世界的移动、时间使用和语义指标验证生成的日常行为。

## 1 引言

近年来基于LLM的多智能体城市仿真器能够生成具有语义丰富性、社会人口统计意识和上下文适应性的城市日常行为[Piao等人,2025 (https://arxiv.org/html/2607.12086#bib.bib18);Bougie和Watanabe,2025 (https://arxiv.org/html/2607.12086#bib.bib3);Ye等人,2026 (https://arxiv.org/html/2607.12086#bib.bib30);Wang等人,2024 (https://arxiv.org/html/2607.12086#bib.bib27)]。然而,它们通常依赖重复的LLM推理来生成或修正单个动作,导致扩展成本高昂。其评估也常常局限于合理性检查、LLM作为评判者的评估或粗略的聚合分布,从而引发关于生成行为是否再现人类移动经验模式的问题[Santos等人,2026 (https://arxiv.org/html/2607.12086#bib.bib19)]。与此同时,人类移动研究提供了成熟的规律性和验证指标,包括每日活动模式、探索-返回动态、访问模式、可预测性和空间位移规律[González等人,2008 (https://arxiv.org/html/2607.12086#bib.bib9);Song等人,2010b (https://arxiv.org/html/2607.12086#bib.bib24);Schneider等人,2013 (https://arxiv.org/html/2607.12086#bib.bib21);Pappalardo和Simini,2017 (https://arxiv.org/html/2607.12086#bib.bib16);Schläpfer等人,2021 (https://arxiv.org/html/2607.12086#bib.bib20)]。这些发现为约束和评估生成式城市仿真提供了有用的构建块。

在本文中,我们提出CityBehavEx,一个交互式LLM辅助城市仿真平台,可扩展至城市规模的人口,支持智能体行为检查,支持经验性验证,并生成更符合真实世界空间、时间和语义分布的移动模式。CityBehavEx并非使用LLM生成每个智能体的每个动作,而是将语义推理与轨迹生成分离。它使用成熟的移动模型来指导每日日程和探索-返回动态,同时使用微调的交叉编码器来估计智能体画像、日程安排、POI选择和活动转换之间的语义对齐度。这些分数被整合到高效的随机模块中,用于日程选择、微观活动生成、社交接触和交通决策。

CityBehavEx被设计为一个端到端的平台,用于构建、检查和验证城市仿真。通过网页界面或CLI访问,该系统使用户能够定义地理区域、配置智能体群体、启动仿真并在地图上视觉回放轨迹。仿真后,用户可以深入检查个体画像和活动痕迹,识别不合理行为,并根据经验性的移动、时间使用、语义和社交网络指标评估生成的日常行为。内置的反馈循环进一步允许研究人员针对特定目标城市或场景迭代调整参数和语义对齐模块。

为确保持续公共访问并防止闭源托管(与CitySim不同),该平台在AGPLv3许可证下发布111https://github.com/gefgu/citybehavex。仓库包含源代码、文档、视频演示和可复现配置。设计轻量化,默认设置仅需单台工作站配备4GB VRAM GPU用于交叉编码操作,因为LLM可通过API访问。对于更大规模的场景(受内存限制,参见附录C (https://arxiv.org/html/2607.12086#A3)),我们提供一个基于YJMOB的公共1000样本合成数据集,用于开箱即用测试,无需专有数据。

CityBehavEx还弥合了规模与真实感之间的差距。单张RTX 5090可在不到一小时内模拟100,000个智能体在75天内的行为。对于500智能体、7天的场景,CityBehavEx仅需几分钟,而近期基于LLM的基线方法则需要数天。由于它还生成优越的空间、时间和语义移动模式,该系统表明高效的语言处理可以使城市仿真更具可扩展性、可检查性和经验真实性。

## 2 CityBehavEx系统

本节描述CityBehavEx的主要模块;图1 (https://arxiv.org/html/2607.12086#S2.F1)总结了架构。

参见标题图1:CityBehavEx架构概览。

### 2.1 画像生成

智能体画像提供了CityBehavEx用于分配日程、活动、交通方式和位置的人口统计和行为背景。画像完全可配置,系统包含一个默认的合成人口生成器,用于跨城市和场景运行仿真[Dyer等人,2024 (https://arxiv.org/html/2607.12086#bib.bib6)]。我们改编了SimPaths画像生成流水线[Bronka等人,2025 (https://arxiv.org/html/2607.12086#bib.bib4)],采样诸如年龄、教育程度、家庭构成、职业、交通资源、家庭/工作位置等属性;完整模式见附录A (https://arxiv.org/html/2607.12086#A1)。

为可扩展性,默认生成器独立采样属性。为减少不一致的画像(例如16岁智能体拥有硕士学位),一个微调的ModernBERT模型[Warner等人,2025 (https://arxiv.org/html/2607.12086#bib.bib28)]标记不一致的画像进行重新采样。用户还可以通过更新画像模式和语义对齐模块使用的叙述模板来添加或重新定义属性。

家庭和工作位置受到特殊处理,因为它们影响通勤距离和附近机会的可达性。CityBehavEx从住宅建筑密度和非POI密度中采样家庭瓦片,然后根据基于非住宅建筑密度、POI密度和距离衰减的吸引力分数采样工作瓦片。默认情况下,家庭-工作距离遵循从分析数据集中估计的可配置对数正态分布(第3.1节 (https://arxiv.org/html/2607.12086#S3.SS1))。建筑和POI数据来自Overture Maps[Overture Maps Foundation,2026 (https://arxiv.org/html/2607.12086#bib.bib15)]。

### 2.2 日记生成

##### 生成。

日记定义智能体的每日结构,作为以15分钟为粒度的活动块序列。CityBehavEx使用受经验性移动规律约束的LLM生成候选日记池,包括每日访问规律[Schneider等人,2013 (https://arxiv.org/html/2607.12086#bib.bib21)]。改编自DITRAS[Pappalardo和Simini,2017 (https://arxiv.org/html/2607.12086#bib.bib16)],位置表示为Home、Work或Other。生成器结合移动模式,生成适应目标城市的平日和周末日程,并支持场景特定的覆盖,如假期、中断或灾难。

##### 语义对齐和聚类。

认识到人类移动大多遵循有限的一组可预测的每日模式[Schneider等人,2013 (https://arxiv.org/html/2607.12086#bib.bib21)],CityBehavEx避免了在日记分配期间每个智能体LLM推理的过高成本。相反,我们使用微调的ModernBERT交叉编码器[Warner等人,2025 (https://arxiv.org/html/2607.12086#bib.bib28)]估计文本化智能体画像与候选日记之间的语义兼容性。为训练该模型,我们提示一个LLM生成1,000个多样的画像-日记对,并评分兼容性。这些对作为监督信号,微调交叉编码器以将新的画像-日记组合映射到对齐分数s_ks\_k。为进一步确保性能扩展,智能体按画像相似度聚类,对齐分数在聚类级别计算。最后,基于这些分数的随机分配在相同聚类内的智能体之间引入自然的行为变异性。

##### 语义加权CRP。

为平衡日常与探索,CityBehavEx使用语义加权中国餐馆过程(SW-CRP)[Blei和Frazier,2011 (https://arxiv.org/html/2607.12086#bib.bib2)]。仿真天数被视为“顾客”,候选日记被视为“桌子”。设KK表示智能体在前几天已选择的日记集合,UU表示该智能体尚未使用的候选日记集合。智能体在第tt天选择已用日记k∈Kk\\in K的概率取决于先前使用次数和语义对齐:

P\(ct=k\)=nk·esk/T∑j∈Knj·esj/T\+∑j∈Uα·esj/T,P\(c\_\{t\}=k\)=\\frac\{n\_\{k\}\\cdot e^\{s\_\{k\}/T\}\}\{\\sum\_\{j\\in K\}n\_\{j\}\\cdot e^\{s\_\{j\}/T\}\+\\sum\_\{j\\in U\}\\alpha\\cdot e^\{s\_\{j\}/T\}\},其中nkn\_\{k\}是日记kk的使用次数,sks\_\{k\}是语义对齐分数,TT是温度参数,α\\alpha控制对UU中未使用日记的探索。对于未使用的日记k∈Uk\\in U,使用相同分母,分子为αesk/T\\alpha e^\{s\_\{k\}/T\}。为建模异质性,TT和α\\alpha从可配置的对数正态分布中采样。

### 2.3 探索与偏好性返回

在日记执行过程中,智能体前往固定的Home和Work瓦片,而Other块的目的地通过探索与偏好性返回(EPR)机制选择[Song等人,2010a (https://arxiv.org/html/2607.12086#bib.bib23)]。智能体特定参数决定智能体是探索新的POI还是返回之前访问过的位置。为使探索具有语义感知,CityBehavEx使用微调的ModernBERT模型对POI类型进行评分,并应用第2.2节 (https://arxiv.org/html/2607.12086#S2.SS2)描述的SW-CRP机制。对于每个画像聚类和Other块,该过程过滤与智能体和上下文兼容的POI类别。探索随后从过滤后的POI类型中采样新目的地,而返回则从智能体访问过的位置中采样。

### 2.4 微观日程生成

近年来基于LLM的城市仿真器常生成开放词汇的微观活动,例如读书或写邮件[Piao等人,2025 (https://arxiv.org/html/2607.12086#bib.bib18)]。尽管表达性强,但此类描述难以对照时间使用数据进行验证。CityBehavEx将微观日程生成基于跨国时间使用研究(MTUS)定义的25个活动类别[IPUMS MTUS,2026 (https://arxiv.org/html/2607.12086#bib.bib12)]。

当智能体进入宏观日程块(如Home、Work或Other)时,CityBehavEx采样活动直到块结束。我们根据上下文屏蔽活动集:在Work块期间禁用睡眠,而Other活动受限于POI类型(使用LLM将Overture Maps映射为15个类别)。为变化块转换,我们从活动特定的对数正态分布中采样活动持续时间。这提供了简单、可控的分布,更易于LLM适应,基于经典模型[Moore等人,1997 (https://arxiv.org/html/2607.12086#bib.bib13);Strum等人,2000 (https://arxiv.org/html/2607.12086#bib.bib25)]。

活动选择使用与日记选择相同的语义加权CRP机制。语义权重取决于画像聚类(第2.2节 (https://arxiv.org/html/2607.12086#S2.SS2))、白天时段、块或POI类型以及前一个活动。这使得CityBehavEx能够编码时间常识:午夜回家的智能体更可能睡觉,而晚间家庭块则赋予准备和进食食物更高的概率。

### 2.5 社交模块

CityBehavEx通过空间邻近性、语义相似性和共现来建模社交网络形成。初始网络从可配置的对数正态度分布中采样每个智能体的预期朋友数量,候选者来自智能体的家庭和工作H3单元。更高的画像嵌入相似性增加了形成联系的概率。在仿真期间,偶然友谊从重复共现中产生:访问相同地点的智能体可能根据遭遇规律性和邻域重叠建立联系,遵循RECAST[Olmo Vaz de Melo等人,2015 (https://arxiv.org/html/2607.12086#bib.bib14)]。友谊强度以可配置间隔更新,在重复遭遇后增加,无遭遇时衰减。

### 2.6 交通模块

CityBehavEx使用多模式交通模块来分配交通方式并估计位置间的移动。每个智能体从对数正态分布中采样步行和骑行距离阈值。低于步行阈值的行程分配为步行;否则,模式选择取决于画像生成中的智能体交通资源(第2.1节 (https://arxiv.org/html/2607.12086#S2.SS1))。拥有自行车访问权限的智能体在行程在其骑行阈值内时骑行,拥有汽车访问权限的智能体使用道路网络,其余行程在铁路可用时使用铁路,否则使用汽车/出租车作为后备。

道路和铁路数据来自Overture Maps[Overture Maps Foundation,2026 (https://arxiv.org/html/2607.12086#bib.bib15)],包括限速信息(如可用),将路线和旅行时间约束于真实基础设施。为保持路线规划高效,CityBehavEx使用可缓存的收缩层次方法[Geisberger等人,2008 (https://arxiv.org/html/2607.12086#bib.bib8)],计算最短路径并在智能体和重复行程之间重用路线。

### 2.7 反馈与校准循环

由于CityBehavEx依赖可配置参数和语义对齐模型,用户可以在检查输出后迭代校准仿真。反馈循环支持两种验证设置:将生成的行为与文献中的移动规律进行比较,或者,当经验性移动或时间使用数据可用时,将仿真与完整评估套件进行比较。

CityBehavEx支持手动和自动校准。

相似文章