当合理不等于现实:评估基于LLM的城市模拟中的人类移动性

arXiv cs.CL 论文

摘要

本文介绍了一个验证框架,用于评估基于LLM的城市模拟器是否再现了经验性的人类移动模式。利用巴黎和上海的数据,作者发现看似合理的叙事与实际移动约束之间存在显著差距,并提供了可复现评估的开放基础设施。

arXiv:2606.13835v1 Announce Type: new Abstract: 基于LLM的生成代理越来越多地用于城市模拟器,但目前尚不清楚它们是否再现了经验上真实的人类移动模式,还是仅仅生成了看似合理的移动叙事。我们引入了一个验证框架,用于评估基于LLM的城市模拟器中生成代理的移动性,并与真实世界移动数据进行比较。为此,我们使用了移动规律、时间节律、网络模式、语义活动转换和行为移动档案。利用大巴黎地区和上海的数据集,我们在多个移动真实性维度上评估了AgentSociety和CitySim。我们的分析揭示了叙事合理性与经验移动真实性之间的显著差距。尽管模拟器捕捉到了一些高层次语义活动分布,但它们在再现核心空间和时间约束方面存在困难,包括真实的出行距离分布、起点-终点流量、停留时间和转换动态。我们进一步观察到,真实的移动多样性在默认提示配置下是不稳定的,可能需要明确的档案感知初始化。为了支持可复现的评估,我们还贡献了可扩展且开放的LLM驱动基础设施,用于区域级地图生成、可观测性增强模拟、移动指标计算和交通模拟。我们的发现强调了基于LLM的城市模拟器需要严格的经验验证,并提供了构建更真实、更可复现的城市模拟系统的实用工具。
查看原文
查看缓存全文

缓存时间: 2026/06/15 08:56

# 当看似合理却不真实:评估基于LLM的城市模拟中的人类移动性  
来源:https://arxiv.org/html/2606.13835  

Aline Carneiro Viana,法国Inria  
Thiago H. Silva,巴西UTFPR 与 加拿大多伦多大学(2026年6月)  

###### 摘要  

基于LLM的生成式智能体越来越多地用于城市模拟器,但尚不清楚它们是否能再现基于经验的人类移动模式,还是仅仅生成看似合理的移动叙事。我们提出了一个验证框架,用于评估基于LLM的城市模拟器中生成式智能体的移动性,并将其与真实世界移动数据进行对比。为此,我们使用了移动定律、时间节律、网络模体、语义活动转换和行为移动特征。利用大巴黎地区和上海的数据集,我们评估了AgentSociety和CitySim在多个移动真实性维度上的表现。我们的分析揭示了叙事合理性与经验移动真实性之间的显著差距。尽管模拟器捕捉到了一些高层次语义活动分布,但它们难以再现核心的空间和时间约束,包括真实的行程长度分布、起终点流量、停留时间和转换动态。我们还观察到,真实的移动多样性在默认提示配置下不稳定,可能需要显式的特征感知初始化。为了支持可重复的评估,我们还提供了可扩展且开放的LLM驱动基础设施,用于区域级地图生成、可观测性增强的模拟、移动指标计算和交通模拟。我们的研究结果强调了基于LLM的城市模拟器需要进行严格的经验验证,并提供了构建更真实且可重复的城市模拟系统的实用工具。  

**关键词**:大型语言模型,生成式智能体,城市模拟,人类移动性,移动性验证,基于智能体的模拟  

††版权:ACMLicensed  
††期刊年份:2026  
††DOI:XXXXXXX.XXXXXXX  
††会议:第34届ACM SIGSPATIAL地理信息系统进展国际会议;2026年11月3–6日;美国加利福尼亚州里弗赛德  
††ISBN:978-1-4503-XXXX-X/26/11  
††CCS:信息系统 → 时空系统  
††CCS:计算方法 → 模拟支持系统  
††CCS:计算方法 → 人工智能  

## 1. 引言  

大型语言模型(LLM)越来越多地用于模拟城市行为和人类移动性(Liang 等,2024;Zeng 等,2025;Sung 等,2026)。最近的框架如AgentSociety(Piao 等,2025)和CitySim(Bougie and Watanabe,2025)支持生成式智能体在模拟城市环境中运行,使其能够规划日常活动、进行社交互动,并根据天气、工作日程和个人需求等上下文信息进行调整。这些系统提出了一种城市模拟的新范式,但引发了一个核心问题:**合成智能体是否再现了经验性的人类移动定律,还是仅仅生成了看似合理的轨迹?** 这一区别对于模拟的有效性至关重要。

数十年的移动性研究刻画了人类行为的复杂性、结构化的昼夜节律以及个体的新奇寻求行为,识别出诸如行程距离的截断幂律分布(González 等,2008)、可预测的访问动态(Song 等,2010;Teixeira 等,2021a)、循环拓扑移动模体(Schneider 等,2013)以及异质但非随机的移动特征(Amichi 等,2020;A. Cuttone, S. Lehmann and M. C. Gonzalez,2018;L. Pappalardo, F. Simini, S. Rinzivillo, D. Pedreschi, F. Giannotti and A.-L. Barabási,2015)等模式。传统的移动模拟器在应用于政策分析或预测之前,通常会根据这些经验模式进行例行验证(Batty,2024;Sargent,2013;Epstein,2007;Kleijnen,1995)。相比之下,LLM驱动的模拟器通常通过基于合理性的评估来进行评价,重点关注生成的日程或行为是否连贯可信(Piao 等,2025;Bougie and Watanabe,2025)。虽然这种评估可能捕捉到时间或叙事上的一致性,但并不能确立真实的移动行为。

实际上,基于合理性的移动评估主要捕捉的是一种“表面效度”(即生成的行为是否看起来合理或可信),而非“客观移动真实性”:智能体的移动可能看似合理(工作日早上7点起床、上班、中午吃午饭、18点回家),但底层的移动过程可能仍然无法再现经验性的人类移动动态(例如,表现出不现实的旅行距离、随机的访问频率、错误的探索动态或缺乏空间约束效应)。

**我们将移动真实性定义为根据经验性的人类移动规律,联合再现空间访问动态和时间活动组织。** 然而,现有LLM驱动模拟器的评估普遍缺乏对这些耦合时空属性的系统验证(Larooij and Törnberg,2025;Kapp 等,2023;Gao and Wu,2026)。

我们提出一个**基于真实世界移动数据和人类移动定律经典文献的、用于LLM城市模拟器的综合验证框架**。据我们所知,这是**首次针对已建立的经验移动定律和时空行为指标对基于LLM的城市模拟器进行系统评估**。我们的研究结果强调了严格经验验证作为合理性评估之外的标准实践的必要性。我们发布了一系列工件,为构建更真实且可重复的城市模拟系统奠定了基础。

总的来说,我们做出以下三项贡献:

**方法论贡献:** 在详细文献综述(参见第2节)之后,我们提出了一个用于LLM驱动移动真实性评估的模块化框架(参见第3节),涵盖五个维度:空间移动定律、时间节律、拓扑模体、行为特征以及语义/时空活动模式。这些维度共同评估模拟轨迹是否在空间和时间维度上再现了经验性的人类移动规律。

**实证贡献:** 利用大巴黎地区和上海的伪匿名移动数据集,我们超越了叙事合理性,评估了AgentSociety(Piao 等,2025)和CitySim(Bougie and Watanabe,2025)。为此,我们引入了**En-AgentSociety**,这是AgentSociety的增强版本,具有改进的移动可追溯性、可观测性和可扩展性。在各项指标上,我们发现合理的智能体行为与经验有效的移动之间存在持续差距(第5节):模拟器再现了一些高层次语义/活动分布,但未能恢复关键的空间约束、位移模式、访问结构和转换动态。我们表明,行为多样性不能仅通过通用角色提示实现,而需要特征感知的初始化和更强的空间约束。

**工件贡献:** 方法论和实证贡献共同构成了一个发布的基础设施,用于对LLM驱动的移动模拟进行可重复的大规模评估¹。该堆栈包括区域级地图生成、可观测性增强的AgentSociety分支、可扩展的Rust+Python指标计算,以及AgentSociety和CitySim所依赖的交通模拟器的开放重实现。它们共同支持区域范围内基于LLM的移动模拟器的标准化基准测试。我们在第6节讨论通往更高保真度的基于LLM的城市模拟路径,并在第7节得出结论。

## 2. 人类移动性概况  

逼真的城市规模移动模拟支持数据驱动的城市服务,但其可靠性取决于准确再现人类移动模式。本节回顾经验移动规律以及近期基于LLM的城市模拟器的局限性。

### 2.1. 经验性人类移动模式  

人类移动在空间和时间尺度上表现出强烈的统计规律。González 等人(2008)利用超过10万手机用户的移动轨迹表明,**人类旅行距离**遵循截断幂律分布,并且个体移动根据特征**回转半径**保持空间有界。随后 Song 等人(2010)的工作证明人类轨迹高度可预测,尽管存在群体规模的行为多样性,但估计可预测性的上限约为93%。

此前的研究还揭示了日常移动结构中的强规律性。Schneider 等人(2013)表明,一小部分循环**移动模体**可以代表高达90%的工作日移动模式,而每日访问次数大致服从对数正态分布。最近,Schläpfer 等人(2021)探索了**旅行距离**和**访问频率**之间的联合关系,表明频繁的短途旅行和不频繁的长途旅行出现在不同的空间尺度(Alessandretti 等,2020),从社区到大都市区域,对疾病传播等过程具有重要影响(Heine 等,2023)。

**需求:** 人类移动受稳健的经验定律支配,而非任意的移动行为。因此,基于LLM驱动智能体的城市模拟器不仅应根据生成叙事的合理性进行评估,还应根据其再现这些已建立的移动模式的能力进行评估。

### 2.2. 行为与语义移动性  

除了受日常行为支配而表现出强烈规律性之外,人类移动还包括探索期,且不同个体之间差异显著。先前的工作提出了诸如**熵**、**规律性**、**平稳性**和**多样性**等指标来刻画这些差异(Teixeira 等,2019,2021b)。在这些度量的基础上,Amichi 等人(2020)识别出三种主要的**移动特征**:**探索者**(Scouters),频繁探索新地点;**常规者**(Routiners),主要重访熟悉场所;以及**普通者**(Regulars),表现出中间行为。这些行为区分对移动预测和模拟具有重要意义(Amichi 等,2021,2022;Esper 等,2024;Kouam 等,2023,2025)。

**需求:** 真实的模拟器应同时捕捉类似日常行为的移动定律和个体间异质的探索模式。

除了行为多样性,真实的城市模拟还必须捕捉移动决策背后的语义背景。虽然基于位置的社交网络(LBSN)数据集存在已知的人口统计和平台偏差(Wang 等,2021),但它们提供了有价值的语义信息,例如POI类别和活动转换,这些信息通常在传统移动数据集中缺失。最近的移动数据集和基于LLM的城市模拟器越来越多地通过活动类型、交通方式和时空活动分析来纳入这一语义维度(Chasse 等,2025;Wang 等,2024)。

**需求:** 基于LLM模拟器生成的语义丰富轨迹需要评估指标,这些指标应捕捉语义和时空动态,而不仅仅是空间统计。

### 2.3. 基于LLM的城市模拟器  

最近的基于LLM的城市模拟器旨在通过大规模生成式智能体来再现人类行为:  

- **AgentSociety**(Piao 等,2025):一个基于OpenStreetMap的开源框架,结合了LLM驱动的决策和心理学启发的行为模块——包括经济、认知、规划、移动和社交组件——用于城市轨迹生成。在详细框架审查以及我们对AgentSociety模拟器的增强(参见第3.1节)之后,我们设计了图1(第3.1节)来说明模拟流水线和模块交互。  
  在初始化时(图1),经济模块和需求模块为每个智能体分配人口统计、财务和行为属性,包括职业、收入、消费水平以及动态需求(如饥饿、精力、安全感和社交联系)。需求根据马斯洛需求层次(Maslow,1943)随时间演变,并影响后续规划决策。  
  日常行为通过规划模块生成,该模块使用基于计划行为理论(Ajzen,1991)指导的LLM调用。根据智能体当前状态(例如位置、时间、天气、情绪、职业和主要需求),模拟器首先选择高层次行为策略,然后生成一系列与特定执行模块关联的细粒度动作。  
  调度模块将每个动作路由到相应的模拟器组件。移动模块控制移动决策和目的地选择。对于每个移动步骤,LLM根据智能体当前计划和上下文状态选择一个POI类别、子类型和探索半径。然后使用基于距离衰减吸引力的密度感知重力模型对候选POI进行采样:  
  \( w_i = \frac{\rho_k}{d_i^2} \),其中 \(\rho_k\) 表示空间环 \(k\) 内的POI密度,\(d_i\) 是到候选POI \(i\) 的距离。选择概率通过对这些权重在候选集上进行归一化来计算。  

  这种移动选择机制是……

相似文章

CityBehavEx: 一个可扩展且经实证验证的LLM辅助城市仿真平台

arXiv cs.CL

CityBehavEx是一个可扩展的LLM辅助城市仿真平台,它结合了成熟的人类移动模型与微调后的交叉编码器,为城市规模的人口生成真实且经实证验证的移动模式。在单个消费级GPU上,不到一小时即可模拟100,000个智能体在75天内的行为。

通过语言模型的视角描绘城市

arXiv cs.CL

本文通过将匿名化的城市画像按40项指标进行评分,衡量了语言模型对“城市”所做的隐含假设,发现它们普遍偏好规模更大、增长更快、基础设施更完善的城市。研究使用开放权重检查点和可复现数据,使语言模型中城市默认画像的经验性追溯成为可能。

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。

当合成用户失效时:LLM模拟人类调查响应的跨领域基准测试

arXiv cs.CL

本文在两个大规模数据集上对LLM模拟的人类调查响应进行了基准测试,发现没有模型在个体层面上能超越简单的基线,并且模型系统性地过度决定人口统计特征,扭曲了群体差异。这些失败在不同模型规模和系列中持续存在,引发了对使用合成用户进行决策支持的担忧。