LLMs 是否了解你的社区?审计 LLM 先验用于社区级移动性预测与结构对齐

arXiv cs.LG 论文

摘要

本文评估了零样本大型语言模型在预测美国大都市区社区级移动模式方面的表现,将其与监督基线进行比较,并审计其与经验数据的结构对齐。

arXiv:2609.00345v1 Announce Type: new 摘要: 人类移动性是城市规划、交通、公共卫生和应急响应的核心,但细粒度轨迹数据通常是专有的、受限的和隐私敏感的。大型语言模型(LLMs)通过生成合理的移动轨迹和预测个人移动提供了一个潜在的替代方案,但其推断聚合社区级移动性的能力尚不清楚。我们使用匿名化的Cuebiq数据,评估了零样本LLMs在四个美国大都市区的普查区块组级移动性预测,构建了点级、轨迹级和时间移动性结果,并配以社会人口学和建成环境预测因子。我们将LLM预测与监督基线进行比较,并引入方向对齐分析来测试LLM隐含的预测因子效应是否与经验OLS和Jonckheere-Terpstra趋势一致。监督模型实现了0.580的平均准确率,而最佳LLM为0.435,其中空间范围结果显示出最强的可预测性,但也表现出最大的LLM-基线差距。方向分析表明,LLMs通常依赖于粗糙、稳定的预测因子级先验,这些先验在不同结果和城市中保持相似,包括对受保护群体预测因子的不对称处理。总体而言,LLMs可以从城市上下文中部分恢复聚合移动模式,但如果不审计经验对齐和潜在偏差,其预测不应被视为结构上可靠的。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:11

# 大语言模型是否了解你的街区?对LLM先验知识的审计:街区级出行预测与结构对齐
来源:https://arxiv.org/html/2609.00345
DOI:XXXXXXX\.XXXXXXX (https://doi.org/XXXXXXX.XXXXXXX)
会议:请确保输入您权利确认邮件中的正确会议标题;2018年6月3-5日;纽约州伍德斯托克
ISBN:978\-1\-4503\-XXXX\-X/2018/06
CCS:信息系统 时空系统
CCS:计算方法学 有监督学习
CCS:信息系统 数据挖掘,
Eesha Kurella
电子邮箱:[ekurella@umd\.edu](mailto:[email protected])
所属机构:马里兰大学,美国,
Arnav Dadarya
https://orcid.org/0000-0001-6036-076X
电子邮箱:[arnav1@terpmail\.umd\.edu](mailto:[email protected])
所属机构:马里兰大学,美国,
Naman Awasthi
https://orcid.org/0000-0001-6036-076X
电子邮箱:[nawasthi@terpmail\.umd\.edu](mailto:[email protected])
所属机构:马里兰大学,美国,
Kazi Tasnim Zinat
https://orcid.org/0000-0001-6036-076X
电子邮箱:[kzintas@terpmail\.umd\.edu](mailto:[email protected])
所属机构:马里兰大学,美国,
Vanessa Frias\-Martinez
https://orcid.org/0000-0001-5114-7633
电子邮箱:[vfrias@umd\.edu](mailto:[email protected])
所属机构:马里兰大学,美国
2018
###### 摘要
人类出行是城市规划、交通管理、公共卫生和应急响应的核心,然而建模出行行为所需的精细轨迹数据通常是专有、访问受限且涉及隐私敏感的,这促使人们寻找替代方案。近期研究表明,大语言模型(LLMs)提供了这样一种替代方案,它们能够生成合理的出行轨迹并预测个体移动。然而,关于LLMs能否推断跨街区的聚合出行模式(这些模式揭示的集体动态可直接用于公共卫生响应、交通建模和应急规划)却知之甚少。此外,除了推断能力,这些预测是否能捕捉到经验上有意义的背景-出行关系仍然是一个开放问题。我们通过评估零样本LLMs在美国四个大都市区进行人口普查街区组级别的出行预测来填补这一空白,使用匿名化的Cuebiq出行轨迹构建点级、轨迹级和时间维度的出行结果,并将其与社会人口学和建成环境预测因子配对。我们将LLM预测结果与有监督基线进行比较,并引入方向对齐分析,以检验LLM隐含的预测因子效应是否与经验OLS和Jonckheere–Terpstra趋势一致。结果显示,街区背景包含大量预测信号,有监督基线的平均准确率达到0.580,而最佳LLM为0.435;空间范围结果的可预测性最高,但LLM与基线的差距也最大。方向分析进一步表明,LLMs依赖于粗糙、稳定的预测因子层面的先验知识,这些先验知识在不同结果和城市间通常保持不变,包括对受保护群体预测因子的不对称处理。这些发现表明,LLMs能够部分地从城市背景中恢复聚合出行模式,但若不审计其经验对齐性和潜在偏差,则不应将其预测视为结构上可靠的。
###### 关键词:大语言模型,人类出行,街区级出行,城市计算,地理空间AI,方向对齐,出行预测,算法审计

## 1.引言
人类出行是城市生活的一个基本维度,反映了人们如何获取机会、使用基础设施以及在日常生活中体验城市(Barbosa等人, 2018 (https://arxiv.org/html/2609.00345#bib.bib3);Hägerstrand, 1970 (https://arxiv.org/html/2609.00345#bib.bib4);Yang等人, 2023 (https://arxiv.org/html/2609.00345#bib.bib9);Du等人, 2025 (https://arxiv.org/html/2609.00345#bib.bib5))。由于出行模式影响着就业和服务获取、疫情传播、环境负担以及更广泛的社会互动,出行数据已成为理解城市和指导城市政策的核心(Abrar等人, 2023 (https://arxiv.org/html/2609.00345#bib.bib38);Buckee等人, 2020 (https://arxiv.org/html/2609.00345#bib.bib8);Chang等人, 2021 (https://arxiv.org/html/2609.00345#bib.bib2);Yabe等人, 2025 (https://arxiv.org/html/2609.00345#bib.bib13);Xu等人, 2025 (https://arxiv.org/html/2609.00345#bib.bib6))。被动收集的数字痕迹,尤其是基于智能手机和手机的定位数据的日益普及,极大地扩展了这一潜力。与传统的出行调查(Bricka等人, 2024 (https://arxiv.org/html/2609.00345#bib.bib12))和其他粗糙数据源相比,此类数据提供了更精细的时空分辨率,通常能在更长时间内连续捕捉行为,且规模更大(González等人, 2024 (https://arxiv.org/html/2609.00345#bib.bib10);Garber等人, 2022 (https://arxiv.org/html/2609.00345#bib.bib11))。这使得研究人员能够以前所未有的细节刻画日常活动模式、出行范围、可达性和行为异质性,极大地丰富了城市科学和政策研究的经验工具包。然而,支撑这些分析的智能手机定位数据大多是专有的、访问受限的,并受到隐私限制,许多研究人员和公共机构难以获得,这就提出了一个问题:编码了广泛城市和人类行为知识的模型,能否在数据稀缺的情况下作为有用的替代品。
大语言模型(LLMs)是承担这一角色的天然候选者。LLMs在涵盖城市描述、人口普查和人口统计数据、交通研究以及城市日常生活的庞大语料库上进行训练,可能编码了支撑出行模式的那种背景知识。近期研究表明确实如此。先前工作已将LLMs用于诸如下一位置预测和零样本出行推断等任务,表明即使没有任务特定训练,LLMs有时也能充当出行预测器(Wang等人, 2023 (https://arxiv.org/html/2609.00345#bib.bib16);Beneduce等人, 2025 (https://arxiv.org/html/2609.00345#bib.bib14);Ma等人, 2025 (https://arxiv.org/html/2609.00345#bib.bib17))。其他研究则探讨了经过提示的LLMs是否能生成合成出行调查响应用于城市出行评估,仅凭背景知识就产生看似合理的日志式行为(Bhandari等人, 2024 (https://arxiv.org/html/2609.00345#bib.bib15))。更广泛地说,CityBench等基准测试在一系列城市任务上评估LLMs,显示虽然先进的模型在基于常识和语义理解的任务上具有竞争力,但在需要更强城市推理的任务上仍然不太可靠(Feng等人, 2025 (https://arxiv.org/html/2609.00345#bib.bib7))。然而,所有这些研究都共享一个共同的评估目标,即评估LLMs能否产生关于个体层面出行的合理输出,例如一个人的下一次出行、合成出行日志或单个设备的行为特征。这种个体层面的关注本身有价值,但它并未完全满足许多现实世界系统的预测需求,这些系统的关键量是聚合出行模式。交通机构、城市规划者、应急管理人员和公共卫生官员通常需要的是起止点流量、需求激增和人口重新分布模式的预测,而非个体轨迹(Zhao等人, 2024 (https://arxiv.org/html/2609.00345#bib.bib37);Rong等人, 2024 (https://arxiv.org/html/2609.00345#bib.bib36))。尽管一种可能的方法是模拟大量基于LLM的个体智能体并聚合其生成的轨迹,但这种策略可能计算成本高昂。我们转而研究LLMs能否直接从背景城市输入中推断聚合出行结果。这一框架将基于LLM的街区级出行预测定位为一个独特且尚未充分探索的问题,询问在个体出行任务上表现出色的模型是否也能从社会人口学和建成环境背景中恢复跨街区的集体出行模式。此外,即使LLMs能够恢复聚合的街区级结果,仅凭预测准确率也不能确定它们学到了构成不同地区出行结构的经验关系。看似合理的表现可能反而反映了浅层启发式方法、宽泛刻板印象(Manvi等人, 2024 (https://arxiv.org/html/2609.00345#bib.bib23);Moayeri等人, 2024 (https://arxiv.org/html/2609.00345#bib.bib24))或对训练期间所见模式的记忆(Hartmann等人, 2023 (https://arxiv.org/html/2609.00345#bib.bib35)),所有这些可能在平均意义上与结果对齐,但偏离了实际构成背景如何塑造出行的特定关系。因此,LLM预测是否能恢复经验数据揭示的街区背景与出行模式之间的结构关系仍是一个开放问题。
为了解决这些差距,我们通过以下方式评估LLMs是否编码了有用的先验知识:测试它们从城市背景推断街区级出行结果的能力,评估这些预测与经验背景-出行关系的结构对齐性,并考察这种对齐性是否在不同城市间成立。我们的分析基于美国大规模的真实出行轨迹数据,由Cuebiq提供,该数据来自近7000万移动设备的匿名位置信息,覆盖约20%的美国人口。我们将这些数据聚合到人口普查街区组(CBG)级别,并推导出行指标,以捕捉行为的三个互补维度:(i) 点级、(ii) 轨迹级和(iii) 时间级出行。给定建成环境和街区社会人口学特征作为输入,我们提出两个研究问题:
RQ1:在给定建成环境和社会人口学背景的情况下,LLMs能在多大程度上预测街区级出行结果?
RQ2:LLM预测与经验观察到的街区特征和出行行为之间的关系在多大程度上一致?
论文其余部分组织如下。第2节(https://arxiv.org/html/2609.00345#S2)回顾了关于LLMs在出行生成、预测和城市推理方面的先前工作,以及评估LLMs地理空间知识和偏差的近期努力。第3节(https://arxiv.org/html/2609.00345#S3)介绍了我们的问题表述、出行结果构建、零样本LLM预测框架、有监督基线和方向对齐方法。第4节(https://arxiv.org/html/2609.00345#S4)描述了数据集、研究区域、背景预测因子、模型设置,以及RQ1的预测性能结果和RQ2的方向对齐结果。最后,第5节(https://arxiv.org/html/2609.00345#S5)总结了主要发现,并讨论了它们对使用LLMs进行聚合城市出行推断的启示。

## 2.相关工作
### 2.1.LLMs在出行生成、预测和城市任务中的应用
越来越多的研究使用大语言模型(LLMs)来生成、预测和模拟出行及城市现象。在出行建模方面,多项研究调整LLMs以表示个体轨迹、活动链和出行行为。Ma等人(2025)(https://arxiv.org/html/2609.00345#bib.bib17)提出了一个用于通用人类出行模式的基础模型,融合跨领域数据并通过调查知识语义丰富GPS轨迹,在洛杉矶和埃及等地的活动推断和兴趣点分类任务中取得了稳健的性能。Wang等人(Wang等人, 2024 (https://arxiv.org/html/2609.00345#bib.bib19))介绍了LLMob,一个LLM智能体框架,通过从历史轨迹中提取模式并推理日常动机来生成个人出行轨迹,即使在疫情期间等异常时期也能产生逼真的移动序列。Shao等人(2024)(https://arxiv.org/html/2609.00345#bib.bib32)同样探索了利用LLMs进行人类出行生成的背景感知推理,强调语言模型能够解释移动段背后的意图,而不仅仅是模仿观察到的序列。(Li等人, 2024b (https://arxiv.org/html/2609.00345#bib.bib20))提出了Geo-Llama,一个在显式时空约束下生成出行轨迹的微调框架,表明LLMs可以产生连贯的合成移动,同时满足访问级别的要求。其他工作侧重于生成更丰富的行为记录,如出行日志和活动安排。Li等人(2024c)(https://arxiv.org/html/2609.00345#bib.bib18)开发了MobAgent,它构建了细粒度的用户画像,并使用递归推理生成与经验出行模式和路网约束一致的逼真出行日志。Bhandari等人(2024)(https://arxiv.org/html/2609.00345#bib.bib15)评估了LLMs能否生成类似于全美家庭出行调查(NHTS)的合成出行调查数据,发现微调模型能有效捕捉美国主要大都市区之间复杂的活动链和转移概率。Liu等人(Liu等人, 2025b)(https://arxiv.org/html/2609.00345#bib.bib34)提出了一个带有反馈循环的检索增强框架,用于在有限信息下生成每日活动链,表明该方法可以再现协调的家庭行为,如联合购物旅行或共享用餐时间。在此方向上,Liu等人(2025a)(https://arxiv.org/html/2609.00345#bib.bib33)研究了使用角色条件LLMs进行离散出行需求建模,表明行为特征和社会经济背景改善了对个体出行选择的模拟。一个相关的研究方向使用LLMs进行出行预测和推荐,而非完整的序列生成。Li等人(2024a)(https://arxiv.org/html/2609.00345#bib.bib26)提出了LLM4POI,一个基于签到数据微调LLMs的下一兴趣点推荐框架,并将其与关键查询相似性结合,以保留协同和上下文信息。Gong等人(2024)(https://arxiv.org/html/2609.00345#bib.bib21)引入了Mobility-LLM,一个使用行为提示和语义位置表示来改进下一位置预测、到达时间估计和用户关联预测的重编程框架。Chen等人(2025)(https://arxiv.org/html/2609.00345#bib.bib27)开发了QT-Mob,它引入了语义位置分词,将坐标编码为语义上有意义的离散标记,显著提升了下一位置预测和轨迹恢复。在城市尺度上,Li等人(2024d)(https://arxiv.org/html/2609.00345#bib.bib25)提出了UrbanGPT,它将时空编码与指令微调相结合,将城市相互依赖性与LLM推理对齐,在出租车流量、自行车流量和犯罪率等预测任务中展示了强大的零样本泛化能力。综上所述,这些文献表明LLMs可以作为合成出行生成、出行模拟、推荐和城市预测的灵活模型。这也表明这些模型编码了非平凡的出行相关信号。其中有少数面向聚合的例子:UrbanGPT的研究

相似文章

LLMs 何时真正有效?评估 LLMs 作为数据质量标注器

arXiv cs.CL

本研究评估了 LLMs 在电子商务任务中作为数据质量标注器的表现,发现当需要背景知识时,它们优于基线方法,但对于具有强烈词汇信号的任务优势有限,同时展示了跨运行的高度一致性。