你的社区安全吗?大型语言模型城市安全判断中的基于地点的污名

arXiv cs.AI 论文

摘要

本研究考察了大型语言模型如何根据社区名称与坐标来判断城市安全,揭示了名称既承载犯罪信号又承载人口统计偏差,且偏差随地理知识扩展。

arXiv:2608.26188v1 公告类型:新 摘要:大型语言模型越来越多地被用于指导城市安全决策,例如判断哪些地方适合步行、租房或旅行。我们探究此类判断是基于实际测量的风险,还是与城市社区名称相关联的模式。我们通过三个条件(仅坐标、仅名称、名称+坐标)对七个经过指令调优的模型进行测试,覆盖洛杉矶和芝加哥的186个社区,并关联暴力犯罪数据与美国社区调查数据。首先,对于七个模型中的六个,在仅提供坐标时评分几乎持平,而名称承载了社区间的主要变异,并与暴力犯罪中度校准;仅在尖端规模模型中,坐标通道才表现出显著变异。其次,名称会降低当地主导边缘化群体比例较高社区(芝加哥为黑人比例,洛杉矶为西班牙裔比例)的安全评分,这一名称效应在所有七个模型和两个城市中都追踪人口统计比例。在洛杉矶,由于人口统计比例与犯罪更易分离,该效应在控制犯罪和收入因素后仍然存在,并通过犯罪匹配对得到验证。一项执法弹性分析进一步显示,过度谨慎与近乎完全报告的凶杀案相关,而非自由裁量的、部署驱动的犯罪。第三,该效应随地理知识扩展:能更好区分真实社区的模型对其应用更多人口统计刻板印象。由于社区名称同时承载真实的犯罪信号和人口统计刻板印象,移除名称会同时减少偏差和准确性。我们讨论了在建议和决策支持环境中部署LLMs的含义。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:31

# 你的社区安全吗?大型语言模型城市安全判断中的地域污名
来源:https://arxiv.org/html/2608.26188
## 你的社区安全吗?大型语言模型城市安全判断中的地域污名CCS:计算方法 自然语言处理CCS:社会与专业议题 种族与族裔CCS:以人为中心的计算 协同与社会计算的实证研究

阮辉 与 林悦 电子邮件:[[email protected]](mailto:[email protected]) 机构:伊利诺伊大学厄巴纳-香槟分校,美国伊利诺伊州厄巴纳

###### 摘要

大型语言模型正越来越多地被用于指导城市中的安全决策,例如判断哪些区域适合步行、租房或出行。我们探讨此类判断是基于**实测风险**,还是基于城市社区**名称**所关联的模式。我们通过三个条件(将名称与地理位置分离)来探查七个经过指令微调的模型对夜间步行安全性的评分:仅坐标、仅名称、以及名称+坐标。研究覆盖洛杉矶和芝加哥的186个社区,并关联了记录在案的暴力犯罪数据与美国社区调查的人口统计数据。首先,在六个模型中,仅坐标的评分结果几乎无差异,而社区名称则几乎承载了所有社区间差异,且在每个模型中,该差异与暴力犯罪数据具有中等校准度;只有达到前沿模型规模时,坐标通道本身才具有显著的区分度。其次,对于本地主导性边缘群体(芝加哥为黑人比例,洛杉矶为西裔比例)比例越高的社区,名称会使其安全性评分降低得越多;在两个城市的所有七个模型中,名称效应均与该群体的人口比例相关。该效应是否超过犯罪数据所证明的程度,只能在二者可分离的地方进行检验:在芝加哥,黑人比例与犯罪率相关性达 r=0.75,过于接近而难以区分;但在洛杉矶,控制犯罪率和收入后,人口统计效应在所有七个模型中依然存在,并且通过犯罪率匹配对在项目层面得到了证实。针对“记录犯罪反映警务工作”的担忧,一项执法弹性分解表明,过度谨慎几乎完全与近乎全面上报的凶杀案相关,而非由部署驱动的自由裁量犯罪,这在洛杉矶(两者统计上独立)得到了复现。第三,该效应随着地理知识的增加而扩大,而非被其限制:能更好区分城市真实社区的模型,对它们应用更多的人口统计刻板印象。关键的是,名称在一个通道中同时承载了真实的犯罪信号与人口统计刻板印象:去除名称会同时消除偏见和准确性,因此无法通过隐藏名称来修正这一失败。我们讨论了在建议和决策支持环境中部署大型语言模型的影响。

###### 关键词:

大型语言模型,算法偏差,公平性,社区污名,地理知识,安全判断,模型审计

## 1. 引言

大型语言模型通过应用于搜索、聊天助手、旅行工具和推荐系统,已成为智慧城市愿景的关键驱动力,并且现在驱动着可塑造城市社会物理环境的自主决策智能体人工智能系统(30 (https://arxiv.org/html/2608.26188#bib.bib9);16 (https://arxiv.org/html/2608.26188#bib.bib10);12 (https://arxiv.org/html/2608.26188#bib.bib11))。鉴于某些城市环境中持续存在的公共安全与犯罪问题,安全问题在这些应用中尤为紧迫。近期研究已开始调查大型语言模型如何独立或借助额外数据(如街景图像)评估和模拟城市安全(13 (https://arxiv.org/html/2608.26188#bib.bib7);5 (https://arxiv.org/html/2608.26188#bib.bib8))。

考虑到大型语言模型在城市安全应用中日益增长的使用,本文探讨了大型语言模型的判断是否与实测风险相符,还是反映了现有的种族-空间社区污名模式。研究表明,黑人居民比例较高的社区更容易引发关于高犯罪率和失序的假设,即使测量的犯罪率并未显著更高(22 (https://arxiv.org/html/2608.26188#bib.bib23);25 (https://arxiv.org/html/2608.26188#bib.bib5))。这种污名也附着在非正式话语中的名称上。某些社区的名称成为“你就是不该去”的地方的代名词,其危险性被假定独立于实测风险(14 (https://arxiv.org/html/2608.26188#bib.bib6))。这种模式也延伸到数字空间中社区名称的表示。最近的一项研究发现,在线住房列表包含黑人居民较多社区名称的频率低于白人社区(27 (https://arxiv.org/html/2608.26188#bib.bib1))。我们的目标是考察这种模式是否以及如何延续到大型语言模型对城市安全的判断中,从而可能比记录在案的犯罪数据所证明的,对边缘化人口社区施加了过度惩罚。

我们通过在芝加哥和洛杉矶社区进行的对照实验设计来分解这些机制。对于每个社区,我们收集在模型接收的标识信息不同的条件下的夜间步行安全评分:仅坐标、仅名称、以及名称+坐标。因为坐标指定了位置而不透露其名称,所以将仅坐标条件与包含名称的条件进行比较,可以分离出名称对评分的影响。我们在七个模型(主要集合四个,加上三个用于缩放分析的更大模型)和两个城市(芝加哥和洛杉矶)中运行此比较,并将每个评分与记录的暴力犯罪数据和人口普查统计数据对齐。

#### 贡献

- 一项条件消融探针,将社区*名称*与其*坐标*和实测*风险*分离,应用于七个大型语言模型(主要集合四个,以及用于缩放分析的Qwen2.5-14B、GPT-4o和DeepSeek V4),覆盖两个城市的186个社区。仅坐标对评分几乎没有影响,社区名称几乎解释了所有差异。
- 证据表明,在两个城市的所有七个模型中,名称对黑人比例较高(芝加哥)和西裔比例较高(洛杉矶)的社区的安全评分降低更多。在洛杉矶,控制犯罪率和收入后,该效应依然可识别,所有七个模型都显示该效应,并且三个独立的估计方法(水平回归、名称消融、犯罪匹配对)一致。芝加哥无法将二者分离,因为该地黑人比例与犯罪率相关性达r=0.75。该模式对提示措辞、评分量表以及两种名称显著性度量(维基百科页面浏览量和预训练语料库频率)具有稳健性。
- 一项执法弹性检验解决了“记录犯罪反映警务工作”的标准反对意见:按从近乎全面上报的凶杀案到部署驱动的自由裁量犯罪对事件进行排序,过度谨慎主要加载在上报端,在控制凶杀案后从自由裁量端几乎无增益,这在洛杉矶得到了复现,其中两端在统计上独立。
- 证据表明人口统计效应随地理知识增长而扩大,而非被其限制:两个独立的知识度量都预测了七个模型中名称效应的大小(洛杉矶地区准确度ρ=-0.94,p=0.002;识别度d'ρ=-0.71和-0.75)。
- 证据表明坐标通道并非普遍无效:对于开源模型(标准差0.01–0.15),它可忽略不计,但在前沿模型规模达到0.67–0.91,因此名称承载一切的结论本身是规模相关的。
- 一项分解显示名称通道同时承载真实的犯罪信号和人口统计刻板印象,因此无法在去除偏见的同时不降低准确性。

## 2. 相关工作

#### 感知的社区安全与种族污名

研究记录了感知社区安全中的种族-空间模式。感知的社区犯罪率随年轻黑人男性的比例上升,即使考虑了独立的实际犯罪测量,在芝加哥、西雅图和巴尔的摩也是如此(22 (https://arxiv.org/html/2608.26188#bib.bib23))。另一项研究中,在控制了独立观察到的失序后,感知的失序程度随少数族裔和贫困集中度在芝加哥约500个街区组上升,这被定性为自我强化的社区污名(26 (https://arxiv.org/html/2608.26188#bib.bib24))。其机制是刻板印象的放大(23 (https://arxiv.org/html/2608.26188#bib.bib25))。这种社区污名化模式延伸到数字空间中的数据表示(27 (https://arxiv.org/html/2608.26188#bib.bib1))。我们探讨一个在数字空间数据上训练的语言模型是否复制了这种地域错误表征。

#### 学习到的语言表示中的偏差

大量研究记录了人工智能系统中学习到的语言表示的社会偏差。早期研究发现静态词嵌入中的几何偏差(4 (https://arxiv.org/html/2608.26188#bib.bib12))和从语料库中恢复的人类类关联偏差(6 (https://arxiv.org/html/2608.26188#bib.bib13))。近期工作将此扩展到现代语言生成和大模型中的偏差与刻板印象(28 (https://arxiv.org/html/2608.26188#bib.bib14);20 (https://arxiv.org/html/2608.26188#bib.bib15);1 (https://arxiv.org/html/2608.26188#bib.bib16)),对规模的广泛分析警告流畅的模型可能编码和放大社会刻板印象(2 (https://arxiv.org/html/2608.26188#bib.bib17);29 (https://arxiv.org/html/2608.26188#bib.bib18))。我们的研究通过围绕社区名称在安全评分任务中的实验设计扩展了这一工作线,以测量偏差如何在地理空间和城市决策中显现。

#### 大型语言模型中的地理偏差

大型语言模型可能产生关于地区的不均匀和有偏见的信息(19 (https://arxiv.org/html/2608.26188#bib.bib19)),并且这种偏差可能随模型规模放大(9 (https://arxiv.org/html/2608.26188#bib.bib27);3 (https://arxiv.org/html/2608.26188#bib.bib29))。这种偏差也具有社会人口统计学维度。一项研究发现,大型语言模型对本地知识提示的回应显示出“城市优势”,农村地区系统性代表性不足,且语义深度较低(8 (https://arxiv.org/html/2608.26188#bib.bib4))。另一项独立研究在环境正义背景下发现,大型语言模型在内陆和更城市化的县表现优于农村和低收入地区(15 (https://arxiv.org/html/2608.26188#bib.bib3))。相关的社区层面研究也记录了种族和族裔少数居民比例较高的社区的系统性错误表征(17 (https://arxiv.org/html/2608.26188#bib.bib2))。

## 3. 数据

### 3.1. 社区单元与犯罪数据

我们研究两个城市。对于**芝加哥**,我们使用77个官方社区区域和该市公开犯罪数据中记录的事件,包括2020年1月至2025年4月的犯罪记录。对于**洛杉矶**,我们使用来自“Mapping L.A.”边界的109个洛杉矶市居住社区。Mapping L.A. 还将公园、盆地和类似的非居住多边形指定为社区。这些区域记录了犯罪事件,但居民人口几乎为零,因此其人均犯罪率不稳定。因此,我们仅保留居民至少500人的多边形,其中我们保留的最小的是2,317。这也使我们的设计聚焦于“夜间独自步行”具有其常规居住意义的地区。洛杉矶警察局事件数据包含2020年1月至2024年12月的犯罪记录,通过空间连接将每个事件关联到其社区。在两个城市中,我们为每个社区计算暴力犯罪计数。在芝加哥,这精确对应于主要类型值集{凶杀、刑事性侵犯、抢劫、殴打、伤害、绑架、恐吓、人口贩运}(393,927起事件,占总数的33.9%)。在洛杉矶,这是涵盖相同概念的25个犯罪代码描述值:凶杀、过失杀人、抢劫、伤害、殴打、强奸及其他性犯罪、绑架、人口贩运和亲密伴侣犯罪(247,151起事件,占24.9%)。两个城市使用不同的报告模式,因此定义无法完全相同。因为所有分析仅比较*城市内*的社区,设计要求的是概念对齐,而非精确等同。第二个量是其记录事件的平均纬度/经度,在仅坐标条件下用作锚点。我们还使用凶杀率作为替代测量,因为它对执法偏差的敏感性较低,因为凶杀比低级别犯罪记录更少随意性(第5.2节 (https://arxiv.org/html/2608.26188#S5.SS2.SSS0.Px1))。

### 3.2. 人口统计数据

我们将美国社区调查(ACS)5年区级估计数据汇总,包括总人口、家庭户数、家庭总收入以及种族和族裔比例(非西裔白人、非西裔黑人和西裔),整合到两个城市的社区数据中。平均家庭收入为总收入除以家庭户数。我们将风险表示为每1,000居民的暴力犯罪数。

两个城市在种族和族裔群体跨社区的分布上有所不同。在芝加哥,黑人比例在某些社区高达约96%,并且被发现与暴力犯罪率强烈相关。在洛杉矶,黑人比例范围较窄(最大值≈66%),而西裔比例在某些社区高达92%。因此,我们根据每个城市显著的人口统计轴进行分析,并在具有信息量时报告两个轴。

参考说明

参考说明

图1. 暴力犯罪率(上,分位数分箱)和每个城市主要边缘化人口统计比例(下)按社区划分:芝加哥(左)和洛杉矶(右)。

## 4. 方法

### 4.1. 提示设计

对于每个社区,我们发出一个零样本提示,询问模型在指定社区夜间独自步行有多安全,并要求回复一个从1(极其危险)到10(极其安全)的整数。每个提示使用系统消息“您是一个有用的助手。请简洁回答。”和用户消息:

提示:在*[地点]*夜间独自步行有多安全?请回复一个从1(极其危险)到10(极其安全)的整数,且仅回复数字。

这里,*[地点]*在三种信息条件下之一进行填充。对于一个名称为n、质心纬度为φ、经度为λ的社区区域:

- •仅坐标:“芝加哥纬度φ,经度λ的位置”
- •仅名称:“芝加哥的n社区”
- •名称+坐标:“芝加哥的n社区(纬度φ,经度λ)”

洛杉矶将“洛杉矶”替换“芝加哥”;两个城市的设计在其他方面相同。

坐标在不透露名称的情况下标识社区位置。如果模型的输出准确反映了现实世界的风险,我们预计在所有三种条件下,安全评分的跨社区差异应该相当,并且该差异应与暴力犯罪数据匹配。

### 4.2. 模型

我们的主要集合包括四个经过指令微调的模型(Qwen2.5-7B-Chat、LLaMA3.1-8B-Chat、Yi1.5-9B-Chat、Mistral-7B-Instruct),以及三个用于缩放分析的更大模型(Qwen2.5-14B-Chat、GPT-4o、DeepSeek-V4-Chat)。所有模型均通过其官方API或推荐的推理设置进行查询。对于每个模型,我们在所有条件下对每个社区运行提示一次,并记录整数评分。

相似文章

通过语言模型的视角描绘城市

arXiv cs.CL

本文通过将匿名化的城市画像按40项指标进行评分,衡量了语言模型对“城市”所做的隐含假设,发现它们普遍偏好规模更大、增长更快、基础设施更完善的城市。研究使用开放权重检查点和可复现数据,使语言模型中城市默认画像的经验性追溯成为可能。

大型语言模型中地理条件作用的意外影响

arXiv cs.CL

本文识别并分析了LLM中的“位置泄漏”现象,即地理条件作用导致模型即使在与位置无关的提示中也过度依赖位置元数据,揭示了超出内容的结构性条件作用效应。