使用微调LLM识别英国警方事件日志中的脆弱性指标

arXiv cs.CL 论文

摘要

本文探讨了使用微调LLM识别英国警方事件日志中的脆弱性指标(精神健康问题、物质滥用、酒精依赖、无家可归),发现虽然LLM能够产生有意义的患病率估计,但需要谨慎的方法学支持,并且不适用于个人层面的决策。

arXiv:2607.18446v1 公告类型: 新 摘要: 目的: 了解日常警务中有多大比例涉及弱势群体,可为资源配置、培训和跨机构响应提供信息,但行政数据提供的洞察有限。我们探讨是否可以将基于开源美国警方数据开发的基于LLM的分类流水线,应用于估计英国警方事件叙述中四个脆弱性指标(精神健康问题、物质滥用、酒精依赖和无家可归)的患病率,以及何时可以将输出视为合理的测量结果。 方法: 我们分析了来自英国某警察部队的近3000份去标识化事件日志,使用了一个多阶段流水线,结合了重复模型推理、标签聚合、结构化人工审核和统计校正。该流水线在本地托管的开放权重LLM上运行,反映了警察必须在安全环境中工作的情况。 结果: LLM能够大规模地产生有意义但并非完美的患病率估计。大约五分之一的案件中存在精神健康问题指标,其他指标的患病率较低。然而,天真的LLM部署是不可靠的:单次分类不稳定,聚合输出相对于人工判断系统性地过度分配指标。纠正这些偏差需要大量的人工输入和统计调整,留下了相当大的不确定性。 结论: 虽然LLM可以从非结构化的警务数据中提取信息,但如果没有谨慎的方法学支持,其输出不能被视为有效的测量。在人群层面,可以实现合理的估计,但资源密集;在个体层面,错误仍然频繁且不可预测,限制了其在操作决策中的适用性。本研究强调了基于LLM的测量在实际应用中的潜力和局限性。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:23

# 使用微调大语言模型识别英国警方事件记录中的脆弱性指标

**来源:** https://arxiv.org/html/2607.18446

Sam Relins^a,b^ https://orcid.org/0009-0001-7868-9835
Daniel Birks^a,b,\*^ https://orcid.org/0000-0003-3055-7398

^a^ESRC脆弱性与警务未来研究中心
^b^利兹大学法学院,利兹,英国

^\*^通讯作者:[email protected] (https://arxiv.org/html/2607.18446v1/mailto:[email protected])

###### 摘要

**目的。** 了解日常警务工作中有多大比例涉及脆弱人群,有助于指导资源配置、培训和多机构协同应对,然而行政数据提供的洞见有限。本文探讨了基于开源美国警务数据开发的大语言模型(LLM)分类流程,能否被改编用于估算英国警方事件叙述中四种脆弱性指标——精神健康不佳、药物滥用、酒精依赖和无家可归——的流行率,以及何时可将输出结果视为可靠的测量数据。

**方法。** 我们分析了来自英国某支警察部队的近3,000份去标识化事件记录,采用了包含重复模型推理、标签聚合、结构化人工审查和统计校正的多阶段流程。该流程在本地托管开源权重的大语言模型上运行,反映了警方可能使用的安全计算环境。我们的方法评估了输出稳定性,量化了偏差,并生成了带有不确定性的校正估计值。

**结果。** 大语言模型能够大规模生成有意义的、尽管不完美的流行率估计。精神健康不佳指标出现在大约五分之一的事件中,其他指标的流行率较低。然而,简单部署LLM并不可靠:单次分类结果不稳定,且聚合后的输出相对于人工判断系统性地高估了指标。纠正这些偏差需要大量的人工输入和统计调整,留下了相当大的不确定性。

**结论。** 尽管LLM能够从非结构化的警务数据中提取信息,但如果没有谨慎的方法论支持,其输出不能被视为有效的测量结果。在人口层面,可以实现可靠的估计,但需要大量资源;在个体层面,错误仍然频繁且不可预测,限制了其在操作决策中的适用性。本研究突显了基于LLM的测量的潜力与局限,强调了在应用环境中进行严格评估的必要性。

**关键词:** 大语言模型 · 非结构化数据 · 警务 · 脆弱性

## 1 引言

一线警务工作使警官经常接触经历复杂且相互重叠需求的人群。这类接触——通常被归入"脆弱性"这一术语之下——在英格兰和威尔士以及国际上的可比司法管辖区都有充分记录(Crawford,2024)。精神健康不佳、药物滥用、酒精依赖和无家可归在一线警官处理的案件中尤为突出,与这些接触相关的累积需求被广泛认为是巨大的,给警务资源带来了持续压力,并塑造了警察活动的模式。估计值各不相同——警官自身报告其40%至75%的工作涉及脆弱个体(伦敦警察厅与英格兰及威尔士警察局长协会警务委员会,2014),而结构化数据分析往往产生较低但仍显著的数值(Kane等,2021;脆弱性与警务未来研究中心,2025)。这促使了"正确关怀,正确人员"(Right Care, Right Person)等政策响应,其全国推广反映了官方对警务能力承受压力以及警察角色与所遇复杂需求之间不完全匹配的认可(内政部,2024;NHS联合会,2024;护理质量委员会,2025)。这也引发了关于健康及其他公共服务能力与协调的重要问题。

准确估计警务工作中与脆弱性相关的交互的流行率,对于指导一线资源配置和更广泛的战略政策响应至关重要。在部队层面,它有可能为资源配置决策、培训重点以及健康和社会关怀机构的伙伴关系设计提供信息。在政策层面,它可以支持关于警察角色适当边界、精神健康服务充足性以及在共享脆弱人群责任的服务间分配公共资金的有力、基于证据的辩论。目前,这些讨论的证据基础仍然非常薄弱。结构化行政数据——警察信息系统记录的资格标志、事件类别和处理代码——捕捉了部分情况,但它们本就是为了操作和行政目的而设计的,而非对脆弱性相关需求的流行病学评估。已知这些数据不完整、应用不一致,并受到各支队伍之间以及随时间变化的记录实践的影响(脆弱性与警务未来研究中心,2025;HMICFRS,2018)。因此,很难有把握地说警察在日常工作中遇到特定脆弱性的频率有多高。

而警察部队确实拥有大量的是叙述文本。事件记录、指挥控制记录和警官报告中包含的非结构化自由文本描述,通常比伴随它们的结构化字段丰富得多。这些叙述通常会描述所涉及个人的情况、行为和陈述的需求。然而,这些信息历史上难以大规模获取。对数千份事件叙述进行手动定性编码需要大量资源,而传统的自然语言处理方法虽然在警务背景下用于实体抽取和主题建模等任务时富有成效(Lukmanjaya et al., 2026),但缺乏进行脆弱性识别所需的解释性、上下文敏感的分类的灵活性。

大语言模型(LLM)的最新进展已显著改变了这一局面。经过指令微调的模型能够遵循自然语言任务描述,在上下文中评估模糊证据,并产生带有理由的分类——这些能力与定性研究中演绎编码的要求非常契合。已有越来越多的研究开始探索LLM在刑事司法领域的应用,从报告撰写辅助(Adams,2024)到犯罪分类(Alharbi and Alyami,2024),尽管对其分析能力的实证评估仍然有限。在之前的一项研究中(Relins et al., 2025),我们评估了经过指令微调的LLM能否复制波士顿警察局公开叙事报告中对脆弱性指标的人工定性编码,测试了多种模型和提示策略,并通过反事实分析评估了四种脆弱性类型——精神健康不佳、药物滥用、酒精依赖和无家可归——可能存在的统计偏见。该研究的主要发现表明,LLM在识别不存在脆弱性的叙述方面非常有效;作为可靠的阴性过滤器,同时也凸显了在阳性和模糊分类方面的显著局限性,以及持续人工监督的必要性。

本研究将这种方法从公开可用的美国数据扩展到由英国某支警察部队提供的安全操作数据。利用来自英国某支警察部队下属单一基本指挥单元(BCU)三个月的事件记录,我们探讨了在公开美国数据上开发的分类方法能否适应高度敏感警务数据的实践和伦理约束。我们进一步评估了经过人工验证和统计调整后产生的分类结果,能否生成当前结构化警务数据所无法提供的东西:即涉及脆弱性相关交互——特别是那些涉及精神健康不佳、药物滥用、酒精依赖和无家可归的交互——的流行率的稳健估计。

在下文中,我们将详细阐述所遇到的方法论挑战——模型在分类过程中的行为、当其行为偏离预期时所需的调整,以及为产生具有可接受置信度的估计而必需的统计校正。本研究既提供了一组新颖的流行率估计,也提供了一个关于在高风险应用环境中进行负责任的LLM测量的实际示范。前者为关于联合服务提供的日益增长证据基础做出了贡献;后者推动了循证实践与在应用警务背景下负责任地开发和部署大语言模型的整合。

## 2 方法

### 2.1 数据

我们从英国一支非都市警察部队获取了三个月的STORM事件记录——即由其计算机辅助调度系统生成的记录。STORM是英国警务中广泛使用的计算机辅助调度系统;事件记录由控制室操作员和出警警官在事件发展过程中实时创建和更新,记录通话性质、地点、涉及人员和采取的行动等细节。由于条目是在操作压力下实时输入的,记录通常是非结构化和特殊的——警官和操作员会发展出缩写惯例,条目的长度和完整性差异很大,同一事件可能积累来自不同贡献者的多个重叠更新。这些记录也经常包含个人信息:姓名、地址、电话号码以及提及第三方的内容作为常规事项嵌入自由文本字段中,这反映了该系统的操作目的,而非任何后续研究使用的预期。

分析的事件记录涉及英国某支非都市警察部队内的一个基本指挥单元(BCU),这是英国警队中最大的区域细分单位,覆盖三个月时间,总计近3,000份单独记录。此处未指明具体部队,且BCU和时间段未向研究团队披露;只知道数据来自一个包含城市和农村地区的BCU,并在2022年至2025年之间的某个时间点提取,因此不会直接受到疫情相关限制的影响。

为防止记录内部的信息泄露,数据在部队内部使用了白名单方法进行匿名化处理。部队分析师获得了一个专门构建的工具,该工具生成了语料库中所有单词的词汇表;研究人员在现场手动验证了最常出现的术语,确认它们不构成个人标识符。这个经过批准的白名单随后被用于过滤所有记录,任何未出现在白名单上的词在传输前均被编辑掉。在语料库的1,181,029个单词标记中,有81,098个(6.9%)在传输前被编辑,保留了1,099,931个(93.1%)。处理后的数据随后被存储和处理在大学的安全研究环境中。

在分类之前,对原始记录进行了清理,移除了没有叙述价值的条目,包括系统生成的消息、处置记录和自动标签。属于同一事件的单独记录条目根据唯一事件ID拼接成一个单一的叙述。如果拼接后的叙述超过400个单词,则将其分割成更小的块进行分类。这个阈值是根据安全研究环境的操作限制确定的:因为这种敏感度的数据无法使用外部API或基于云的基础设施处理,分类是在一个具有相对有限上下文窗口的本地托管模型上进行的。400字的限制在该窗口内提供了一个保守的余量,可容纳事件叙述和分类提示而不会有截断风险。块是在自然断点处创建的——按优先顺序为段落边界、句子结尾和从句边界——以保持叙述的连贯性,并避免在可能为模型掩盖含义的地方分割文本。如果一个事件被分成多个块,则每个块独立分类;将块级分类聚合为单一事件级结果的过程将在下文描述。这些预处理步骤最终生成了来自2,977份事件记录的3,850个文本段落的语料库。

### 2.2 两步分类

我们采用了两步分类方法,改编自我们之前对波士顿警察局FIO报告进行分类的工作(Relins et al., 2025)。该研究确立了支持此设计的两个发现:(i)LLM作为阴性分类器表现强劲——可靠地识别出哪里没有给定脆弱性的证据,并且(ii)大多数事件不包含脆弱性指标的迹象。因此,一个初步的筛选步骤可以识别出有把握被归类为阴性的事件记录,只有通过这些阈值的事件才继续进行实质性分类。该方法针对四种脆弱性类型分别应用:精神健康不佳、药物滥用、酒精依赖和无家可归。下面展示的提示以精神健康不佳为例,遵循了其最直接形式的两步结构。

在第一步中,模型被呈现一个事件叙述,并要求其从文本中高亮出可能指示相关脆弱性的任何引用。为了优化这个过程,提示明确限制模型最多提取两条引用。在初步实验中,我们观察到没有此限制时,模型倾向于冗长,使用过多的标记来突出边缘或虚假的证据——这对于本地托管模型的有限上下文窗口来说是一个特别令人担忧的问题。将提取限制为两条引用有效地遏制了这一点,在提高计算效率的同时保持了相同水平的后续分类准确性。如果未找到任何指标,模型会回复"EVIDENCE: NONE",分类过程结束。这大大减少了大多数不存在证据的情况的处理量。

系统:*你是一名助手,负责识别事件报告中可能表明当前精神健康不佳或有精神健康不佳史的陈述。请仔细遵循指示。*

用户:*请审阅以下事件报告:**

**\{报告内容\}**

**如果报告中有人正在经历心理健康问题的任何迹象,请从文本中高亮出相关引用,其中*

相似文章

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。