公共服务因LLM撰写的福利申请而日益承压

Hacker News Top 论文

摘要

本文描述了由AI智能体(尤其是LLMs)造成的政府服务“智能体泛滥”现象,分析了服务在此类激增面前的暴露情况,并推荐了以平衡可及性和压力的缓解策略。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/24 16:50

# 描述政府服务的智能体洪水现象
来源:https://arxiv.org/html/2608.16603
###### 摘要
AI智能体正使公众更便捷地与政府互动,例如帮助申请福利、理解复杂政策以及表达意见。虽然提升服务可及性是有益的,但由此引发的需求激增可能对准备不足的政府服务造成压力。我们将这种需求激增称为政府服务的“智能体洪水”(简称“洪水”),并做出三项贡献。首先,基于收集的11个司法管辖区84个潜在洪水案例的数据集,我们认为当前洪水现象可能广泛存在,主要源于大型语言模型(LLM)低成本生成文本。其次,我们评估了哪些服务最易受到洪水冲击,开发了分析服务暴露程度的风险矩阵,并指出短期风险最高的是经济吸引力强但流程复杂的服务。最后,我们梳理了政府可能采取的应对措施。历史经验表明这些措施足以阻止大多数洪水案例,但部署最快的摩擦引入措施(如收费)往往会牺牲公共服务的公平可及性。因此,我们最后建议采取可能使政府缓解洪水而不引发这种权衡的短期行动。
数据集——https://github.com/CLSchmitz/flooding-dataset
预印本。本研究将发表于第九届AAAI人工智能、伦理与社会会议(AIES),2026年10月12-14日。

## 1引言
图1:12项政府服务的年提交量(2018-2025年)。其中,政府官员(红色)或权威二手来源(蓝色)均已指出AI参与了需求激增。仅部分激增始于2022年ChatGPT发布(虚线)。
表1:公民与政府互动时面临的“行政负担”类型(44 (https://arxiv.org/html/2608.16603#bib.bib2))、可能减轻负担的AI智能体能力,以及实现这些能力的技术。
AI智能体正日益帮助公众与政府互动。例如,它们已能为正式投诉生成法律上连贯的文本,或将复杂的政策文件解析为通俗语言。30 (https://arxiv.org/html/2608.16603#bib.bib3)对谷歌Gemini约1%的请求分类为协助政府互动。这些能力降低了公民的提交成本,使政府更易获取,这是理想的公共价值(43 (https://arxiv.org/html/2608.16603#bib.bib4))。然而,成本降低也可能导致请求复杂性或数量的激增。这种激增的证据正在显现:澳大利亚政府曾考虑对信息自由(FOI)请求重新收费,理由是涌现了大量AI生成的提交材料(9 (https://arxiv.org/html/2608.16603#bib.bib5));德国部分社会法院将2025年案件量同比增长55%主要归因于AI生成的索赔(38 (https://arxiv.org/html/2608.16603#bib.bib6));64 (https://arxiv.org/html/2608.16603#bib.bib7)发现自2022年以来,美国联邦法院自我代理案件的比例和平均长度均出现“急剧增长”,这很可能是由AI辅助公民自我代理所驱动。
关于此类激增的关键问题仍有待解答,特别是我们需要了解它们有多普遍、构成多大风险,以及政府能做什么。鉴于AI能力发展的迅猛步伐,显然迫切需要更深入的理解。本研究对政府服务的智能体洪水现象(或简称“洪水”)进行了结构化分析:即服务接收的请求数量或复杂性激增,这些激增(1)对其容量造成压力,且(2)因智能体降低了与此类服务互动的成本而得以实现(第2节 (https://arxiv.org/html/2608.16603#S2))。我们探讨三个问题:

##### 洪水是否正在发生——若发生,以何种形式?(第4节 (https://arxiv.org/html/2608.16603#S4))
我们编制了一个数据集(第3节 (https://arxiv.org/html/2608.16603#S3)),包含84个近期的服务需求激增案例,每个案例均被官员或权威二手来源归因于AI使用(图1 (https://arxiv.org/html/2608.16603#S1.F1))。数据与当前广泛发生的智能体洪水现象一致,尽管我们的研究方法无法对AI影响做出因果或定量论断。我们识别的几乎所有案例共享一种机制:LLM生成大量文本,配合人工处理其余流程。更复杂的智能体使用(如自主网站导航)尚未显现。

##### 风险有多大?(第5节 (https://arxiv.org/html/2608.16603#S5))
洪水风险取决于AI能力的进步与普及程度,并因国家和服务而异。通过分析数据,我们认为短期内风险最高的是经济吸引力强、但复杂的提交要求历来抑制需求的服务,如法院索赔和纳税申报。这些特性可在现有服务中评估,且随着AI能力新信息的出现,此类评估可更新。我们构建了一个风险矩阵,以指导对个别服务的更详细评估。

##### 政府如何应对?(第6节 (https://arxiv.org/html/2608.16603#S6))
我们梳理了政府响应选项,分为两大策略:抑制需求(如收费、速率限制、现场办理要求)和提升容量(如增配人员、部署AI、或重新设计服务界面)。历史经验表明两种方法均足以应对洪水,但需求抑制部署速度快得多。然而,它会降低政府服务的质量和可及性,并可能引入程序性不平等。主动准备或可帮助政府避免这种权衡。为此,我们推荐三项近期行动(第7.1节 (https://arxiv.org/html/2608.16603#S7.SS1)):审计服务脆弱性、在最高暴露服务中集成数字身份、以及澄清韧性构建措施的合法性。

## 2政府服务的智能体洪水
本节定义了政府服务的智能体洪水(第2.1节 (https://arxiv.org/html/2608.16603#S2.SS1))并分析了其潜在原因(第2.2节 (https://arxiv.org/html/2608.16603#S2.SS2))。

### 2.1定义
在本研究中,我们使用AI智能体(或“智能体”)指代具有一定自主性和工具访问权限的基于LLM的系统(33 (https://arxiv.org/html/2608.16603#bib.bib8))。我们的定义包括当前一代面向消费者的LLM,因为它们通常集成网络搜索等工具(62 (https://arxiv.org/html/2608.16603#bib.bib9))。我们刻意宽泛地使用政府服务一词,既指公共服务——如福利或基础设施——也指非服务性政府互动渠道,例如公众参与、司法程序或信息自由请求(51 (https://arxiv.org/html/2608.16603#bib.bib10))。我们将公众和用户互换使用,指代所有与政府服务互动的个人。

以此,我们定义智能体洪水。政府服务的智能体洪水指其接收的请求在数量或复杂性上出现激增,该激增(i)由AI智能体与此服务互动引起;且(ii)对该服务造成显著压力。我们区分两种洪水类型:请求数量增加(量化洪水)和每个请求复杂性增加(定性洪水)。例如,帮助用户发现符合条件服务的智能体可能增加请求量,而协助起草文本的智能体可能延长平均投诉信长度。一次洪水实例可能同时包含定性和量化成分。例如,LLM幻觉可能导致大量复杂但错误的申请。这两种效应——被4 (https://arxiv.org/html/2608.16603#bib.bib11)称为工作的“广延”和“集约”边际——都增加了处理负担。然而,某些潜在响应仅针对一种类型(第6节 (https://arxiv.org/html/2608.16603#S6))。例如,引入速率限制不太可能缓解定性洪水。

### 2.2洪水的潜在原因
AI智能体可能通过(1)降低与政府服务互动的成本或(2)增加此互动的收益来导致请求数量或复杂性的激增。因此,用户和中介组织(如律师事务所)都有动机部署智能体与政府服务互动。由此产生的需求增加可能对服务造成压力,因为许多服务仅设计处理有限的需求量。

##### 智能体能力可降低成本
AI智能体可减少行政负担:用户在与政府互动时为参与官僚程序所付出的成本(23 (https://arxiv.org/html/2608.16603#bib.bib12))。44 (https://arxiv.org/html/2608.16603#bib.bib2)将这些成本分为三类:学习成本、合规成本和心理成本。在表1 (https://arxiv.org/html/2608.16603#S1.T1)中,我们映射了智能体能力如何降低这三类成本。学习成本,即理解政府的认知努力,最直接地被智能体解析长文本和个性化沟通的能力所解决(34 (https://arxiv.org/html/2608.16603#bib.bib13))。合规成本,即完成必要步骤的实际努力,随着智能体高质量数字工作能力的提升而降低(13 (https://arxiv.org/html/2608.16603#bib.bib14))。心理成本,即重复官僚接触的情感损耗,随着智能体处理更多此类接触而下降。

减少行政负担通常会提高服务需求。例如,波士顿市引入市政服务请求应用程序导致报告增加33%(52 (https://arxiv.org/html/2608.16603#bib.bib15)),在线选民登记选项持续提高了登记人数(17 (https://arxiv.org/html/2608.16603#bib.bib16))。在概念层面,理性行为者模型提出,当预期收益超过提交成本时,用户会提交请求。(48 (https://arxiv.org/html/2608.16603#bib.bib17);76 (https://arxiv.org/html/2608.16603#bib.bib18))。个体用户很少在财务上最优地行动——其行为受许多其他因素影响,如心理摩擦或污名(11 (https://arxiv.org/html/2608.16603#bib.bib19);3 (https://arxiv.org/html/2608.16603#bib.bib20))。但理性行为者模型通常准确描述人群的总体行为(71 (https://arxiv.org/html/2608.16603#bib.bib21))。因此,我们预期当AI智能体降低提交成本时,请求会增加。

##### 智能体能力可增加收益
智能体能力也可增加与服务互动的收益。例如,智能体可重写信息请求(RFI)回复使其更具说服力,增加回复观点被政策采纳的可能性。AI智能体还可低成本帮助确保收集申请相关的所有信息,确保申请人获得最大福利。类似地,税务会计师帮助确保客户获得最大可能的退税。

##### 部署智能体能力的动机
除了用户层面的激励,还有强大的商业动机以增加政府服务需求的方式部署智能体能力。商业模式已成熟:中介组织代用户处理复杂政府互动,以换取获得权益的分成,从而增加向政府提出的索赔数量。最突出的例子是索赔管理公司,它们长期以来通过模板化提交大规模提交福利和赔偿索赔,如航班延误赔偿和英国人身伤害索赔。宣称使用AI达到类似效果的公司已存在(12 (https://arxiv.org/html/2608.16603#bib.bib22))。此外,对抗性行动者可能明确寻求淹没服务。例如,他们可能旨在破坏关键基础设施(57 (https://arxiv.org/html/2608.16603#bib.bib23)),或使机构瘫痪。即使是善意用户也可能被激励滥用系统。类似地,“恶意诉讼人”提交大量无价值的法庭索赔,每起索赔他们都依法有权提交,但总体会压垮法院(60 (https://arxiv.org/html/2608.16603#bib.bib24))。迄今为止,交易成本使此类案件罕见到足以临时管理;智能体能力可能使这些案件更频繁。

##### 需求增加可导致压力
政府服务需求增加本身并无害,但机构往往无法满足。许多服务因预算限制、运营低效或最小化开销的法律义务而接近运营容量运行(18 (https://arxiv.org/html/2608.16603#bib.bib25))。一些政府知晓并容忍,甚至刻意维持抑制使用的行政负担(56 (https://arxiv.org/html/2608.16603#bib.bib26))。容量压力可能带来直接运营后果——如积压增多或错过回复期限——以及更广泛的财政和政策影响,例如需要调整预算(第5节 (https://arxiv.org/html/2608.16603#S5))。总体而言,这些效应可能侵蚀用户对公共服务的体验,而体验是政府信任的强预测指标(70 (https://arxiv.org/html/2608.16603#bib.bib27);10 (https://arxiv.org/html/2608.16603#bib.bib28))。

## 3证据收集
为编制可能发生洪水的真实案例数据集,我们扫描了12个国家的政府服务(第3.1节 (https://arxiv.org/html/2608.16603#S3.SS1))。由于需求激增中AI的参与难以证明,我们仅包含政府官员或可靠第三方断言存在此类参与的案例(第3.2节 (https://arxiv.org/html/2608.16603#S3.SS2))。这支持了广泛扫描,但牺牲了统计代表性。为收集案例,我们采用LLM辅助的定性编码工作流程(第3.3节 (https://arxiv.org/html/2608.16603#S3.SS3))。

### 3.1范围
我们扫描了12个国家的政府服务公开信息:澳大利亚、巴西、丹麦、爱沙尼亚、法国、德国、日本、荷兰、新加坡、韩国、英国和美国。我们选择那些常见公开报告行政事务的国家,旨在地理和公共管理学术两大核心维度(行政传统(54 (https://arxiv.org/html/2608.16603#bib.bib29))和数字政府成熟度(50 (https://arxiv.org/html/2608.16603#bib.bib30)))上实现多样化。在每个国家,我们扫描相同的13个政府领域固定清单。我们通过合并三个已研究国家(英国、美国和法国)的面向公众的政府服务清单确定此清单。十个领域涵盖公共服务,如福利与社会保障、公民身份、或就业与养老金。三个领域涵盖非公共服务但可能发生洪水的政府流程:参与式流程;监管投诉与报告;以及透明度与信息获取。附录A (https://arxiv.org/html/2608.16603#A)

相似文章

现实世界中的LLM:评估紧急情况下的“AI”

arXiv cs.AI

本文探讨了基于LLM的机器翻译系统在文本到911紧急服务中的部署情况,指出了常见的误解,并为利益相关者提供了建议,以确保人工智能在关键场景中的安全有效使用。

基于LLM的服务反馈新兴主题检测模型

arXiv cs.AI

本文提出了一种新颖的方法论,整合了LLM、统计技术和人机协同,用于检测多语言服务反馈中的新兴主题,旨在提升公共部门组织的服务质量和公平性。

你的LLM不应该是你的编码智能体工作流

Reddit r/openclaw

主张在编码智能体工作流中,LLM应仅用于推理,而由确定性基础设施处理队列、状态、重试和恢复,这样即使达到使用限制,流程也不会中断。

你的LLM提示词有200行。你真的知道智能体遵从了多少吗?

Reddit r/AI_Agents

本文讨论了在生产环境中评估和监控基于LLM的智能体所面临的挑战,涵盖离线评估、提示工程陷阱、可观测性工具、审查队列、标注、聚类、主题分类,以及将人工审查、LLM作为评判和小型分类器进行成本分层的方法。