Neetyabhas:一种面向理性主体模型的不确定性感知公共政策优化框架

arXiv cs.AI 论文

摘要

Neetyabhas 是一个利用层次化强化学习主体在基于主体的流行病仿真中实现不确定性感知公共政策优化的框架。该框架对个体行为(佩戴口罩、接种疫苗、外出购物)及不确定条件下的决策者干预进行建模,并展示了其在 COVID-19 疫情管理中的有效性。

arXiv:2606.04562v1 公告类型:新论文 摘要:目的 WHO 针对 COVID-19 提出的非药物干预措施(如封锁、接种疫苗)能够有效遏制病毒传播,但也带来了沉重的经济负担。现有研究往往忽视个体行为,并错误地假设感染追踪完全准确、政策执行毫无偏差,未能充分考虑现实世界中的不确定性与误差。方法 我们提出一种综合性方法,将流行病测量(感染人数/住院人数)与政策执行两个层面的不确定性纳入建模范围。我们构建了一个包含 1,000 名个体的仿真模型,这些个体会实时做出佩戴口罩、接种疫苗和外出购物等决策。与此同时,决策者根据健康与经济状况的观测数据部署干预措施(封锁、强制令)。该框架由层次化强化学习主体驱动,综合运用深度 Q 网络(DQN)以及具备不确定性感知能力的策略梯度变体(DDPG 和 TD3)。结果 仿真实验有效控制了疫情的发展态势。佩戴口罩和接种疫苗被证明具有显著效果,大幅降低了疫情峰值高度并缩短了持续时间。通过整合个体行为、政策不确定性与多元干预手段,我们的动态控制方法成功减轻了疫情的影响。结论 我们的模型通过将不确定性与人类行为嵌入公共卫生政策框架,克服了以往研究的局限性。仿真结果表明,在应对复杂疫情时,充分考虑个体选择与不完善数据对于设计有效干预措施至关重要,而口罩和疫苗则是其中不可或缺的关键工具。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:08

# Neetyabhas:基于理性智能体模型的不确定性感知公共政策优化框架

来源:https://arxiv.org/html/2606.04562

###### 摘要

**目的:** 为应对 COVID-19 大流行,世界卫生组织(WHO)批准了一项包含 18 条非药物干预措施的方案,涵盖封锁、快速疫苗接种和公共交通关闭等多种措施。尽管这些干预措施在遏制病毒传播和制定公共卫生政策方面已证明有效,但也带来了显著的不利后果,尤其是封锁措施造成的经济压力。现有研究在设计平衡的多维度政策框架时,往往忽视个体偏好与行为。此外,主流研究倾向于假设感染数据测量精确且政策执行完美,忽视了不确定性和误差的重要作用。

**方法:** 为应对上述挑战,我们提出了一种综合方法,将流行病状态(感染和住院)测量以及政策指令执行过程中的不确定性纳入考量。作为概念验证,我们构建了一个包含 1000 名个体的小型社区仿真模型。这些个体在疫情演进过程中实时做出口罩佩戴、疫苗接种和购物行为等决策。决策者可根据对感染情况、住院数量和经济指标的观测,部署封锁、免疫控制和口罩强制令等干预措施。该方法采用层次化强化学习智能体,结合深度 Q 网络,并扩展了不确定性感知的深度确定性策略梯度变体(DDPG 和 TD3),以指导个体决策和决策者选择。

**结果:** 我们的仿真模型有效展示了管控疫情进程的能力。其中,口罩佩戴和疫苗接种的推广被证明是特别有前景的策略,能有效降低疫情峰值高度并缩短疫情持续时间。通过纳入个体行为、政策不确定性和多维度干预措施,我们的方法成功实现了对疫情影响的动态控制。

**结论:** 总体而言,我们的综合方法通过在多维度政策框架中考量不确定性和个体行为,弥补了现有研究的不足。通过仿真实验,我们验证了该方法在控制 COVID-19 疫情方面的有效性。口罩佩戴和疫苗接种是降低疫情严重程度的关键措施。本研究强调了在应对复杂大流行病时,将不确定性和个体决策纳入有效公共卫生干预方案设计的重要性。

###### 关键词:公共政策优化、模型可信度与可靠性、基于智能体的仿真、理性智能体、强化学习、疫情仿真

## 1 引言

COVID-19 大流行在全球范围内造成了毁灭性影响,截至 2022 年 10 月,已记录超过 4.6 亿例感染和 600 万例死亡Wu(2022)。此外,大流行仅在 2020 年就导致全球 GDP 下降约 3%Wu(2022)。为遏制感染传播并减轻其影响,世界卫生组织(WHO)制定了一项包含 18 条非药物干预(NPI)措施的方案Yang et al.(2022),涵盖封锁、快速疫苗接种计划、公共交通关闭和经济刺激措施Perra(2021)。虽然这些干预措施在控制疫情方面已被证明有效,但其中一些措施,如长期封锁和公共交通关闭,也带来了不利影响,如加剧经济不平等以及因过度拥挤导致的健康状况恶化Bavli et al.(2020)。

各国政府面临着确定最优干预水平的挑战,这涉及众多地域特异性和文化特异性变量与因素。为应对这一复杂的决策过程,仿真已成为重要工具,帮助政府和决策者利用这些仿真做出明智选择Venkatramanan et al.(2018)。然而,优化干预措施以控制疫情需要考量多重因素。近年来,通过仿真进行疫情优化的人工智能和机器学习研究已相当丰富Payedimarri et al.(2021);Brodeur et al.(2021);Yang et al.(2022);Weltz et al.(2022);Puron-Cid et al.(2016);van Veenstra and Kotterink(2017);Wan(2022);Yang et al.(2022),采用的技术包括动态规划Weltz et al.(2022)、v-learning Luckett et al.(2019)、Q-learning(深度和表格形式)Khadilkar et al.(2020);Kwak et al.(2021);Song et al.(2020);Khadilkar et al.(2020);Ohi et al.(2020);Colas et al.(2021);Bampa et al.(2022),以及贪心算法Minutoli et al.(2020)。当优化选择数量较大时,这些技术的扩展性较差。深度确定性策略梯度(DDPG)Chadi and Mousannif(2022)、Twin Delayed DDPG(TD3)Chadi and Mousannif(2022)和近端策略优化(PPO)Chadi and Mousannif(2022)等强化学习技术已被用于应对大规模优化挑战。然而,这些方法往往忽视推荐行动和疫情传播测量中的不确定性,也未考虑理性智能体个人决策对政策制定的混杂影响。此外,目前缺乏比较不同模型可靠性或可信度的正式量化指标。

本研究引入一个包含两级决策的疫情模型:个体层面和公共政策层面。针对个体决策,采用基于深度 Q 网络(DQN)的决策器。在公共政策层面,提出了一种新颖的不确定性感知连续强化学习模型,由不确定性感知 DDPG 和 Twin Delayed DDPG 组成。为评估和比较这些算法,本研究扩展并采用了疫情优化中的可靠性Chan et al.(2020)和可信度Sequeira and Gervasio(2020)指标。为促进该领域的进一步研究,作者计划将本研究使用的代码、仿真模型、优化方法和超参数作为开源资源发布,以便未来研究在可扩展性、多目标考量和仿真模型完善等方面得到提升。

## 2 相关工作

多年来,随着模型日趋逼真、采用率不断提升,利用建模与仿真发现最优政策的应用已显著增长。基于智能体的模型(ABM)能够有效捕捉现实世界个体交互中固有的种群异质性、关系结构和随机性DeAngelis and Diaz(2019)。研究人员已采用 ABM 模拟疾病传播动态Kerr et al.(2021),考量年龄分层种群、多疫苗接种场景以及口罩佩戴和购物习惯等行为反应等多种因素Gnanvi et al.(2021)。这些模型的优势在于可适应特定情境,能够研究局部疫情、定制化干预措施和政策发现。然而,将自动化政策发现工具广泛应用于 ABM 的重大挑战在于存在多个相互冲突的优化标准以及大量需要优化的地域特异性因素。

目前已有多种公共政策发现方法被提出,各有优势与局限。在行动空间为离散型的情形下,多种基于 Q-learning 的强化学习技术已被用于政策发现Payedimarri et al.(2021);Brodeur et al.(2021);Yang et al.(2022);Weltz et al.(2022);Luckett et al.(2019);Khadilkar et al.(2020);Kwak et al.(2021);Song et al.(2020);Khadilkar et al.(2020);Ohi et al.(2020);Colas et al.(2021);Bampa et al.(2022)。这些研究在干预措施数量有限时非常实用,例如口罩类型选择、是否购物的是/否决策、是否外出的决策等。然而,这在现实公共卫生场景中构成重大局限,因为现实中存在连续性因素,如所需疫苗接种数量和封锁持续时间Lillicrap et al.(2015)。

为向连续空间迈进,部分基于 Q-learning 的工作已通过以下技术得到扩展:不安分老虎机Mate et al.(2021)、软 Actor-Critic Kompella et al.(2020)、协作强化学习Bednarski et al.(2021)、基于循环神经网络的强化学习Ge et al.(2020)以及上下文老虎机Awasthi et al.(2022)。尽管这些研究在一定程度上缓解了离散行动空间的局限,但在仿真目标(如疫苗接种、封锁、经济)、规模(数千名个体)或所用方程式模型不适于干预研究等方面仍存在问题。

近期的重要贡献包括用于连续行动空间的连续强化学习框架,如深度确定性策略梯度(DDPG)、Twin Delayed DDPG 和近端策略优化(PPO)Chadi and Mousannif(2022);Schulman et al.(2017)。虽然这些研究解决了离散和连续行动空间的问题,但未纳入层次化决策机制。例如,决策者在制定公共政策以缓解大流行病的深远影响的同时,个体也在做出局部决策,以在遵守公共政策的前提下最有效地应对疫情和经济压力。Dong *et al.* Dong et al.(2020)的研究采用层次化强化学习框架模拟个体和家庭决策,纳入了不同层次的局部选择,但未考虑公共卫生决策者在决策中的角色。Zheng *et al.* 开发了一个经济学多层次模型,控制同样在局部和区域层面进行。所有这些研究的共同缺陷在于,均假设所有观测数据和决策执行均准确无误,未考虑任何不确定性。

不确定性是政策制定的固有属性,源于不可预测事件、数据局限性以及人类行为的多样性。偶然不确定性涉及流行病过程和输入参数中固有的随机性,而认知不确定性则源于状态测量、模型结构及参数估计。传统的政策优化方法通常忽视这些不确定性,导致决策次优或政策失败。近期研究已开始着手解决这些问题,引入了随机优化和稳健决策等不确定性处理技术。然而,在同时考量偶然不确定性和认知不确定性方面仍存在差距,而这将有助于提升政策建议的可靠性和适应性。

公共卫生领域中讨论决策不确定性的研究为数甚少,其中近 70% 为影像学研究,采用 Monte Carlo dropout 来缓解和量化不确定性Loftus et al.(2022)。其他技术,如基于分布的 Q-learning Browning et al.(2021)、确定行动和状态分布Nanayakkara et al.(2022)、用于不确定性量化的不确定性分解Festor et al.(2021),以及基于变分长短期记忆(LSTM)的接触网络在信息不完整条件下近似疫情传播Feng et al.(2022),已被提出用于不确定性条件下的医疗决策。然而,这些技术大多用于已知不确定性分布或不确定性量化的场景。

Tessler *et al.* 最近的研究Tessler et al.(2019)发展了能够处理不确定行动的基础理论和强化学习技术。该研究未展示实际应用,且仅考虑了偶然不确定性(由测量误差引起的不确定性),未涉及认知不确定性(由数据不足和不确定导致的状态测量和模型权重的不确定性)。虽然 Tessler *et al.* 处理的偶然不确定性可以应对不确定行动,但认知不确定性可以同时处理状态和行动的不确定性。在本研究中,我们采用并扩展了 Tessler *et al.* 所展示的技术,以适应流行病学领域中两类不确定性并存的情形。在建立这些技术之后,衡量政策决策的有效性和可信度对于确保有效实施至关重要。

相似文章

噪声感知下智能体的风险感知决策策略

arXiv cs.LG

本文提出了一个在噪声感知下觅食的人工生命捕食者-猎物模型,表明与盲目信任感知标签相比,不确定性感知决策策略能显著提高生存率,并且随着不确定性增加,智能体会从探索性策略转向保守性策略。

基于智能体建模中的LLM驱动推理

arXiv cs.AI

本文介绍了一种可扩展的混合智能体与语言驱动的疫情建模框架HALE,该框架利用大语言模型预测基于智能体模拟中的人类决策,并在盐湖县的新冠病毒传播建模中展示了更高的准确性。

策略感知模拟器学习的理论基础与高效算法

arXiv cs.LG

本文提出了一种用于基于模型的强化学习中模拟器学习的策略鲁棒性目标,将其建模为模型玩家与对抗性策略玩家之间的极小极大博弈。提供了理论保证和可证明收敛的算法,实验表明预测误差在关键区域降低1.5-2.2倍,并提升了策略从模拟到真实世界的迁移效果。

基于非确定性因果模型的鲁棒反事实策略优化

arXiv cs.LG

本文形式化了在概率非确定性因果模型下马尔可夫决策过程的反事实策略优化,该模型将潜在混杂因素与固有随机性分开,并提出了一种实用的优化程序来推导鲁棒的反事实策略。该方法在脓毒症治疗模拟器上得到验证,其中糖尿病状态作为未观测的全局混杂因素。