谁在COVID-19后陷入财务脆弱?基于MEPS数据的人群层面机器学习分析
摘要
本研究利用MEPS数据和机器学习方法分析了COVID-19疫情前后财务脆弱性的模式,发现收入水平、保险状态和处方药支出是关键预测因素,且存在持续的不平等。
arXiv:2607.15446v1 公告类型:新
摘要:医疗费用在美国仍然是一个令人担忧的问题,并且可能受到COVID-19疫情相关干扰的影响。本研究利用2019年和2021年的医疗支出小组调查(MEPS)数据,考察了疫情前后医疗财务脆弱性的情况。高财务负担定义为自付医疗支出超过家庭收入的10%。进行了加权调查子组分析,以获得具有全国代表性的人口和社会经济群体估计值。
描述性分析辅以可解释的逻辑回归和机器学习模型。逻辑回归用于估计调整后的比值比,随机森林和梯度提升模型用于评估预测性能。时间泛化评估了在疫情前数据上训练的模型应用于疫情后观测时是否仍具有预测能力。
财务脆弱性与贫困状况、保险覆盖范围和处方药支出密切相关。亚组分析表明,不同人群之间存在持续的不平等,2021年有证据显示脆弱群体的负担有所增加。尽管存在这些差异,但在疫情前数据上训练的模型在疫情后数据上评估时,预测性能仅略有下降,表明医疗财务脆弱性的主要预测因素随时间保持相对稳定。
这些发现提供了COVID-19期间医疗财务脆弱性的人群层面评估,并展示了将可解释统计建模与机器学习相结合在人群健康研究中的价值。结果可能支持未来旨在减少医疗财务障碍的人群健康监测、风险分层和医疗政策研究。
查看缓存全文
缓存时间: 2026/07/20 09:27
# 新冠疫情后谁陷入了财务脆弱?基于MEPS数据的人群级机器学习分析 来源:https://arxiv.org/html/2607.15446 Alexey Kresin1,5,∗,Zien Cheng2,5,Ammar Ahad5,Ebiyomare Kelvin3,5,Manish Sivaratri4,5,Prabhjeet Singh5,6,Omar Aljawfi5,6,Olabisi Ojo7,5,Nawar Shara5,6 forkresin@gmail\.com \* 通讯作者 1美国马里兰州弗雷德里克市胡德学院 2美国华盛顿特区乔治城大学 3尼日利亚贝宁城贝宁大学 4印度奥里萨邦NIST大学计算机科学与工程系 5美国华盛顿特区AI CoLab:MedStar–乔治城人工智能医疗研究与教育合作中心 6美国华盛顿特区MedStar健康研究所 7美国佐治亚州奥尔巴尼州立大学自然科学系 ###### 摘要 与医疗相关的财务负担在美国一直是一个持续性的问题,并可能受到COVID-19大流行相关干扰的影响。本研究基于2019年和2021年医疗支出面板调查(MEPS)数据,分析了疫情前后的财务脆弱性模式。我们将高财务负担定义为自付医疗支出超过家庭收入的10%,并使用调查加权估计值按人口和社会经济群体比较差异,以实现全国代表性解读。 采用描述性子组分析与预测建模相结合,深入探究与财务脆弱性相关的因素。应用可解释的逻辑回归模型估算比值比。使用随机森林和梯度提升等机器学习方法评估预测性能。我们通过时间泛化实验评估学习关系的时序稳定性,即用疫情前数据训练模型,然后在疫情后观测数据上进行测试。 结果表明,财务脆弱性与收入水平、保险状况和处方药支出密切相关。子组分析显示,不同人群群体之间的差异持续存在,且有证据表明,在疫情后时期,先前脆弱人群的负担有所加重。然而,尽管如此,使用疫情前数据训练的模型在应用于疫情后数据时,性能差异不大,表明基本关系相对稳定。 总之,我们的研究提供了COVID-19期间医疗财务脆弱性的人群级图景,强调了不平等的持续存在以及预测关系的相对稳定性。这些结果可为未来的风险识别和决策支持工作提供参考,同时也凸显了脆弱人群的持续重要性。 ## 1 引言 医疗费用是美国公共卫生和政策领域的一大关切。即使对于有保险的个人而言,高昂的自付医疗费用也可能带来沉重的财务负担,因为过去二十年间,共付额、免赔额和共同保险等费用分摊要求显著增加,将医疗成本直接转嫁给患者[1 (https://arxiv.org/html/2607.15446#bib.bib1)]。这对低收入人群、慢性病患者以及医疗需求较高的人群(包括老年人、残疾人和需要专科护理或长期用药的患者)负担尤为沉重。先前研究发现,与医疗相关的财务压力可能导致延迟就医、用药依从性降低、医疗债务增加以及财务稳定性下降[3 (https://arxiv.org/html/2607.15446#bib.bib3),4 (https://arxiv.org/html/2607.15446#bib.bib4)]。这些问题在COVID-19疫情期间及之后变得尤为紧迫。疫情打乱了医疗服务、就业、保险的获取,也改变了全国的医疗使用模式。 COVID-19大流行扰乱了医疗体系和更广泛的经济,可能改变了财务脆弱性的模式[10 (https://arxiv.org/html/2607.15446#bib.bib10),11 (https://arxiv.org/html/2607.15446#bib.bib11),6 (https://arxiv.org/html/2607.15446#bib.bib6)]。疫情初期就业不稳定和医疗使用减少,以及现有的社会经济和人口差异,可能在疫情后时期进一步扩大。了解哪些人群仍然处于财务脆弱状态,以及预测关系是否发生了变化,对于公共卫生监测和未来的决策支持工作至关重要。 在本研究中,我们使用2019年和2021年(分别代表疫情前和疫情后时期)的医疗支出面板调查(MEPS)全年度合并文件,考察与医疗相关的财务脆弱性。我们将高财务负担定义为自付医疗支出超过家庭收入的10%,这是灾难性卫生支出和医疗可负担性研究中常用的阈值[3 (https://arxiv.org/html/2607.15446#bib.bib3),2 (https://arxiv.org/html/2607.15446#bib.bib2)]。分析采用重复横截面设计,结合了描述性子组分析和预测建模方法。子组分析使用调查加权估计值以支持全国代表性解读。 我们的建模框架包括可解释的逻辑回归模型,用于估算预测因子与财务负担之间的关联,同时采用随机森林和梯度提升等机器学习方法评估预测性能。为降低目标泄漏风险,模型中排除了直接用于构建结果变量的变量,包括总自付支出、家庭收入以及相关的负担度量指标。我们还进行了时间泛化实验,评估用疫情前数据训练的模型在应用于疫情后观测数据时是否保持预测性能。 本研究做出了几项贡献。首先,它使用具有全国代表性的MEPS数据,考察了COVID-19疫情前后的医疗财务脆弱性。其次,它使用调查加权估计值比较了不同人口、收入和保险子组之间的差异。第三,它通过跨时期泛化实验评估了预测关系的时序稳定性,以判断疫情前的模式在疫情后环境中是否仍然具有参考价值。 本研究并非旨在确定疫情的原因效应。相反,它侧重于识别模式、关联以及预测关系随时间的一致性。研究结果有助于当前关于医疗可负担性和财务脆弱性的讨论,并指出了预测分析在帮助识别财务风险增加人群方面的潜力。 ## 2 相关工作 研究人员广泛研究了美国医疗费用以及与医疗相关的财务压力,尤其是在低收入人群、无保险者和慢性病患者中。高昂的自付医疗费用可导致多种不利后果,包括延迟就医、用药依从性降低、医疗债务和财务稳定性下降[3 (https://arxiv.org/html/2607.15446#bib.bib3),4 (https://arxiv.org/html/2607.15446#bib.bib4)]。研究人员通常通过比较医疗支出与家庭收入来评估医疗财务负担,这有助于识别面临不成比例财务压力的群体[3 (https://arxiv.org/html/2607.15446#bib.bib3),5 (https://arxiv.org/html/2607.15446#bib.bib5)]。 COVID-19大流行扰乱了医疗体系和更广泛的经济,导致对医疗相关财务脆弱性的关注增加。以往研究调查了疫情期间医疗利用率、健康保险覆盖、就业不稳定性和医疗支出的变化[6 (https://arxiv.org/html/2607.15446#bib.bib6),7 (https://arxiv.org/html/2607.15446#bib.bib7)]。疫情初期条件与常规医疗利用率下降、就医延迟以及更大的经济不确定性相关[8 (https://arxiv.org/html/2607.15446#bib.bib8),9 (https://arxiv.org/html/2607.15446#bib.bib9)]。尽管大量研究考察了COVID-19相关的短期医疗和经济干扰,但医疗财务脆弱性模式是否持续到疫情后时期仍然是一个活跃的研究领域。 全国代表性的调查数据集,如医疗支出面板调查(MEPS)[12 (https://arxiv.org/html/2607.15446#bib.bib12),13 (https://arxiv.org/html/2607.15446#bib.bib13)],常用于研究美国的医疗支出、保险覆盖、医疗利用率和可负担性。MEPS对于基于人群的医疗财务负担分析尤其有用,因为它包含关于医疗支出、人口特征、保险覆盖、就业和社会经济因素的详细信息。先前使用MEPS数据的研究考察了不同收入群体、保险类别和慢性病患者群体之间医疗负担的差异[3 (https://arxiv.org/html/2607.15446#bib.bib3),16 (https://arxiv.org/html/2607.15446#bib.bib16)]。 与此同时,预测建模方法在公共卫生分析和卫生服务研究中变得越来越普遍。逻辑回归因其可解释性以及通过比值比估计预测因子与二元结果之间关联的能力而仍被广泛使用。近年来,随机森林和梯度提升等机器学习方法因其灵活性和捕捉变量间非线性关系及交互作用的能力,被应用于医疗预测任务。 尽管人们对预测性医疗分析的兴趣日益增长,但很少有研究考察重大社会干扰(如COVID-19大流行)下预测关系的时间稳定性。评估用疫情前数据训练的模型在疫情后环境中的预测性能,可为医疗财务脆弱性模式随时间的变化提供见解。 在本研究中,我们通过将具有全国代表性的子组分析与可解释的统计建模和机器学习方法相结合,扩展了之前的工作。此外,我们的研究明确评估了疫情前和疫情后时期之间的时间泛化能力,并排除了直接参与结果定义构建的变量,以降低目标泄漏风险。 ## 3 数据 ### 3.1 数据来源 我们的分析使用了2019年和2021年医疗支出面板调查(MEPS)全年度合并文件中的数据[14 (https://arxiv.org/html/2607.15446#bib.bib14),15 (https://arxiv.org/html/2607.15446#bib.bib15)]。MEPS是一项针对美国平民非机构化人口的全国代表性调查,提供关于医疗利用率、支出、保险覆盖、人口特征和社会经济状况的详细数据。2019年文件用于代表疫情前时期,而2021年文件用于代表疫情后时期。最终的长格式分析数据集包含两个研究年度共54,990个观测值,其中2019年27,682个,2021年27,308个。本文中,2021年作为相对于最初疫情冲击的2020年后比较期使用,同时认识到疫情相关干扰持续到2021年。 ### 3.2 研究设计 分析采用重复横截面设计。在2019年和2021年观测到的个体被视为独立的横截面样本,而非随时间追踪的相同个体。因此,本研究是对COVID-19疫情前后人群级模式的比较,而非对个体级纵向变化的估计。通过这种设计,我们可以调查两个时期内子组模式和预测关系是否相似或不同。 ### 3.3 结果定义 主要结果是医疗高财务负担。我们将高财务负担定义为自付医疗支出超过家庭收入的10%,这与医疗可负担性研究中常用的支出与收入阈值一致。该阈值旨在标示家庭医疗支出对其资源构成重大负担的情况。如果个体超过此阈值,结果变量编码为1,否则为0。 ### 3.4 特征集 预测因子包括MEPS全年度合并文件中可用的人口、社会经济、保险和健康变量。这些变量用于描述个体并估计与高财务负担的关联。例子包括年龄、性别、种族和民族、贫困状况、保险覆盖以及医疗需求或利用率指标。 为尽量降低目标泄漏风险,模型特征排除了直接用于构建结果的变量。此类变量包括总自付医疗支出、家庭收入、计算出的负担比率以及任何根据这些数量计算的其他负担相关变量。这种排除有助于确保预测模型无法直接访问定义目标变量的信息。 ### 3.5 变量选择与特征纳入 为提高透明度,我们根据变量在分析流程中的作用对其进行了分类。为便于透明度和可重复性,研究中考虑的所有变量根据其在分析流程中的作用分为四组:(1)用于定义结果的变量,(2)MEPS全年度合并文件中可用的候选预测变量,(3)纳入最终预测模型的变量,以及(4)仅用于加权描述性分析的调查设计变量。 候选预测变量基于领域知识、变量可用性及其在估计医疗财务脆弱性方面的潜在适用性进行先验选择。首先,该变量必须在2019年和2021年MEPS全年度合并文件中均可获得。其次,它需要代表那些在估计财务脆弱性时可能可用的人口、社会经济、保险相关、就业或医疗特征。第三,直接参与构建结果的变量被排除以防止目标泄漏。 表1 (https://arxiv.org/html/2607.15446#S3.T1) 总结了每个变量类别在分析框架中的作用。 表1:分析框架中使用的变量组。表2:考虑分析的变量及其在分析框架中的作用。变量描述作用理由AGE由AGE19X和AGE21X统一创建的年龄变量预测因子与医疗利用率和财务脆弱性相关的人口特征SEX性别预测因子基本人口特征RACEV1X种族/民族预测因子用于评估不同人群群体之间的差异POVCAT19 / POVCAT21贫困类别预测因子财务脆弱性的主要社会经济指标INSURC19 / INSURC21保险覆盖预测因子保险状况影响自付医疗费用RXEXP19 / RXEXP21处方药支出预测因子医疗需求和用药的替代指标
相似文章
面向阿尔茨海默病患者的药物感知金融剥削检测——基于边缘感知交互风险建模
本文提出了一种药物感知框架,将用药依从性数据与交易监控相结合,以检测阿尔茨海默病患者的认知风险金融事件,并在药物诱导的脆弱窗口期内显示召回率提升。
利用精简数据衡量贫困与不平等:一种基于尼日利亚住户数据的机器学习方法
本文应用随机森林递归特征消除(RF-RFE)对尼日利亚住户调查数据进行分析,旨在识别能够准确分类贫困状态、五分位分布和不平等位置的最小预测因子。研究表明,机器学习可以在减少数据需求的同时,保留用于监测贫困与不平等的分布信息。
类别不平衡约束下少数类财务困境预测的机器学习方法比较评估
本文对在严重类别不平衡条件下预测财务困境的经典方法、集成方法和神经网络方法进行了比较评估,使用SMOTE进行过采样,SHAP进行可解释性分析。
机器学习用于2型糖尿病风险预测的综合评估:大规模外部验证与公平性分析
本文构建了一个多维框架,用于评估基于机器学习的2型糖尿病风险预测模型的区分度、校准度、可解释性和算法公平性,揭示了在现实世界分布偏移下性能显著下降以及按年龄和肥胖程度存在的偏差。
从结构方程模型到双机器学习:基于调查研究的稳健性分析
本文开发了一个分阶段的稳健性分析框架,该框架将结构方程模型(SEM)、普通最小二乘法(OLS)和双机器学习(DML)连接起来,用于基于调查的潜变量研究,并通过金融科技数字客户亲密度调查模型进行了演示。该框架为研究人员提供了一个可重复使用的模板,用于评估不同估计方法下研究结果的稳定性。