可解释机器学习在宽带采用差异中的应用:基于人口普查区级别的预测和SHAP因素分析

arXiv cs.LG 论文

摘要

本文提出一个可解释的机器学习框架,利用SHAP分析来预测和分析美国人口普查区级别的宽带采用差异,识别收入和教育等关键因素以指导政策目标。

arXiv:2608.29110v1 Announce Type: new 摘要:美国通过基础设施投资和就业法案拨款约650亿美元用于宽带扩展,但针对这些投资的证据基础方法仍不完善。本文提出一个可解释的机器学习框架,用于分析全国83,359个人口普查区的宽带采用差异。使用来自2022年美国社区调查的65个社会经济、人口和基础设施特征,我们在空间五折交叉验证下训练LightGBM模型,达到R^2 = 0.533和Spearman rho = 0.763;在51折的州外交叉验证中确认泛化能力(R^2 = 0.525)。TreeSHAP分析识别出收入和教育作为主导因素组(其中工程化的交互项吸收了其组成特征的归因),基于SHAP的聚类揭示了三个探索性因素概况:连接良好的中等水平(约4.9万个区域)、可负担性受限的严重水平(约2.1万个区域)和农村老年型(约1.3万个区域)。作为筛选工具,基于机器学习的区域选择在前10%的区域内捕获了38.0%的总采用差距,而仅基于收入的启发式方法捕获35.2%(提高2.8个百分点,p < 0.002,县块引导法);在遗憾减少方面,模型缩小了仅收入与最优选择之间剩余差距的19%。主要贡献是每个区域的因素分解:SHAP识别出哪些特征组(收入/教育、农村性、年龄)与每个区域的预测差距最密切相关,并支持差异化调查。时间稳定性检查在2017年ACS上训练并预测2022年ACS,调查年份无重叠,确认了排名稳定性(rho = 0.784,注意超参数在2022年数据上调整)。
查看原文
查看缓存全文

缓存时间: 2026/09/01 13:08

# 面向宽带采用差异的可解释机器学习:人口普查区级预测与SHAP因子剖析
来源:https://arxiv.org/html/2608.29110

###### 摘要

美国通过《基础设施投资和就业法案》拨款约650亿美元用于宽带扩展,但针对这些投资的循证方法仍不完善。本文提出一个可解释机器学习框架,用于在全国83,359个人口普查区粒度上分析宽带采用差异。利用来自2022年美国社区调查的65项社会经济、人口和基础设施特征,我们在空间五折交叉验证下训练了一个LightGBM模型,达到R²=0.533和Spearman ρ=0.763;州留出交叉验证(51折)确认了泛化能力(R²=0.525)。TreeSHAP分析显示收入和教育是主要因素组(经构造的交互项吸收了其组成特征的归因),而基于SHAP的聚类揭示了三种探索性因子剖面:中等连接型(约49,000个区)、严重负担受限型(约21,000个区)和农村-老年型(约13,000个区)。作为筛选工具,基于机器学习的区选择在前10%的区域内捕获了38.0%的总采用差距,而仅基于收入的启发式方法为35.2%(+2.8个百分点,p<0.002,县块自举);就遗憾减少而言,该模型弥补了仅收入选择与神谕选择之间剩余差距的19%。主要贡献是逐区因子分解:SHAP识别出哪些特征组(收入/教育、农村性、年龄)与每个区的预测差距关联最强,并为差异化调查提供依据。时间稳定性检查在ACS 2017上训练、在ACS 2022上预测(调查年份零重叠)确认了排序稳定性(ρ=0.784,注:超参数基于2022数据调整)。

###### 索引术语:

宽带采用、数字鸿沟、可解释机器学习、SHAP、LightGBM、政策定向、人口普查区、空间交叉验证

## I 引言

数字鸿沟,即能够有效使用数字技术的人与不能的人之间的差距,仍然是美国最持久的公平挑战之一。尽管数十年来政策关注度不断提高,但仍有约2400万美国人无法接入宽带互联网,另有数千万生活在名义上有宽带可用地区的人因负担能力、数字素养或相关性障碍而未订阅服务[1 (https://arxiv.org/html/2608.29110#bib.bib1),2 (https://arxiv.org/html/2608.29110#bib.bib2)]。COVID-19大流行暴露了这一鸿沟的严重性,因为基本服务转移到线上,使宽带从便利品变成了必需品[1 (https://arxiv.org/html/2608.29110#bib.bib1)]。

作为回应,2021年的《基础设施投资和就业法案》(IIJA)拨款约650亿美元用于宽带,其中包括用于“宽带公平、接入与部署”(BEAD)计划的424.5亿美元,这是美国历史上最大规模的宽带投资[3 (https://arxiv.org/html/2608.29110#bib.bib3)]。BEAD根据FCC宽带地图中确定的各州未服务和高成本未服务地点份额分配资金[4 (https://arxiv.org/html/2608.29110#bib.bib4)]。然而,这种方法依赖于少数启发式因素,并主要关注基础设施可用性,而非导致采用差异的全套需求侧障碍。实施挑战加剧了这一问题:一个州验证的合格地点列表仅包含最初地图中标注的未服务地点的22.6%[5 (https://arxiv.org/html/2608.29110#bib.bib5)]。

机器学习提供了识别与宽带采用差异相关的许多因素之间复杂非线性关系的潜力。然而,要为公共政策所用,此类模型不仅必须准确,还必须可解释。政策制定者需要理解为何特定区域采用率低,是由于负担能力限制、农村性、年龄相关障碍,还是这些因素的组合,以便调查适当的干预措施。可解释人工智能(XAI)的最新进展,特别是TreeSHAP[6 (https://arxiv.org/html/2608.29110#bib.bib6)],使得能够基于合作博弈论,将梯度提升模型的预测忠实地分解为逐特征贡献。

本文通过呈现一个集成框架,连接了数字鸿沟研究、机器学习和政策行动,该框架(1)在人口普查区粒度上预测宽带采用差异,(2)使用SHAP解释预测,以识别哪些因素组对每个区的预测差距贡献最大,以及(3)将聚类为探索性因子剖面。新颖之处不在于任何单个算法组件(LightGBM、TreeSHAP和k-均值是既定方法),而在于这个结合预测、解释和剖析的集成框架,该框架在全国范围内服务于宽带政策,并在泄漏特征排除、空间交叉验证和政策类别感知的SHAP聚合方面采取了方法论上的审慎。具体而言,我们的贡献是:

- • 全国规模的区级机器学习预测:我们在空间五折交叉验证下,对83,359个人口普查区使用65个特征训练LightGBM,达到R²=0.533和Spearman ρ=0.763;州留出交叉验证(51折)确认了泛化能力,R²=0.525。
- • 基于SHAP的因子剖析:TreeSHAP将预测的采用差距分解为特征级贡献,揭示收入和教育特征共同具有最大的归因。基于SHAP的聚类识别出三种具有不同关联模式的探索性因子剖面,支持差异化调查。
- • 基于机器学习的政策筛选:基于机器学习的区筛选在前10%的区域内捕获了38.0%的全国总采用差距,而仅基于收入的启发式方法为35.2%(+2.8个百分点,p<0.002)。主要贡献是逐区因子分解,识别出哪些特征组与每个区的预测差距关联最强。

本文其余部分组织如下。第二节回顾相关工作。第三节描述我们的数据和特征工程。第四节详述方法论。第五节呈现结果。第六节讨论发现、启示和局限性。第七节总结。

## II 相关工作

### II-A 数字鸿沟与宽带采用

关于数字鸿沟的研究经历了多个发展阶段。Van Dijk [7 (https://arxiv.org/html/2608.29110#bib.bib7)] 提出资源与占用理论,认为分类不平等导致ICT接入不平等,后来[8 (https://arxiv.org/html/2608.29110#bib.bib8)]证明数字不平等是强化而非减少现有的社会不平等。Blank 和 Groselj [9 (https://arxiv.org/html/2608.29110#bib.bib9)]将多维观点形式化,提出互联网使用应在数量、种类和活动类型上进行衡量。

大量文献记录了宽带差异的地理分布。Grubesic [10 (https://arxiv.org/html/2608.29110#bib.bib10)]开发了宽带部署区域的空间分类体系,而后续分析[11 (https://arxiv.org/html/2608.29110#bib.bib11)]发现覆盖范围被系统性夸大。Salemink 等人[12 (https://arxiv.org/html/2608.29110#bib.bib12)]回顾了157篇关于农村数字鸿沟的论文,识别出持续存在的基础设施质量差距。Horrigan [2 (https://arxiv.org/html/2608.29110#bib.bib2)]确定了三个主要障碍(成本、数字素养和感知相关性),并将非采用者分为四类。

Prieger [13 (https://arxiv.org/html/2608.29110#bib.bib13)]研究了农村地区的固定和移动宽带接入,发现移动宽带部分弥补了固定线路的不足,但基于收入的差距依然存在。Perrin 和 Turner [14 (https://arxiv.org/html/2608.29110#bib.bib14)]报告称,黑人和西班牙裔成年人订阅家庭宽带的可能性仍然显著较低,约四分之一的人仅依赖智能手机作为唯一连接。

可用性与采用之间的区别是本文献的核心。Whitacre 等人[15 (https://arxiv.org/html/2608.29110#bib.bib15),16 (https://arxiv.org/html/2608.29110#bib.bib16)]提供了因果证据,表明宽带采用(而不仅仅是可用性)对企业数量、就业和家庭收入中位数有积极影响。Whitacre 等人[17 (https://arxiv.org/html/2608.29110#bib.bib17)]进一步分解了都市与非都市的采用差距,发现基础设施解释了部分差距,但社会经济因素占显著额外部分。Gallardo [18 (https://arxiv.org/html/2608.29110#bib.bib18)]在县一级开发了数字鸿沟指数,但未进行预测建模或特征级解释。尽管文献如此丰富,但此前尚无工作应用现代机器学习在全国范围内预测人口普查区粒度的宽带采用差异,或将预测因素分解为可操作的政策类别。

### II-B 用于宽带和电信预测的机器学习

机器学习已应用于电信的各个方面,但很少用于宽带采用预测。Oughton 和 Mathur [19 (https://arxiv.org/html/2608.29110#bib.bib19)]使用卷积神经网络与卫星图像预测马拉维和埃塞俄比亚的手机采用率,在解释方差方面比基线高出40%以上;然而,他们的工作针对发展中国家,目标是手机而非宽带采用。Singleton 等人[20 (https://arxiv.org/html/2608.29110#bib.bib20)]将XGBoost整合到小区域估计框架中,以绘制大不列颠的数字不平等地图,但重点是互联网使用模式而非宽带订阅。

Zahnd 等人[21 (https://arxiv.org/html/2608.29110#bib.bib21)]使用空间回归研究美国人口普查区之间的宽带接入差异,发现贫困和教育是最强的预测因子。虽然这项工作的空间分辨率与我们相同,但它依赖于空间回归而非机器学习,并未生成预测模型或基于可解释性的建议。Paul 等人[22 (https://arxiv.org/html/2608.29110#bib.bib22)]分析了30个城市中超过837,000个地址的宽带套餐差异,发现ISP定价在城市内部差异高达600%,这是一项供给侧分析,补充了我们的需求侧预测。Nabi 等人[23 (https://arxiv.org/html/2608.29110#bib.bib23)]应用XGBoost与SHAP识别FCC国家宽带地图中可疑的ISP可用性声明(AUC > 0.98),证明了可行性,但目标是数据质量审计而非采用预测。Agarwal 和 Canfield [24 (https://arxiv.org/html/2608.29110#bib.bib24)]提出了一个理论驱动的基于代理的模型,模拟密苏里州一个274户家庭社区的宽带采用动态,这是最近的采用预测尝试,但规模有限。总体而言,这些研究表明,此前尚无工作应用梯度提升模型在全美范围内的人口普查区级别预测宽带采用。

### II-C 可解释AI与SHAP在政策中的应用

Lundberg 和 Lee [25 (https://arxiv.org/html/2608.29110#bib.bib25)]引入了SHAP,这是一个基于合作博弈论的统一框架。Lundberg 等人[6 (https://arxiv.org/html/2608.29110#bib.bib6)]用TreeSHAP扩展了它,这是一个用于在树集成上精确计算SHAP的多项式时间算法。Rudin [26 (https://arxiv.org/html/2608.29110#bib.bib26)]认为事后解释对于高风险个体决策不可靠;在我们的场景中,SHAP为聚合政策筛选提供信息,其中Shapley值保证提供了足够的保真度。Athey 和 Imbens [27 (https://arxiv.org/html/2608.29110#bib.bib27)]警告说,特征重要性是预测性的而非因果性的,我们始终注意这一区别。

SHAP已被部署于政策相关领域。Lundberg 等人[28 (https://arxiv.org/html/2608.29110#bib.bib28)]应用SHAP交互值预测手术风险,证明SHAP可以通过识别可改变的风险因素,将重点从预测转向预防,我们为宽带政策采用了这种方法。Wagner 等人[29 (https://arxiv.org/html/2608.29110#bib.bib29)]将SHAP应用于350万次通勤的梯度提升模型,将输出转化为空间政策建议,这是我们工作在方法论上最接近的类似物。

### II-D 联邦宽带投资

IIJA [3 (https://arxiv.org/html/2608.29110#bib.bib3)]拨款约650亿美元用于宽带,包括BEAD的424.5亿美元[4 (https://arxiv.org/html/2608.29110#bib.bib4)]、数字公平法案的27.5亿美元[30 (https://arxiv.org/html/2608.29110#bib.bib30)]以及负担能力连接计划(ACP)的142亿美元。ACP在2024年6月结束前注册了约2300万家庭;其终止是一个重大的负担能力冲击。BEAD在2025年6月的重组使该计划转向最低成本部署,减少了与需求侧分析的一致性。国会研究服务处的一份报告[5 (https://arxiv.org/html/2608.29110#bib.bib5)]记录了地图不准确和实施延迟问题。这一政策背景促使需要能够预测采用差异最严重地区并描述相关因素的工具。

## III 数据与特征工程

### III-A 数据来源与目标变量

我们的主要数据来源是2022年美国社区调查(ACS)五年期估计值,它提供人口普查区级别的社会经济、人口和住房特征。ACS五年期估计值平均了2018年至2022年间收集的数据,跨越了COVID-19大流行;解读结果时应考虑这种时间混合。我们用县商业模式(CBP)数据补充了ACS数据,以获取经济活动指标。CBP特征仅在县级可用,并且在县内所有区之间共享,这限制了县内区分能力,但提供了有用的县间经济背景。最终数据集包含83,359个人口普查区(约占所有美国区的98%);被排除的约1,700个区缺乏足够的ACS回应(主要是人口非常稀少的区,包括一些部落/保留地),可能不成比例地代表了服务不足的群体。

目标变量是相对宽带采用差距:gᵢ = (m - rᵢ) / m,其中m是全国宽带订阅率中位数,rᵢ是区i的率。正值表示服务不足的区。关键的是,我们排除了23个互联网自我报告特征(例如,“是否有任何互联网订阅”),以避免从其近似代理预测结果。

### III-B 特征工程

我们构建了65个特征,分为十个类别:
*   **收入/贫困(6项)**:对数家庭收入中位数、家庭收入中位数、人均收入、贫困率、基尼指数和房屋价值与收入比。
*   **教育(4项)**:...

相似文章

基于可解释机器学习与临床生物标志物的阿尔茨海默病早期检测:利用阿尔茨海默病神经影像学倡议(ADNI)数据集的多分类研究

arXiv cs.AI

本研究利用ADNI数据集中的八项临床生物标志物,构建了一个结合SHAP可解释性的XGBoost分类器,实现对阿尔茨海默病的三分类检测(认知正常、轻度认知障碍、AD),在留出测试集上达到宏观AUC 0.982、Cohen's kappa 0.909。SHAP分析表明,CDR整体评分是认知正常和轻度认知障碍的主导预测因子,而CDR-SB与MMSE共同驱动了AD的分类判别。