零样本大语言模型能否预测儿童营养不良?公平性与时间稳健性研究

arXiv cs.CL 论文

摘要

一项研究评估了零样本 GPT-4o-mini 在孟加拉国人口与健康调查数据中预测儿童发育迟缓的表现,并与随机森林基线进行对比,同时评估了不同人口群体间的公平性及时间稳健性。结果显示两者平衡准确率相当,但在居住地和财富类别上存在显著的公平性差异。

arXiv:2607.29082v1 公告类型:新 摘要:儿童营养不良仍然是低收入和中等收入国家面临的重大公共卫生挑战,尤其是在南亚地区,早期识别弱势儿童对于及时干预和资源分配至关重要。本研究旨在评估使用预训练大语言模型(LLM)在零样本设置下,利用人口健康调查数据进行儿童发育迟缓预测的可行性、公平性和时间稳健性。利用 2007 年至 2022 年间收集的孟加拉国人口与健康调查(BDHS)数据,我们将母亲、儿童、医疗保健和家庭特征转化为语义上可解释的基于提示的表示形式,并评估了 GPT-4o-mini 在零样本发育迟缓预测中的表现,将其性能与随机森林基线进行了比较,同时评估了人口和社会经济群体间的公平性以及不同调查波次间的时间稳健性。结果表明,使用 GPT-4o-mini 进行的零样本推断取得了与监督基线相当的平衡准确率,同时在识别发育迟缓病例方面表现出显著更高的敏感性,在不同儿童性别群体间的表现相对一致,并且在 BDHS 各波次间的预测行为稳定;然而,在居住地和家庭财富类别之间观察到了重要的公平性差异,这凸显了在基础模型部署于公共卫生预测场景之前需要进一步研究的必要性。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:35

# 零样本大语言模型能否预测儿童营养不良?一项公平性与时间稳健性研究
来源:https://arxiv.org/html/2607.29082
\\copyrightclause

本文版权归作者所有。允许根据知识共享署名 4.0 国际许可协议(CC BY 4.0)使用。

\\conference

AIME 2026 研讨会联合论文集:第一届医疗保健中多中心与隐私保护学习国际研讨会、公共卫生与流行病学基础模型:从承诺到实践,以及第一届健康知识图谱国际研讨会,2026年7月10日,加拿大渥太华

[orcid=0000-0002-6798-6535, [email protected], ]\cormark[1]

[orcid=0000-0003-3452-8367, [email protected] ]

\cortext

[1]通讯作者。

Md Ahshanul Haque澳大利亚查尔斯特大学计算、数学与工程学院,巴瑟斯特,新南威尔士州 2795

(2026)

###### 摘要

儿童营养不良仍然是低收入和中等收入国家面临的重大公共卫生挑战,尤其是在南亚地区,及早识别脆弱儿童对于及时干预和资源分配至关重要。本研究旨在评估在零样本设置下使用预训练大语言模型(LLM)进行儿童发育迟缓预测的可行性、公平性和时间稳健性,数据来自人口健康调查。利用 2007 年至 2022 年间收集的孟加拉国人口与健康调查(BDHS)数据,我们将母亲、儿童、医疗保健和家庭特征转换为语义可解释的基于提示的表示,并评估了 GPT-4o-mini 在零样本发育迟缓预测中的表现,将其性能与随机森林基线进行比较,同时评估了不同人口和社会经济群体中的公平性以及不同调查轮次间的时间稳健性。结果表明,使用 GPT-4o-mini 进行零样本推理达到了与监督基线相当的平衡准确率,同时在识别发育迟缓病例方面表现出显著更高的灵敏度,在不同儿童性别群体中表现相对一致,并且在 BDHS 各轮次间预测行为稳定;然而,在居住地和家庭财富类别之间观察到重要的公平性差异,这表明在公共卫生预测环境中部署基础模型之前需要进一步调查。

###### 关键词:

LLM\sep零样本\sep儿童营养不良\sep发育迟缓\sep公平性\sep稳健性

## 1 引言

儿童营养不良仍然是一个全球性的重大公共卫生挑战,尤其是在低收入和中等收入国家,幼儿期营养不足与生长发育受损、认知发育迟缓、疾病易感性增加以及死亡风险升高有关[victora2008maternal,black2013maternal]。尽管孕产妇和儿童医疗保健有所改善,包括孟加拉国在内的南亚国家仍然承受着儿童发育迟缓、消瘦和低体重的沉重负担[unicef2023malnutrition,bdhs2022]。因此,及早识别脆弱儿童对于及时干预和循证公共卫生规划至关重要。

母亲、儿童、医疗保健和家庭社会经济特征一直被确定为儿童营养不良的重要决定因素[black2013maternal,victora2008maternal]。鉴于孟加拉国人口与健康调查(BDHS)数据集的可获得性不断增加,近期研究已应用诸如逻辑回归、随机森林和梯度提升等传统机器学习(ML)方法来预测儿童营养不良结果[talukder2020machine,khan2021model,islam2024prediction]。然而,这些研究主要依赖针对特定任务的监督学习,对于大语言模型(LLM)在公共卫生预测任务中的适用性研究有限。

大语言模型的最新进展已在各种生物医学和医疗保健应用中展现出强大的零样本推理能力[bommasani2021opportunities,singhal2023large,thirunavukarasu2023large]。然而,将零样本 LLM 用于结构化人口健康调查数据在很大程度上仍未得到探索,特别是在不同人口和社会经济群体中的公平性以及时间稳健性方面。

在本研究中,我们评估了预训练 LLM GPT-4o-mini 在零样本设置下使用 2007 年至 2022 年间收集的 BDHS 数据进行儿童发育迟缓预测的表现。利用母亲、儿童、医疗保健和家庭特征的基于提示的特征-值表示,我们评估了预测性能、儿童性别、居住地和家庭财富类别中的公平性,以及 BDHS 各轮次间的时间稳健性。我们的研究结果有助于推动关于 LLM 在人群层面公共卫生预测任务中的实际适用性和局限性的讨论。

## 2 方法

### 2.1 数据集

本研究使用了 2007 年至 2022 年间收集的儿童层面 BDHS 数据[bdhs2022,dhsprogram]。BDHS 是一项具有全国代表性的横断面调查,包含广泛的母亲、儿童、医疗保健、人口和家庭社会经济信息,已被广泛应用于人口健康与机器学习研究[talukder2020machine,khan2021model,islam2024prediction]。分析中纳入了五岁以下、具有完整人体测量和协变量信息的儿童。目标结局是儿童发育迟缓,根据世界卫生组织(WHO)儿童生长标准定义为年龄别身高 Z 评分(HAZ)低于 WHO 参考人群的 -2 个标准差[who2006child]。本研究中考虑的特征在既往文献中被确定为儿童营养不良的重要决定因素[black2013maternal,victora2008maternal,talukder2020machine,islam2024prediction],汇总见表1 (https://arxiv.org/html/2607.29082#S2.T1)。在预处理过程中排除了任何选定特征存在缺失值的样本,最终分析数据集包含 17106 名儿童,其中发育迟缓 5623 例,非发育迟缓 11483 例。

表1:本研究中使用的选定特征按儿童发育迟缓状态分层的汇总。数值以平均值±\pm标准差或频率(%)表示。对于二分类变量,为简洁起见,仅报告一个类别(例如,是或否)。pp值表示发育迟缓组与非发育迟缓组之间的统计学差异。特征名称特征值发育迟缓组(n=5623, %)非发育迟缓组(n=11483, %)p值母亲年龄(岁)平均值±\pm标准差25.37±\pm6.0725.16±\pm5.67p=0.032p=0.032母亲教育水平中学2449(43.6)5674(49.4)p<0.001p<0.001小学1838(32.7)2787(24.3)大专及以上384(6.8)1970(17.2)无教育952(16.9)1052(9.2)母亲体质指数(BMI)平均值±\pm标准差20.82±\pm3.5921.96±\pm3.91p<0.001p<0.001过去12个月内是否工作否4290(76.3)8868(77.2)p=0.176p=0.176存活子女数平均值±\pm标准差2.23±\pm1.352.01±\pm1.16p<0.001p<0.001母亲初育年龄平均值±\pm标准差17.98±\pm3.0918.69±\pm3.45p<0.001p<0.001是否参与决策是2558(45.5)5461(47.6)p=0.011p=0.011是否认同殴打妻子否3997(71.1)8818(76.8)p<0.001p<0.001是否接触大众媒体是3165(56.3)7693(67.0)p<0.001p<0.001是否经历过子女死亡否4848(86.2)10404(90.6)p<0.001p<0.001父亲教育水平中学1598(28.4)3914(34.1)p<0.001p<0.001小学1972(35.1)3169(27.6)无教育1546(27.5)1940(16.9)大专及以上507(9.0)2460(21.4)父亲职业工人2628(46.7)5157(44.9)p<0.001p<0.001商业或专业人士1322(23.5)3708(32.3)农业1563(27.8)2375(20.7)无业110(2.0)243(2.1)儿童年龄(月)平均值±\pm标准差24.46±\pm13.6919.37±\pm14.45p<0.001p<0.001儿童性别男3014(53.6)5901(51.4)p=0.007p=0.007儿童出生顺序平均值±\pm标准差2.41±\pm1.552.12±\pm1.30p<0.001p<0.001生育间隔≥\geq24个月3238(57.6)6360(55.4)p<0.001p<0.001无先前生育1904(33.9)4457(38.8)<24个月481(8.6)666(5.8)是否早开奶是4212(74.9)8201(71.4)p<0.001p<0.001儿童是否正在母乳喂养是4205(74.8)9028(78.6)p<0.001p<0.001儿童是否补充维生素A是3614(64.3)6829(59.5)p<0.001p<0.001是否有熟练接生人员否3602(64.1)5389(46.9)p<0.001p<0.001是否在医疗机构分娩否3817(67.9)5909(51.5)p<0.001p<0.001是否剖宫产否4623(82.2)7924(69.0)p<0.001p<0.001是否接受至少4次产前检查否4284(76.2)7321(63.8)p<0.001p<0.001饮用水源安全4943(87.9)9889(86.1)p=0.001p=0.001厕所设施类型卫生2883(51.3)7030(61.2)p<0.001p<0.001居住地是否农村是4103(73.0)7575(66.0)p<0.001p<0.001家庭财富指数最贫困1621(28.8)1947(17.0)p<0.001p<0.001最富裕679(12.1)2787(24.3)较富裕961(17.1)2465(21.5)较贫困1261(22.4)2086(18.2)中等1101(19.6)2198(19.1)家庭人数平均值±\pm标准差6.01±\pm2.686.12±\pm2.71p=0.011p=0.011
### 2.2 提示构建与零样本推理

每名儿童的记录通过将特征-值对序列化为结构化的列表式提示格式来表示(表3 (https://arxiv.org/html/2607.29082#S2.T3))。先前研究表明,在将 LLM 应用于结构化数据推理任务时,列表式序列化能够保留表格语义并减少歧义[hegselmann2023tabllm]。遵循现代 LLM 中使用的指令微调范式,提示明确定义了任务目标、二分类输出空间和序列化的输入记录。提示模板根据先前的基于指令的提示优化方法,通过实证验证进行迭代完善。

表3:用于零样本推理的提示示例。你是一个临床分类模型。根据提供的特征,预测该儿童是否可能发育迟缓。输出必须是单个标记:0 = 未发育迟缓,1 = 发育迟缓。特征:母亲当前年龄(岁):24,儿童性别:女,... 请仅用一个标记(0 或 1)回答。GPT-4o-mini 被用作零样本推理的预训练 LLM,因为它具有强大的指令遵循能力、成本效益高,并支持标记级对数概率,从而能够通过比较预定义输出标记的似然性进行概率分类。通过 OpenAI API 进行推理时,采用温度设为 0 的确定性解码。对于基线比较,实现了随机森林分类器,其中class\_weight=‘balanced’且random\_state=42,以处理类别不平衡问题。

## 3 结果与讨论

表4 (https://arxiv.org/html/2607.29082#S3.T4) 展示了零样本 GPT-4o-mini 模型在儿童发育迟缓预测中的公平性和时间稳健性表现。总体而言,GPT-4o-mini 实现了 58% 的平衡准确率和 0.632 的 AUROC,与使用 5 折交叉验证的随机森林基线模型(平衡准确率:57%,AUROC:0.685)相当。值得注意的是,GPT-4o-mini 的灵敏度(77.5%)显著高于随机森林(23.4%),表明其在识别发育迟缓病例方面的能力更强。然而,其特异度明显较低(38.6% 对 90.7%),表明相对于监督式机器学习基线,零样本 LLM 倾向于过度预测阳性发育迟缓结果。

表4:零样本 LLM 在儿童发育迟缓预测中的公平性和时间稳健性表现。CV:交叉验证。类别值测试样本平衡准确率(%)AUROC灵敏度(%)特异度(%)随机森林5折交叉验证57.00.68523.490.7GPT-4o-mini1710658.00.63277.538.6GPT-4o-mini 的公平性儿童性别男891558.10.63176.739.4女819158.00.63378.337.7居住地农村1167855.40.62086.024.9城市542859.80.64554.465.2财富指数最贫困356850.00.581100.00.0较贫困334750.90.56098.73.0中等329953.10.56373.033.1较富裕342655.00.57854.155.9最富裕346652.90.58324.781.1GPT-4o-mini 的时间稳健性BDHS轮次200721958.20.61147.668.92011258756.50.62283.829.22014166156.60.62177.135.92018167657.90.61773.642.3202290957.90.61871.744.1公平性评估显示,儿童性别群体之间的表现相对一致,男性和女性儿童的平衡准确率和 AUROC 值几乎相同。相比之下,在居住地和财富类别之间观察到较大的差异。GPT-4o-mini 对农村儿童的灵敏度显著较高(86%),但特异度较低(24.9%),表明其倾向于更频繁地推断农村人口的发育迟缓。同样,该模型在最贫困财富类别中实现了 100% 的灵敏度和 0% 的特异度,表明可能对社会经济弱势儿童过度分类为发育迟缓。为了进一步调查这种行为是否主要由财富指数变量本身驱动,我们在从提示中排除财富指数特征后,重新评估了最贫困类别中的 3568 个样本。该模型仍然表现出非常高的灵敏度(96%)和较低的特异度(6%),这表明观察到的预测模式可能并非仅源于显式的财富信息,而可能源于相关的母亲、家庭或其他特征。这些发现需要进一步研究预训练 LLM 学习到的隐性社会经济关联。

时间稳健性分析显示,在 2007 年至 2022 年的 BDHS 调查轮次中,模型表现相对稳定。平衡准确率保持在较窄范围内(56.5%–58.2%),而 AUROC 值仅在 0.611 至 0.622 之间适度变化。这些发现表明,尽管调查年份间的人口、社会经济和医疗保健分布不断变化,零样本 LLM 仍保持相对一致的预测行为。然而,不同 BDHS 轮次之间的灵敏度和特异度差异较大。早期的调查轮次(尤其是 2007 年)灵敏度较低、特异度较高,而后期轮次则呈现相反趋势。这种转变可能反映了人口特征和医疗保健可及模式的随时间变化。

## 4 结论与未来工作

本研究评估了在零样本设置下使用预训练 LLM GPT-4o-mini 预测儿童发育迟缓的可行性。基于 BDHS 数据集的发现表明,使用预训练 LLM 进行零样本推理可以达到与传统随机森林基线相当的平衡准确率,同时在识别发育迟缓病例方面表现出显著更高的灵敏度。公平性分析显示,儿童性别之间的表现相对一致,但在居住地和家庭财富类别之间突出了重要差异,表明需要进一步调查基于 LLM 的公共卫生预测中潜在的社会经济偏见。时间稳健性评估进一步表明,尽管人口分布随时间变化,模型在 BDHS 各轮次间的预测表现相对稳定。总体而言,本研究凸显了 LLM 在无需任务特定训练的情况下进行人群层面健康预测的潜力和局限性。未来的工作应进一步调查公平性影响,探索少样本提示和提示优化策略,并将不同 LLM 与稳健的机器学习方法进行比较,以提高基础模型在公共卫生预测中的可靠性和泛化能力。

相似文章

零样本世界模型是发展高效的学习者 [R]

Reddit r/MachineLearning

研究人员引入了零样本世界模型(Zero-shot World Models, ZWM),该方法在仅使用极少数据(单个幼儿的视觉经验)且无需特定任务训练的情况下,即可达到与最先进模型相当的视觉能力。这项工作展示了通往数据效率可与人类发展学习效率匹敌的AI系统的路径。