基于加速度测量的心血管代谢风险数字生物标志物:具有不确定性量化的人群代表性表格基准
摘要
本文介绍了NHANES加速度测量心血管代谢基准,这是一个用于从加速度测量数据预测心血管代谢风险的人群代表性表格数据集,并评估了岭回归、XGBoost和TabPFN v2,结合使用保形预测进行不确定性量化。
arXiv:2606.30702v1 公告类型:新
摘要:结构化表格数据在临床医学中占主导地位,但现有基准未能反映现实世界的特性,如复杂调查抽样、人口统计过采样和子组公平性。我们引入了NHANES加速度测量心血管代谢基准,该基准源自2003-2006年NHANES,包含1,381名成年人,配备了髋部佩戴的加速度计、空腹实验室生物标志物、膳食摄入和人体测量数据。我们评估了三种表格学习方法——岭回归、XGBoost和基础模型TabPFN v2——从活动表型和生活习惯协变量预测糖化血红蛋白(HbA1c)、空腹甘油三酯和C反应蛋白(CRP)。TabPFN v2取得了最佳整体性能(HbA1c R^2=0.156,CRP R^2=0.383),而甘油三酯仍然难以预测(R^2 < 0.05),这与已知的遗传优势一致。我们应用分割保形预测生成无分布90%预测区间,并评估按性别和种族/民族子组的人口统计覆盖公平性。边际覆盖率在CRP和HbA1c上接近90%目标,但低于甘油三酯。在子组层面,我们观察到局部覆盖不足(例如,墨西哥裔美国参与者的HbA1c),说明了边际保证与临床公平所需的条件覆盖之间的差距。代码和数据可在https://github.com/felizzi/nhanes-accel-cardiometabolic-benchmark获取。
查看缓存全文
缓存时间: 2026/07/01 05:31
# 基于加速度计的心血管代谢风险数字生物标志物:带不确定性量化的群体代表性表格基准 来源:https://arxiv.org/html/2606.30702 ###### 摘要 结构化表格数据是临床医学中的主流格式,然而现有的表格基准未能反映真实世界健康数据的关键属性:复杂调查抽样、人口统计学过度抽样、临床验证的结果以及跨群体子集的公平性要求。我们引入了*NHANES加速计心血管代谢基准*,源自国家健康与营养调查(NHANES)2003-2006,包含1,381名成年人,配有髋部佩戴式加速计数据、空腹实验室生物标志物、膳食摄入和人体测量数据。我们评估了三种方法,涵盖表格学习的专业化到通用化光谱——岭回归、XGBoost以及表格基础模型TabPFN v2——用于从加速计衍生的活动表型和生活方式协变量预测糖化血红蛋白(HbA1c)、空腹甘油三酯和C-反应蛋白(CRP)。TabPFN v2取得了最佳整体性能(HbA1c R²=0.156,CRP R²=0.383),而甘油三酯几乎无法仅从生活方式特征预测(所有模型R²<0.05),这与已知的遗传主导地位一致。我们对所有模型应用了*分割共形预测*,生成无分布假设的90%预测区间,并评估了跨性别和种族/民族子集的分布覆盖公平性。对于更可预测的结果(CRP和HbA1c),边际覆盖率接近90%目标,但对于最不可预测的甘油三酯则低于目标;在子集层面,我们观察到局部覆盖不足(例如,墨西哥裔美国参与者的HbA1c),这揭示了分割共形预测的边际保证与临床公平最终所需的条件覆盖之间的差距。所有代码和导出的基准数据集公开于https://github.com/felizzi/nhanes-accel-cardiometabolic-benchmark。 表格数据,数字生物标志物,共形预测,NHANES,心血管代谢风险,不确定性量化,表格基础模型 ## 1 引言 结构化表格数据支撑着大多数临床决策,涵盖电子健康记录、实验室结果和可穿戴设备摘要(Jiang等人,2025(https://arxiv.org/html/2606.30702#bib.bib1))。尽管表格表示学习取得了快速进展——从梯度提升树到Transformer架构和表格基础模型——基准评估主要使用通用数据集,而这些数据集省略了对健康应用至关重要的属性:复杂调查抽样设计、群体代表性、临床验证的结果指标以及跨人口统计学子集的公平性能要求(McElfresh等人,2023(https://arxiv.org/html/2606.30702#bib.bib5))。 可穿戴加速计为群体规模的数字生物标志物发现提供了引人注目的途径。连续七天测量的身体活动能捕捉与心血管代谢风险有意义相关的行为模式,但将原始活动计数转化为临床可操作的预测需要模型能够处理异构的混合类型特征、缺失的实验室值,并且——关键的是——必须提供可靠的不确定性估计以支持临床部署。 我们做出四项贡献。首先,我们引入了*NHANES加速计心血管代谢基准*,这是一个具有群体代表性的健康表格基准,具有现有套件所缺失的属性:调查设计权重、对少数群体的人口统计学过度抽样、临床验证的空腹结果以及两波时间结构。其次,我们对三种心血管代谢结果进行了严格的方法比较,方法涵盖Jiang等人(2025(https://arxiv.org/html/2606.30702#bib.bib1))的分类法——从专门的经典模型到通用表格基础模型。第三,我们对所有模型应用了*分割共形预测*(Angelopoulos和Bates,2023(https://arxiv.org/html/2606.30702#bib.bib4)),生成具有有限样本覆盖保证的无分布假设预测区间。第四,我们评估了共形覆盖在性别和种族/民族子集之间是否公平,这些子集是NHANES旨在代表的,直接解决了Jiang等人(2025(https://arxiv.org/html/2606.30702#bib.bib1))指出的公平性差距。 ## 2 数据与基准 ### 2.1 NHANES 2003-2006 国家健康与营养调查(NHANES)是美国非机构化平民人口的分层、多阶段概率样本,由疾病控制与预防中心进行(Centers for Disease Control and Prevention,2006(https://arxiv.org/html/2606.30702#bib.bib7))。我们使用调查周期C(2003-2004)和D(2005-2006),其中包含了髋部佩戴的ActiGraph加速度计,最多连续七天。 ### 2.2 分析样本 从具有有效加速度计数据的参与者(≥4个佩戴日,每天≥600分钟佩戴时间)出发,我们应用了以下纳入标准:年龄20-85岁;HbA1c、甘油三酯和CRP非缺失;并在抽血前空腹≥8小时(有效血脂测量所需)。最终分析样本包含N=1,381名参与者。描述性统计数据见表1(https://arxiv.org/html/2606.30702#S2.T1)。 表1:分析样本特征(N=1,381)。 ### 2.3 特征 活动特征(6个):总活动计数(TAC)、log-TAC(TLAC)、静坐时间(ST)、中高强度体力活动(MVPA)、轻度体力活动(LIPA)和佩戴时间(WT),使用标准切点根据分钟级加速度计数据计算(Troiano等人,2008(https://arxiv.org/html/2606.30702#bib.bib8))。 人口统计和临床协变量(12个):年龄、性别、种族/民族、贫困收入比、BMI、收缩压、吸烟状况以及通过24小时膳食回忆获得的总能量、碳水化合物、脂肪、蛋白质和纤维摄入量。 结果:log转换后的HbA1c(%)、空腹甘油三酯(mg/dL)和CRP(mg/dL),分别建模。 ## 3 方法 ### 3.1 实验设置 我们将分析样本划分为训练集(60%)、校准集(20%)和测试集(20%),使用分层随机分割(种子=42)。数值特征使用训练集统计量进行标准化。分类特征(性别、种族/民族、吸烟)进行标签编码。所有结果在建模前进行log转换以处理右偏分布;报告的指标在log尺度上计算。 ### 3.2 模型 我们评估了三种模型,涵盖Jiang等人(2025(https://arxiv.org/html/2606.30702#bib.bib1))的分类法中的专业化到通用化: 岭回归(α=1.0):一个线性专业化基线,提供可解释的性能下界。 XGBoost(Chen和Guestrin,2016(https://arxiv.org/html/2606.30702#bib.bib6)):一个梯度提升树集成,代表了临床表格预测的当前实践状态。我们使用了500个估计器,学习率0.05,最大深度6,并在校准集上提前停止。 TabPFN v2(Hollmann等人,2025(https://arxiv.org/html/2606.30702#bib.bib3))是一个表格基础模型,代表了Jiang等人(2025(https://arxiv.org/html/2606.30702#bib.bib1))分类法中的*通用*层级——它不需要特定任务的训练,直接将学习到的先验应用于下游任务而无需微调。TabPFN v2通过*上下文学习*在数百万个由结构因果模型和贝叶斯神经网络构建的合成数据集上进行预训练,使模型能够在测试时对表格输入执行近似贝叶斯推断。具体来说,给定训练集D_train和测试实例x*,TabPFN v2计算: ŷ* = g_Θ(x* ∣ D_train) (1) 其中g_Θ是一个Transformer,其权重Θ在预训练后固定——训练集直接作为上下文传递,预测在单次前向传播中生成,无需梯度更新。这种*上下文*机制使TabPFN v2能够在其前向传播中隐式地执行模型选择和不确定性估计,我们假设这解释了它在我们的中等样本量(N_train=828)上优于特定任务训练的基线的原因。按照Hollmann等人(2025(https://arxiv.org/html/2606.30702#bib.bib3))的方法,训练实例直接作为上下文示例传递,仅当训练集超过此规模时才将示例子采样至1,000个;这里N_train=828 < 1,000,因此所有训练示例都作为上下文使用,未进行子采样。我们全程使用CPU推理。 ### 3.3 共形预测 我们使用校准集对每个模型应用了*分割共形预测*(Angelopoulos和Bates,2023(https://arxiv.org/html/2606.30702#bib.bib4))。对于每个模型和结果,我们在校准集上计算非一致性得分作为绝对残差|y_i - ŷ_i|,并在误覆盖率α=0.10(目标90%覆盖)下形成预测区间: Ĉ(x) = [ŷ - q̂, ŷ + q̂] (2) 其中q̂是校准残差的⌈(1-α)(1+1/n_cal)⌉分位数。分割共形预测无需分布假设即可提供有限样本的边际覆盖保证(Angelopoulos和Bates,2023(https://arxiv.org/html/2606.30702#bib.bib4))。 ### 3.4 子集覆盖分析 我们评估了共形覆盖在由性别(男性/女性)和种族/民族(墨西哥裔美国人、其他西班牙裔、非西班牙裔白人、非西班牙裔黑人、其他)定义的人口统计学子集之间是否公平,利用了NHANES过度抽样设计,该设计确保了少数群体的充分代表。 ## 4 结果 ### 4.1 预测性能 表2(https://arxiv.org/html/2606.30702#S4.T2)报告了所有模型-结果组合的R²、平均绝对误差(MAE,log尺度)和经验共形覆盖率。 表2:测试集(N=276)上的模型比较。覆盖目标=0.90。MAE在log尺度上报告。 TabPFN v2在所有三个结果上取得了最佳的R²,在CRP上差距最大(R²=0.383对比岭回归的0.339)。TabPFN v2的优势在CRP上最为显著(ΔR²=+0.044超过岭回归,+0.070超过XGBoost),这与其上下文贝叶斯先验捕捉活动、BMI和饮食特征之间的非线性交互作用一致,这些交互作用在如此样本量下难以被线性模型近似,且在梯度提升树中正则化不足。CRP是所有模型中最可预测的结果,这与全身炎症的强行为决定因素一致。甘油三酯在所有模型上显示出接近零或负的R²,反映了急性膳食摄入和遗传因素的主导作用,这两者既未被我们的特征集捕获,也不在NHANES公共使用文件中可用(Teslovich等人,2010(https://arxiv.org/html/2606.30702#bib.bib9))。HbA1c具有中等可预测性(R²=0.133-0.156),与使用一般群体样本中生活方式变量的已发表估计一致(Selvin等人,2004(https://arxiv.org/html/2606.30702#bib.bib10))。 共形覆盖最接近90%目标的是岭回归(HbA1c:0.910,CRP:0.917)和TabPFN v2在CRP上(0.939)。XGBoost在甘油三酯上显示出轻微覆盖不足(0.823),反映了其残差分布上的更大过度自信。 ### 4.2 子集覆盖分析 图1(https://arxiv.org/html/2606.30702#S4.F1)显示了TabPFN v2按人口统计子集划分的经验共形覆盖率。在CRP上,跨性别和种族/民族子集的覆盖率总体上一致,所有组均达到或超过90%目标。然而,对于墨西哥裔美国参与者在HbA1c上观察到显著的覆盖不足(0.719),而其他组在该结果上达到≥0.87的覆盖率。甘油三酯在所有子集中也观察到覆盖不足,与该结果整体可预测性差一致。值得注意的是,非西班牙裔黑人参与者在HbA1c和CRP上的覆盖率均达到或超过90%目标,表明尽管该群体心血管代谢风险患病率较高,但边际区间对此群体仍然有效。 参见图注 图1:TabPFN v2按人口统计子集划分的经验共形覆盖率(90%目标)。颜色表示覆盖水平:绿色≥0.90,红色<0.90。 ## 5 讨论 #### TabPFN v2 作为小规模健康数据集的强基线。 我们的结果表明,表格基础模型TabPFN v2在所有三个结果上无需任何特定任务训练即可在评估的基线中取得最佳点性能,尽管在此单一分割上相对于岭回归和XGBoost的优势不大,应通过重复分割评估来确认。这与Hollmann等人(2025(https://arxiv.org/html/2606.30702#bib.bib3))的发现一致,表明TabPFN v2在小规模表格数据集(N <10,000)上取得了最先进的性能,并将这一发现扩展到临床结构化、具有群体代表性的健康基准。 #### 为什么TabPFN v2优于特定任务模型。 TabPFN v2在N=1,381的数据集上的优越性能与其设计目标一致:模型在覆盖多种因果结构的合成数据集上的预训练有效地编码了表格关系的广泛先验,这在特定任务训练数据稀缺时起到了强正则化作用。经典模型如岭回归和XGBoost必须从可用的828个训练示例中估计所有结构,而TabPFN v2则利用从数百万个合成数据集中提炼的知识来指导其预测。这一发现扩展了Hollmann等人(2025(https://arxiv.org/html/2606.30702#bib.bib3))的结果——该结果展示了TabPFN v2在通用小规模表格基准上的优势——将其推广到临床结构化、具有群体代表性的健康数据集,表明表格基础模型可能特别适用于数据收集成本高昂且样本量固有受限的健康应用。 #### 结果特定的可预测性。 CRP(R²≈0.38)与甘油三酯(R²≈0.00)之间的强烈对比凸显了数字生物标志物发现的关键挑战:并非所有心血管代谢结果都同等程度地可从生活方式和活动数据中预测。甘油三酯主要由遗传因素(Teslovich等人,2010(https://arxiv.org/html/2606.30702#bib.bib9))和急性膳食摄入主导,这两者均未被7天加速度计或单次24小时膳食回忆捕获。未来纳入遗传数据或重复膳食评估的工作可能显著改善甘油三酯预测。 #### 边际覆盖与条件覆盖。 分割共形预测无需分布假设即可提供有效的*边际*覆盖,使其成为处理NHANES异构人口结构的一个有吸引力的起点。然而,边际有效性并不意味着条件有效性:保证在测试分布上平均成立,但可能在单个子集内被违反。我们的分析证实了这一点——在CRP和HbA1c上,大多数组的覆盖率接近标称值
相似文章
CardioMeta: 跨人群与电子健康记录数据中糖尿病、高血压和心血管疾病的校准多任务预测
CardioMeta是一个校准的多任务框架,用于在NHANES和MIMIC-IV数据上联合预测糖尿病、高血压和心血管疾病,强调泄漏控制、校准和透明可靠性。
超越BMI:利用智能手机影像估算心血管代谢风险
Google Research 推出 PhotoScan,这是一个深度学习框架,能从标准智能手机照片中估算身体成分指标,以预测胰岛素抵抗和心血管代谢风险,达到接近DXA的准确度。
OpenMHC:加速可穿戴基础模型科学研究
OpenMHC推出了最大的开放获取可穿戴健康数据集,包含超过6000万小时的数据,并提供了可穿戴基础模型的开源实现,包括用于预测、插补和时序预测的统一基准测试。
身体活动为广谱健康预测实现可扩展的基础建模
StepFM是一个基础模型,仅使用计步器数据进行广谱健康预测,为高频传感器模型提供了保护隐私且可扩展的替代方案。
Holtercare-Bench:一个评估长期动态心电图分析的多模态基准
Holtercare-Bench是一个多模态基准,用于使用Holtercare-23K数据集评估长期动态心电图分析,揭示了当前MLLMs的性能差距,并通过微调为临床应用提供改进。