不确定性下的证据引导神经架构选择用于个体化血糖预测
摘要
提出EVIDENT框架,该框架整合贝叶斯训练与基于证据的排序进行神经架构选择,并在1型糖尿病的个体化血糖预测中演示,系统地选择泛化可靠的轻量模型。
查看缓存全文
缓存时间: 2026/06/05 08:10
# 不确定性下基于证据引导的神经架构选择用于个体化血糖预测 来源:https://arxiv.org/html/2606.05373 ###### 摘要 在有限、含噪声且异质的数据条件下进行时间序列预测时,可靠的神经架构选择仍是一个开放挑战。标准的启发式架构设计和验证方法无法确保准确、可靠的预测及泛化能力。我们提出 EVIDENT(基于证据的神经架构识别),这是一个整合了贝叶斯训练、基于证据的排序以及不确定性下任务特定验证的架构选择框架。该框架探索候选架构池,并识别出满足规定验证标准的最低容量模型。我们使用时间卷积网络(TCN)对1型糖尿病患者的个体化血糖预测来演示该方法。结果表明,EVIDENT在人群级糖尿病数据上系统性地拒绝了欠参数化和过参数化的TCN架构,同时识别出能可靠泛化到未见患者的模型。当多个架构具有竞争力时,该框架进一步支持基于似然加权的集成预测,从而提升预测性能。与随机搜索基线相比,EVIDENT识别出更小的架构,且在未见患者上具有更一致的预测性能。这些发现确立了EVIDENT作为一种神经架构发现策略,使其能够在数据有限且异质的环境下,为具有重大影响的预测任务实现可靠的模型选择。 ###### 关键词:贝叶斯神经网络、架构选择、模型证据、时间序列建模、时间卷积网络 ††期刊:神经网络 \\affiliation \[inst1\]organization=Department of Mechanical and Aerospace Engineering, University at Buffalo,city=Buffalo, state=NY, country=USA \\affiliation \[inst2\]organization= Computational and Data-Enabled Sciences, University at Buffalo,city=Buffalo, state=NY, country=USA ## 1 引言 神经网络的架构与超参数选择仍是时间序列学习中的核心挑战[1 (https://arxiv.org/html/2606.05373#bib.bib1),2 (https://arxiv.org/html/2606.05373#bib.bib2),3 (https://arxiv.org/html/2606.05373#bib.bib3)],尤其在数据有限、含噪声且异质的条件下。当目标不仅限于逐点精度,还包括对物理和生物医学系统中具有重要影响的决策提供可靠预测时,这一挑战更加突出。在此类场景中,架构设计必须平衡时间表达能力、基于可用数据的有效参数学习以及向未见条件的泛化能力。然而在实践中,架构选择往往依赖于反复试错或基于保留集性能比较的启发式选择。虽然这些方法能够在特定数据划分下产生精确模型,但它们对于所选架构的可训练参数是否充分受数据支撑、架构选择对数据划分的敏感程度如何,以及所得预测是否满足任务所需的可靠性等问题,所提供的洞察十分有限。
1型糖尿病患者个体化血糖预测为这一问题提供了高风险的测试平台。其目标是从连续血糖监测(CGM)数据以及记录的膳食摄入和胰岛素输送记录中预测未来的血糖变化轨迹,从而实现基于患者的个性化治疗决策,例如优化胰岛素施用方案。由于复杂的血糖-胰岛素延迟动态、强烈的患者间和患者内变异性以及可穿戴传感器的噪声,这一场景极具挑战性。因此,那些在回顾性历史患者数据上表现良好的架构,仍可能无法泛化到前瞻性的个体化预测,这使得该应用成为神经架构选择的一个严格基准。
尽管神经架构和训练算法快速进步,当前用于构建和验证神经网络预测的方法在几个关键方面仍然受限。神经架构搜索及相关设计策略通常依赖启发式探索或元启发式优化[4 (https://arxiv.org/html/2606.05373#bib.bib4),5 (https://arxiv.org/html/2606.05373#bib.bib5),6 (https://arxiv.org/html/2606.05373#bib.bib6),7 (https://arxiv.org/html/2606.05373#bib.bib7),8 (https://arxiv.org/html/2606.05373#bib.bib8)],产生的架构对数据划分敏感,且可能无法泛化到观测训练分布之外。更根本的是,模型验证通常由经验性能评估驱动,往往基于大数据假设或问题特定启发式规则[9 (https://arxiv.org/html/2606.05373#bib.bib9),10 (https://arxiv.org/html/2606.05373#bib.bib10),11 (https://arxiv.org/html/2606.05373#bib.bib11),12 (https://arxiv.org/html/2606.05373#bib.bib12),13 (https://arxiv.org/html/2606.05373#bib.bib13)]。这些方法对于给定架构是否充分受数据支撑,或预测不确定性是否可接受等问题的洞察十分有限。这类局限性在生物医学和临床时间序列预测中尤为突出:患者间变异性和有限的患者数据可能导致不稳定的架构排序,而仅凭平均测试集精度不足以评估预测是否满足任务所需的准确性和可靠性。
为解决这些局限,我们提出 EVIDENT(基于证据的神经网络架构识别)框架,其整合了贝叶斯训练[14 (https://arxiv.org/html/2606.05373#bib.bib14),15 (https://arxiv.org/html/2606.05373#bib.bib15),16 (https://arxiv.org/html/2606.05373#bib.bib16),17 (https://arxiv.org/html/2606.05373#bib.bib17),18 (https://arxiv.org/html/2606.05373#bib.bib18)]、基于证据的排序[19 (https://arxiv.org/html/2606.05373#bib.bib19),20 (https://arxiv.org/html/2606.05373#bib.bib20)]以及不确定性下的任务特定验证[21 (https://arxiv.org/html/2606.05373#bib.bib21),22 (https://arxiv.org/html/2606.05373#bib.bib22)]。EVIDENT 并不穷举搜索大型架构空间或仅基于保留集误差选择模型,而是以分层方式系统性地评估候选架构,返回满足规定可靠性标准的最低容量架构(即可训练参数数量最小)。其核心思想是将模型排序与模型验证解耦,使得贝叶斯证据用于识别架构空间中高模型似然的区域,而模型接受则基于明确考虑预测不确定性的任务特定验证。在本文中,我们使用时间卷积网络(TCN)实现 EVIDENT 用于个体化血糖预测,并展示近似证据能够一致地将候选架构定位到一个狭窄的中间容量区间,在此区间内可以识别出经过验证的预测器。
本文其余部分组织如下:第2节 (https://arxiv.org/html/2606.05373#S2) 阐述所提出的方法论,包括血糖预测公式、可行的 TCN 架构空间、贝叶斯学习、基于近似证据的 TCN 预测器架构排序以及 EVIDENT 算法框架。第3节 (https://arxiv.org/html/2606.05373#S3) 呈现数值结果,包括一组基于似然的分析来检验 TCN 架构的行为,然后将 EVIDENT 应用于 1 型糖尿病人群级架构选择,并基于患者特定验证。第4节 (https://arxiv.org/html/2606.05373#S4) 讨论该方法的更广泛意义、局限性和扩展方向,第5节 (https://arxiv.org/html/2606.05373#S5) 给出结论性评注。
## 2 方法
### 2.1 血糖预测与可行架构空间
我们考虑从包含血糖、膳食摄入和胰岛素输送序列的多通道时间序列中进行多步血糖(BG)预测。在离散时间指标 \(k\) 下,模型将最近的观测窗口映射到预测时长 \(H\) 上的未来血糖轨迹。令 \(G^{(k-d_G:k)}\in \mathbb{R}^{d_G}\)、\(M^{(k-d_M:k)}\in \mathbb{R}^{d_M}\) 和 \(I^{(k-d_I:k)}\in \mathbb{R}^{d_I}\) 分别表示血糖、膳食摄入和胰岛素输送的输入历史。预测模型被构造为非线性算子 \(\mathcal{T}_{w,\xi}: \mathbb{R}^{d_G}\times \mathbb{R}^{d_M}\times \mathbb{R}^{d_I}\rightarrow \mathbb{R}^{H}\),其中 \(\xi\) 是架构参数,\(w\in\mathbb{R}^W\) 表示所有可训练参数。预测器则写为:
\[
G^{(k+1:k+H)} = \mathcal{T}_{w,\xi}\!\left(G^{(k-d_G:k)},\, M^{(k-d_M:k)},\, I^{(k-d_I:k)}\right),
\]
其中 \(G^{(k+1:k+H)}\in \mathbb{R}^{H}\) 表示预测的未来血糖轨迹。本文中,\(\mathcal{T}_{w,\xi}\) 使用编码器-解码器时间卷积网络(TCN)[23 (https://arxiv.org/html/2606.05373#bib.bib23),24 (https://arxiv.org/html/2606.05373#bib.bib24)] 实现,如图1 (https://arxiv.org/html/2606.05373#S2.F1) 所示。输入被表示为具有三个通道的多通道序列,分别对应 \(G^{(k-d_G:k)}\)、\(M^{(k-d_M:k)}\) 和 \(I^{(k-d_I:k)}\)。编码器由 \(N\) 个堆叠的时间块组成。每个编码器块 \(j\) 将输入特征张量映射到具有 \(c_j\) 个通道的输出特征张量,并实现为包含两个贝叶斯因果膨胀一维卷积层(Conv1D,滤波器大小 \(f\))的时间残差块,随后是非线性 ReLU 激活和残差跳跃连接。当输入和输出通道维度不同时,在跳跃路径上应用逐点 \(1\times1\) Conv1D 以线性投影输入通道,然后进行逐元素相加。这种残差块结构受 ResNet [25 (https://arxiv.org/html/2606.05373#bib.bib25)] 启发,通过促进跨块的梯度流动来改进更深 TCN 的训练。卷积层使用因果填充,以确保每个块内的时序维度保持不变。编码器块 \(j\) 中的膨胀因子定义为 \(\delta_j = b^{j-1}\),其中 \(b\) 是膨胀基数。膨胀决定相邻滤波器操作之间的间距;当 \(\delta_j=1\) 时,卷积使用连续的时间样本;当 \(\delta_j>1\) 时,滤波器跳过了中间样本,从而在不增加滤波器大小的情况下覆盖更宽的时间范围。\(\delta_j\) 随深度 \(j\) 呈几何增长,扩大了感受野,使网络能够在保持因果性的同时捕获长期时间依赖关系。在每个编码器块后(最后一个除外),平均池化层(AvgPool)降低时间分辨率,生成紧凑的潜在表示。解码器通过 \(N\) 个通道数分别为 \(\tilde{c}_1,\ldots,\tilde{c}_N\) 的解码器块将潜在序列映射回预测分辨率。每个解码器块采用相同的残差结构,包含两个因果 Conv1D 层(滤波器大小 \(f\))、ReLU 激活函数,以及当块的输入和第二层卷积的输出具有不同通道维度时,在残差连接中使用 \(1\times1\) 投影以确保两个张量可以逐元素相加。与编码器不同,解码器卷积使用单位膨胀(即所有解码器块 \(j=1,\ldots,N\) 的 \(\delta_j=1\))。在连续解码器块之间,上采样层增加时间分辨率。最后,一个贝叶斯 Conv1D 层将解码器特征张量映射到预测的血糖轨迹 \(G^{(k+1:k+H)}\)。
参照图注
图1:(左面板) 用于多步血糖预测 \(G^{(k+1:k+H)} = \mathcal{T}_{w,\xi}(G^{(k-d_G:k)},\, M^{(k-d_M:k)},\, I^{(k-d_I:k)})\) 的贝叶斯时间卷积网络(TCN)架构。编码器包含 \(N\) 个时间残差块,通道数为 \(c_j\),滤波器大小 \(f\),膨胀 \(\delta_j = b^{j-1}\);编码器块之间的平均池化层逐步降低时间分辨率,生成编码后的潜在序列。解码器包含 \(N\) 个通道数为 \(\tilde{c}_j\) 的残差卷积块,使用单位膨胀因果卷积,以及解码器块之间的上采样层。(右上面板) 时间残差块,由两个贝叶斯因果 Conv1D 层(带 ReLU 激活)和一个残差跳跃连接组成;当输入和输出通道维度不同时,在跳跃路径上使用 \(1\times1\) Conv1D。(右下面板) 因果 Conv1D 层的贝叶斯参数化,其中卷积权重由贝叶斯训练确定的概率分布表示。
在此架构家族中,感受野是一个由 \(\xi\) 导出的量,表示输入中影响输出特定条目的条目集合。对于图1 (https://arxiv.org/html/2606.05373#S2.F1) 中的时间块(每个包含两个因果膨胀卷积),所得感受野为:
\[
\mathrm{RF} = 1 + 2(f-1) \sum_{j=0}^{N-1} b^j = 1 + 2(f-1) \frac{b^N - 1}{b-1}.
\]
可行架构空间由有限组合的离散架构参数(块数 \(N\)、膨胀基数 \(b\)、滤波器大小 \(f\)、编码器通道数 \(\{c_j\}_{j=1}^N\) 和解码器通道数 \(\{\tilde{c}_j\}_{j=1}^N\)、步长 \(s\)、输入长度 \(\{d_G, d_M, d_I\}\) 以及输出时长 \(H\))定义,并受到结构和时间约束:
\[
\Xi = \left\{ \xi: \mathrm{RF} \geq \tau_{\min},\; f \geq b \right\},
\]
其中 \(\tau_{\min}\) 表示捕获相关血糖动态(例如膳食和胰岛素的延迟效应)所需的最小时间范围,而 \(f \geq b\) 强制膨胀卷积的无空洞条件,以确保输入序列中的每个条目都对输出有贡献。可能还会根据期望预测时长和计算预算施加其他问题特定约束。尽管存在这些限制,\(\xi\) 的组合结构仍产生了一个庞大的候选架构空间,从而激发了对原则性架构发现策略的需求。
### 2.2 TCN 预测器的贝叶斯学习
我们将 TCN 预测器的训练置于贝叶斯框架中,在可训练参数(即卷积权重 \(w\))上放置一个概率分布。贝叶斯训练的动机在于数据的有限性和异质性、量化预测不确定性的需求,以及架构选择需对过于自信的数据拟合具有鲁棒性的要求。在我们的特定问题中,训练是基相似文章
Neural Bayesian Sequential Routing
介绍了神经贝叶斯顺序路由(NBSR),这是一个将神经推理建模为有向无环图(DAG)上的顺序证据积累的框架,使用狄利克雷-分类共轭更新,实现了不确定性量化、早期退出和资源理性推理。
UASPL:基于证据神经网络的不确定性感知自步学习
本文提出UASPL,一种将预测可靠性融入自步学习样本选择的方法,使用证据神经网络,提升了分类性能和可解释性。
ELVAE:基于证据学习的变分自编码器用于不确定性感知生成
介绍了ELVAE,一种采用证据学习的VAE,通过正态-逆伽马后验对潜在坐标进行建模,以获得显式的不确定性估计。在MNIST上的实验表明,类内不确定性排序可以对合成样本的可靠性和压力测试进行分层,但结果需要按类别归一化,且在不同随机种子间存在差异。
面向交通预测的神经架构搜索:方法、挑战与未来方向综述
本综述回顾了应用于交通预测的神经架构搜索(NAS)方法,按照搜索策略(基于梯度的方法、进化方法、单次权重共享方法)进行组织,并讨论了计算可扩展性、跨城市泛化以及未来方向等挑战。
Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?
The paper investigates whether retrieving more evidence helps visual retrieval-augmented generation with diffusion language models, finding that unconditionally expanding evidence hurts accuracy due to semantic conflict, and proposes a training-free Entropy-Based Candidate Filter (ECF) to selectively admit evidence, improving accuracy across benchmarks.