HantaWatch:基于联邦学习的汉坦病毒基因组监测
摘要
HantaWatch 是一个用于汉坦病毒基因组监测的联邦学习框架,能够在不共享原始数据的情况下协作训练基于序列的模型,集成了k-mer特征提取和自适应优化,以支持风险筛查和专家优先排序。
arXiv:2607.16234v1 Announce Type: new
摘要:汉坦病毒基因组监测受限于序列数据的分布、非独立同分布的来源异质性以及有限的专家审核能力。我们提出 HantaWatch,这是一个联邦学习框架,使实验室和监测站点能够在不共享原始数据的情况下协作训练基于序列的模型。HantaWatch 集成了k-mer特征提取、感知来源的联邦客户端构建、自适应DU-FedProx优化、监测特定模型选择以及仅预测分类。在二分类和多分类任务上的实验表明,HantaWatch 支持高风险筛查、疫情相关预测、进化枝分类和临床综合征分类,同时平衡预测性能、假阴性风险和更新稳定性。该框架将模型输出转换为风险评分、置信度估计、不确定性标志和排序后的专家审核优先级。因此,HantaWatch 为去中心化的汉坦病毒监测提供了实用的联邦决策支持层,支持专家优先排序,而不取代实验室或公共卫生解释。
查看缓存全文
缓存时间: 2026/07/21 06:46
# HantaWatch:汉坦病毒基因组监测的联邦学习 来源:https://arxiv.org/html/2607.16234 Shanika Iroshi Nanayakkara 和 Shiva Raj Pokhrel,作者来自澳大利亚迪肯大学信息技术学院,吉朗;邮箱:s222112938@deakin\.edu\.au, shiva\.pokhrel@deakin\.edu\.au ###### 摘要 汉坦病毒基因组监测受到分布式序列数据、非独立同分布(non-IID)的源异质性以及有限的专家审查能力的限制。我们提出 HantaWatch,一个联邦学习框架,使实验室和监测站点能够在不共享原始数据的情况下协作训练基于序列的模型。HantaWatch 集成了 k-mer 特征提取、源感知的联邦客户端构建、自适应 DU-FedProx 优化、监测特定的模型选择以及仅预测的分诊。在二分类和多分类任务上的实验表明,HantaWatch 支持高风险筛查、疫情相关预测、分支分类和临床综合征分类,同时平衡了预测性能、假阴性风险和更新稳定性。该框架将模型输出转换为风险评分、置信度估计、不确定性标记和排序后的专家审查优先级。因此,HantaWatch 为去中心化的汉坦病毒监测提供了一个实用的联邦决策支持层,在不取代实验室或公共卫生解释的情况下支持专家优先级排序。 ## I 引言 汉坦病毒[15 (https://arxiv.org/html/2607.16234#bib.bib32)]是由啮齿动物传播的人畜共患病毒,可导致严重的人类疾病,包括汉坦病毒肺综合征、汉坦病毒心肺综合征和肾综合征出血热。尽管感染频率低于许多呼吸道疾病,但它们构成了低频次、高影响的公共卫生威胁[4 (https://arxiv.org/html/2607.16234#bib.bib34)]。由于病例在地理上分散,与生态宿主相关,并受不同病毒谱系、宿主和区域传播模式的影响,监测仍然困难。早期检测因非特异性症状与其他发热或呼吸道疾病相似而进一步复杂化。因此,及时的临床怀疑、实验室确认、支持性护理和协调的公共卫生应对仍然至关重要[21 (https://arxiv.org/html/2607.16234#bib.bib30)]。 参见图注 图 1:汉坦病毒联邦学习问题。在标准聚合下,监测元数据和标签分布导致客户端漂移、更新不稳定、聚合不匹配以及假阴性增加。 基因组和分子监测能够进行序列层面的筛查、病原体分类、谱系监测和基于元数据的风险评估。公共数据库和精选的汉坦病毒基因组数据集为计算监测建模提供了宝贵资源[17 (https://arxiv.org/html/2607.16234#bib.bib33)]。序列衍生表示,特别是 k-mer 特征,允许机器学习模型在不进行完全手动比对的情况下捕获判别性核苷酸模式[28 (https://arxiv.org/html/2607.16234#bib.bib29), 19 (https://arxiv.org/html/2607.16234#bib.bib35)]。这些模型可以支持高致病性筛查、疫情相关预测、宿主相关分类、分支分类和临床综合征分类。 然而,操作性的监测不仅仅需要序列分类。新的记录可能来自多个实验室、数据库、区域和监测站点,而专家审查能力仍然有限。关键的操作性问题不仅是模型预测什么,而是哪些记录应该优先审查以及为什么。高风险类、疫情相关类、临床相关、低置信度或非典型序列可能需要加速的专家检查。因此,一个有效的监测系统应生成预测标签,同时提供风险评分、置信度估计、不确定性指标、审查理由和优先级排序。 现有的基因组监测工作流程为序列检索、相似性搜索、系统发育解释、分类、可视化和疫情调查提供了基本能力[17 (https://arxiv.org/html/2607.16234#bib.bib33)]。然而,它们没有完全解决在分布式和非独立同分布监测条件下,对新提交的汉坦病毒记录进行联邦化、自适应和不确定性感知的优先级排序。实际上,原始序列和元数据通常由不同的实验室、机构、数据库或单位持有,集中化可能受到治理、隐私、操作和结构性限制。此外,客户端可能在宿主分布、分支组成、基因组片段、疫情历史、元数据完整性和采样偏差方面存在差异,自然地创造了一个非独立同分布的联邦学习环境。 联邦学习 (FL)[1 (https://arxiv.org/html/2607.16234#bib.bib3)]非常适合这种场景,因为它允许协作模型训练,同时将原始数据保留在本地[16 (https://arxiv.org/html/2607.16234#bib.bib38), 23 (https://arxiv.org/html/2607.16234#bib.bib2)]。FedAvg[18 (https://arxiv.org/html/2607.16234#bib.bib36)] 提供了标准的模型平均基线 FL,但异构客户端在其数据分布不同时可能产生冲突的本地更新。FedProx[16 (https://arxiv.org/html/2607.16234#bib.bib38)] 通过近端正则化部分缓解了这个问题,然而固定的学习率、近端系数和本地轮次调度在变化的监测客户端和轮次中可能仍然不够充分。在风险敏感的基因组监测中,这种不稳定性至关重要:一个模型可能达到高准确率,同时漏掉罕见但重要的监测阳性记录。 图 1 (https://arxiv.org/html/2607.16234#S1.F1) 说明了本工作解决的核心挑战。异构的监测客户端导致客户端漂移和不稳定的本地优化,降低了标准聚合方法的可靠性。因此,一个实用的汉坦病毒监测框架必须解决两个耦合问题:在非独立同分布序列分布下的鲁棒联邦学习,以及用于专家审查优先级排序的可靠决策支持。 为了解决这些挑战,我们引入了 HantaWatch,一个用于汉坦病毒序列筛查、模型适用性评估和专家审查优先级排序的联邦基因组监测框架。HantaWatch 支持从分布式序列记录进行任务特定的模型训练、候选联邦策略的比较、基于适用性的模型选择以及对新序列批次进行仅预测分析。它不是一个自主的诊断或致病性确定系统;相反,它是一个决策支持层,优先排序用于实验室、分子、系统发育、临床或流行病学审查的记录。 本工作的主要贡献如下: - • 我们将汉坦病毒基因组监测表述为一个去中心化的联邦学习问题,用于专家审查优先级排序,而不集中原始序列数据。 - • 我们引入了 HantaWatch,一个联邦监测支持框架,生成预测标签、风险评分、不确定性标记、审查理由和排序后的专家审查优先级。 - • 我们设计了源感知的非独立同分布客户端构建,以捕获跨宿主、分支、基因组片段、疫情背景、临床标签、元数据质量和数据源的现实异质性。 - • 我们提出了一种自适应深度展开 FedProx 控制器,将客户端状态映射到本地学习率、近端系数和轮次调度,以减少客户端漂移。 - • 我们开发了一个监测特定的模型选择层,基于召回率、假阴性率、F1 分数、AUC、宏平均指标和更新稳定性,而不仅仅是准确率。 我们在二分类和多分类汉坦病毒监测任务上评估了 HantaWatch,包括高致病性筛查、疫情相关预测、分支分类和临床综合征分类,在受控的非独立同分布和源代表性的联邦设置下。我们证明了 HantaWatch 可以将训练好的联邦模型转换为仅预测的专家审查工作流程,从而支持高风险、临床相关、疫情相关或不确定记录的优先级排序,同时保留人类专家在最终解释中的角色。 HantaWatch 的核心方法组件是一个用于自适应联邦优化的深度展开 FedProx 控制器。而不是使用固定的本地训练设置,HantaWatch 将联邦过程展开到通信轮次中,并将客户端级别的状态——包括先前的损失、梯度范数、更新范数、类别不平衡和轮次索引——映射到自适应控制。这些控制决定了本地学习率 η\\eta、近端系数 μ\\mu 和本地轮次数量 EE,使每个客户端能够根据本地异质性和更新稳定性调整其训练行为。 HantaWatch 还将本地优化器视为监测工作流程的可配置组件。候选联邦方法通过优化器设置(如 SGD、Adam、AdamW 和 RMSProp)进行评估,允许框架评估收敛性、预测性能、假阴性风险和更新稳定性。这避免了将性能提升归因于单个有利的优化器配置,并加强了方法级别的评估。 ## II 相关工作 基因组监测已成为病原体监测的核心,因为它支持序列水平的分类、谱系追踪、疫情调查以及分子与流行病学证据的整合[12 (https://arxiv.org/html/2607.16234#bib.bib8)]。测序监测通过提供对病原体多样性、传播动态和新变异株更高分辨率洞察,补充了传统流行病学[26 (https://arxiv.org/html/2607.16234#bib.bib7), 12 (https://arxiv.org/html/2607.16234#bib.bib8), 10 (https://arxiv.org/html/2607.16234#bib.bib11)]。对于汉坦病毒,基因组和系统发育分析尤其重要,因为病毒多样性受宿主、地理、基因组片段和区域循环模式的塑造。最近对汉滩病毒的研究进一步证明了基因组监测在描述正汉坦病毒多样性和指导公共卫生应对方面的价值[22 (https://arxiv.org/html/2607.16234#bib.bib9), 20 (https://arxiv.org/html/2607.16234#bib.bib10)]。 几个基因组监测平台为病原体分析提供了重要能力。HantaNet,在 MicrobeTrace 内实现,支持精选的汉坦病毒参考数据、分类、基因组流行病学、系统发育可视化、绘图、网络分析和仪表板[8 (https://arxiv.org/html/2607.16234#bib.bib4), 6 (https://arxiv.org/html/2607.16234#bib.bib5), 25 (https://arxiv.org/html/2607.16234#bib.bib6)]。更广泛的平台如 Nextstrain、Pathogenwatch 和 NCBI Virus 支持实时病原体进化分析、基因组上传与解读、亲缘关系评估、分型或谱系分析,以及大规模病毒序列检索[14 (https://arxiv.org/html/2607.16234#bib.bib12), 3 (https://arxiv.org/html/2607.16234#bib.bib14), 2 (https://arxiv.org/html/2607.16234#bib.bib13), 13 (https://arxiv.org/html/2607.16234#bib.bib16), 5 (https://arxiv.org/html/2607.16234#bib.bib15)]。类似地,工具和倡议如 Nextclade、Pangolin、UShER、COG-UK、CDC SPHERES、WHO 基因组监测框架和 CoV-Spectrum 支持质量评估、分支或谱系分配、系统发育放置、测序协调、元数据整合和变异监测[27 (https://arxiv.org/html/2607.16234#bib.bib26), 9 (https://arxiv.org/html/2607.16234#bib.bib27), 11 (https://arxiv.org/html/2607.16234#bib.bib28), 21 (https://arxiv.org/html/2607.16234#bib.bib30), 7 (https://arxiv.org/html/2607.16234#bib.bib31)]。 尽管有这些进展,现有系统主要侧重于集中式或上传的序列分析、系统发育解释、谱系分配、可视化和公共卫生协调。它们没有直接解决来自分布式汉坦病毒序列持有者的联邦学习问题,其中原始数据可能保留在本地机构、治理或操作控制之下。此外,它们没有提供一种自适应的非独立同分布学习机制,将源异构模型训练与新提交记录的不确定性感知优先级排序联系起来。 HantaWatch 通过用联邦专家审查优先级排序层补充现有基因组监测基础设施来填补这一空白。与 HantaNet、MicrobeTrace、Nextstrain、Pathogenwatch 及相关平台不同,HantaWatch 旨在支持分布式模型训练、源感知的非独立同分布适应、监测特定的模型适用性评估、不确定性感知分诊,以及针对新汉坦病毒序列的排序专家审查输出。 参见图注 图 2:HantaWatch:用于汉坦病毒监测和专家审查优先级排序的联邦学习框架 ## III 提出的 HantaWatch 方法论 ### III-A 不确定性感知的决策支持与专家分诊 在高后果的生物医学和公共卫生环境中,模型预测不应被视为自主决策。越来越多的研究认识到不确定性估计、分布外检测和决策支持设计对于建立可信机器学习的重要性。在生物信息学中,分布外学习尤为相关,因为基因组序列可能由于罕见谱系、不完整采样、测序人工制品、宿主转换或有限的参考覆盖而偏离训练分布。在临床和生物医学人工智能中,不确定性感知系统通常被概念化为支持而非取代专家决策的工具。 这一观点直接适用于 HantaWatch。高风险预测不应被视为致病性的确凿证据,低置信度预测也不应被忽视。相反,HantaWatch 将预测转换为专家审查优先级。被识别为高风险类、疫情相关类、临床相关或不确定的记录被标记为加速专家审查,而常规记录被分配到标准监测工作流程。该框架通过生成风险评分、置信度值、不确定性标记、审查理由和排序后的优先级输出来支持专家工作负载的分配。 ### III-B HantaWatch 的定位 所提出的框架位于基因组监测平台、病毒序列机器学习、联邦生物医学学习、非独立同分布优化和不确定性感知关键方面的交叉点。现有系统处理病原体监测的关键方面,如序列检索、系统发育分析、公共卫生、分类和公共卫生报告。然而,据我们所知,当前的汉坦病毒和病原体监测工具不提供联邦非独立同分布学习、DU-FedProx 自适应优化、模型适用性评估、不确定性感知审查优先级排序以及面向用户的新序列分诊的特定组合。HantaWatch 通过将分布式汉坦病毒序列学习转化为一个操作性的专家审查优先级工作流程来填补这一空白。 现有工具有利于基因组序列的组织、过滤、分类和可视化。HantaWatch 引入了
相似文章
LDARNet:用于基因组建模的具有可学习分词的DNA自适应表示网络
LDARNet 是一个拥有1.2亿参数的层次化基因组基础模型,引入了可学习的自适应分词机制(灵感来源于 H-Net 的动态分块),用于DNA序列的掩码语言建模。该模型在5项组蛋白修饰任务上取得了最先进的结果,并在多项基因组基准测试中超越了参数量多达其20倍的模型。其学习到的分词边界与启动子motif和剪接位点等生物学特征高度吻合。
医疗中的联邦生存分析:跨机构异质性乳腺癌数据的多模型评估
本文系统评估了联邦学习下三种生存模型(Cox、DeepSurv、RSF)在异质性乳腺癌数据上的表现,发现联邦学习优于本地训练,且RSF在各客户端间提供了最佳性能平衡。
OpenMHC:加速可穿戴基础模型科学研究
OpenMHC推出了最大的开放获取可穿戴健康数据集,包含超过6000万小时的数据,并提供了可穿戴基础模型的开源实现,包括用于预测、插补和时序预测的统一基准测试。
用于目标检测的联邦学习:无需集中数据即可实现协作无人机学习
将联邦学习应用于无人机编队的目标检测,无需集中航拍图像即可实现协作训练,在保护隐私和降低带宽的同时,性能接近集中式训练。
用于网络异常检测的混合潜变量-结构融合(HLSF)
提出混合潜变量-结构融合(HLSF),一种加权异常融合框架,结合CP-APR结构异常分数与来自归一化流的隐空间密度分数,在真实受损用户凭证数据上提升了网络异常检测性能。