ATHENA:知识引导的代理神经架构搜索,用于基于AutoFormer的电子健康记录建模
摘要
ATHENA是一个知识引导的代理神经架构搜索框架,通过跨医院重用架构知识来自动化Transformer基础的电子健康记录建模,以减少人工调优。
arXiv:2608.21712v1 公告类型:新
摘要:基于Transformer的模型广泛用于电子健康记录(EHR)的临床预测,但其架构仍需大量人工调优,且最优配置可能因任务和医院而异。神经架构搜索(NAS)自动化架构设计,但对于基于Transformer的EHR模型,传统方法计算成本高昂。最近的大语言模型(LLM)引导的NAS方法减少了人工搜索设计,但通常独立进行每次搜索,未跨医院重用架构知识。在本研究中,我们提出ATHENA(用于EHR神经架构搜索的跨医院代理迁移),一个知识引导的代理NAS框架,用于基于Transformer的EHR建模。ATHENA使用权重共享超网,每个医院预训练一次,允许候选架构实例化为继承子网络,并通过微调而非独立预训练进行评估。它还引入了两层跨医院架构先验。第一层基于任务描述符从源站点检索高性能架构示例,第二层使用基于SHapley加性解释(SHAP)的元回归估计架构组件的效果。这些先验指导多代理LLM搜索,并结合目标医院的验证反馈。在六个临床预测任务和两个独立医疗系统中,ATHENA在搜索预算为30时,在12次医院-任务评估中有9次匹配或优于四个NAS基线。它还显示出跨重复搜索的更一致的架构选择。ATHENA为减少基于Transformer的EHR建模中的手动架构调优提供了实用方法。代码公开可用:https://github.com/GatorAIM/ATHENA。
查看缓存全文
缓存时间: 2026/08/25 04:23
# ATHENA:用于AutoFormer电子健康记录建模的知识引导智能体神经架构搜索
来源:https://arxiv.org/html/2608.21712
\[orcid=0009\-0004\-7039\-7303\] \[orcid=0000\-0002\-8036\-2110\]
德亿·李 (lilideyi@ufl\.edu),组织=佛罗里达大学医学院健康结局与生物医学信息学系,城市=盖恩斯维尔,州=佛罗里达,国家=美国
凌瑶·李,组织=亚利桑那大学信息科学学院,城市=图森,州=亚利桑那,国家=美国
田胜·王,组织=休斯顿大学药学院药物健康结局与政策系,城市=休斯顿,州=得克萨斯,国家=美国;组织=北卡罗来纳大学教堂山分校吉勒斯全球公共卫生学院流行病学系,城市=教堂山,州=北卡罗来纳,国家=美国
沐轩·梁,组织=德克萨斯大学MD安德森癌症中心生物统计系,城市=休斯顿,州=得克萨斯,国家=美国
梅·刘 (mei\.liu@ufl\.edu)
###### 摘要
基于Transformer的模型已广泛用于电子健康记录(EHR)的临床预测,但其架构仍需大量手动调优,且最优配置可能因任务和医院而异。神经架构搜索(NAS)可自动化架构设计,但传统方法对于基于Transformer的EHR模型计算成本高昂。近期基于大语言模型(LLM)的NAS方法减少了手动搜索设计,但通常独立执行每次搜索,未在不同医院间重用架构知识。本研究提出ATHENA(跨医院EHR神经架构搜索的智能体迁移),这是一个面向基于Transformer的EHR建模的知识引导智能体NAS框架。ATHENA采用权重共享超网络,每个医院仅需预训练一次,允许候选架构作为继承子网络实例化,并通过微调而非独立预训练进行评估。该框架还引入两层跨医院架构先验:第一层根据任务描述从源站点检索高性能架构示例,第二层通过基于SHapley加性解释(SHAP)的元回归估计架构组件的影响。这些先验与目标医院的验证反馈共同指导多智能体LLM搜索。在六项临床预测任务和两个独立医疗系统中,ATHENA在30次搜索预算的12项医院-任务评估中有9项达到或超过四种NAS基线性能,并在重复搜索中表现出更一致的架构选择。ATHENA为降低基于Transformer的EHR建模中的手动架构调优提供了一种实用方法。代码公开于 https://github.com/GatorAIM/ATHENA。
###### 关键词
电子健康记录,临床预测建模,神经架构搜索,知识迁移,多智能体系统
††贡献:概念构思,数据管理,形式分析,方法研究,方法论,软件开发,可视化,撰写初稿
††贡献:概念构思,数据管理,形式分析,方法研究,方法论,撰写初稿
††贡献:验证,撰写初稿
††贡献:验证,撰写初稿
††贡献:验证,撰写初稿
††贡献:概念构思,资金获取,项目管理,资源提供,监督指导,验证,撰写初稿
††通讯作者:通讯作者
††通讯作者:通讯作者
††这些作者对本工作贡献均等
## 1 引言
大规模电子健康记录(EHR)数据的日益普及推动了能够直接从常规收集的临床记录中学习预测模式的模型开发\[37 (https://arxiv.org/html/2608.21712#bib.bib38)\]。深度学习已成为这些任务的标准方法,基于Transformer的模型因其捕捉患者纵向记录中医疗事件间依赖关系的能力而日益普及\[30 (https://arxiv.org/html/2608.21712#bib.bib39)\]。一种常见的两阶段范式是在大规模EHR数据上预训练Transformer主干网络以学习可泛化的临床模式,然后通过微调使模型适应特定任务目标\[28 (https://arxiv.org/html/2608.21712#bib.bib3),43 (https://arxiv.org/html/2608.21712#bib.bib8),27 (https://arxiv.org/html/2608.21712#bib.bib12),19 (https://arxiv.org/html/2608.21712#bib.bib16)\]。尽管取得了这些进展,用于EHR建模的Transformer架构仍主要通过手动设计确定,依赖于先前经验和反复试验。最优架构可能因预测任务和医疗系统而异,因为队列组成、临床工作流程和结局特征的差异可能偏好不同的架构配置\[17 (https://arxiv.org/html/2608.21712#bib.bib40)\]。因此,单一手动设计的架构可能无法在所有任务和站点表现一致,而为每个新设置手动重新设计架构计算成本高昂,且无法系统地利用从先前设置中获得的知识。神经架构搜索(NAS)通过将架构设计视为预定义搜索空间上的优化问题来解决此问题\[31 (https://arxiv.org/html/2608.21712#bib.bib41),8 (https://arxiv.org/html/2608.21712#bib.bib45)\]。经典NAS方法,包括强化学习\[48 (https://arxiv.org/html/2608.21712#bib.bib42)\]、进化算法(EA)\[29 (https://arxiv.org/html/2608.21712#bib.bib43)\]、可微搜索\[23 (https://arxiv.org/html/2608.21712#bib.bib24)\]和贝叶斯优化\[16 (https://arxiv.org/html/2608.21712#bib.bib44)\]已成功应用于视觉任务。然而,评估每个候选架构可能需要大量训练。这对基于Transformer的EHR建模尤其成问题,因为在大型纵向EHR数据集上的预训练可能主导模型开发的计算成本\[28 (https://arxiv.org/html/2608.21712#bib.bib3)\]。权重共享NAS通过训练单个过参数化的超网络来降低此成本,该超网络的子网络共享参数,允许候选架构作为继承子网络实例化并通过微调进行评估,而非从头独立预训练\[12 (https://arxiv.org/html/2608.21712#bib.bib22)\]。这使得权重共享NAS特别适合基于Transformer的EHR模型架构搜索。近期研究也探索了使用大语言模型(LLM)引导NAS\[14 (https://arxiv.org/html/2608.21712#bib.bib46),47 (https://arxiv.org/html/2608.21712#bib.bib34),22 (https://arxiv.org/html/2608.21712#bib.bib47),34 (https://arxiv.org/html/2608.21712#bib.bib31)\]。给定任务描述、搜索空间和计算预算,LLM可提出新的架构配置,为手动设计的搜索启发式方法提供了灵活替代。然而,现有LLM引导方法通常将每次搜索视为独立的优化问题。当架构搜索在临床任务或医疗系统间重复时,先前搜索的信息未被明确保留为可重用的先验。因此,即使相关任务或站点已被探索,每次新搜索仍需通过自身评估重新发现有用的架构模式。本研究提出ATHENA(跨医院EHR神经架构搜索的智能体迁移),这是一个面向基于Transformer的EHR建模的知识引导智能体NAS框架。ATHENA通过权重共享评估和跨医院架构先验解决上述两个限制。具体而言,我们构建了AutoFormer风格的超网络\[3 (https://arxiv.org/html/2608.21712#bib.bib15)\],该网络为每个医院预训练一次并在架构搜索全程重用,允许每个候选架构继承相应的子网络权重,并通过微调而非独立预训练进行评估。ATHENA将多智能体LLM搜索与两层先验相结合,以迁移先前研究医院的架构知识。第一层根据任务描述从源站点检索高性能架构,第二层通过基于SHapley加性解释(SHAP)的元回归估计架构组件的影响。这些组件共同允许搜索建立在先前观察到的架构模式上,而非将每个医院-任务对视为独立的优化问题。在六项临床预测任务和两个独立医疗系统中,与传统独立预训练和微调相比,ATHENA在架构评估中最高实现了15.3倍加速。在有限搜索预算下,ATHENA达到或超过传统和LLM引导的NAS基线,同时在重复搜索中表现出更一致的架构选择。
## 2 相关工作
### 2.1 基于Transformer的EHR建模
EHR数据的纵向和不规则特性使得患者轨迹建模极具挑战性。Transformer架构\[35 (https://arxiv.org/html/2608.21712#bib.bib11)\]因其捕捉纵向临床事件间依赖关系的能力而被广泛用于EHR建模。BEHRT\[21 (https://arxiv.org/html/2608.21712#bib.bib2)\]将医疗代码表示为标记,并使用Transformer编码器建模纵向患者历史,而Med-BERT\[28 (https://arxiv.org/html/2608.21712#bib.bib3)\]证明了大规模预训练在数百万患者记录上的有效性。后续工作将更丰富的时间和临床信息纳入基于Transformer的EHR模型。CEHR-BERT\[26 (https://arxiv.org/html/2608.21712#bib.bib7)\]引入时间感知嵌入和辅助学习目标,而Hi-BEHRT\[20 (https://arxiv.org/html/2608.21712#bib.bib21)\]采用分层架构捕捉扩展患者历史中的长程依赖关系。近期研究探索了传统仅编码器设计之外的Transformer架构。TransformEHR\[43 (https://arxiv.org/html/2608.21712#bib.bib8)\)采用编码器-解码器架构与生成式预训练目标进行纵向临床建模,而Foresight\[18 (https://arxiv.org/html/2608.21712#bib.bib19)\)采用GPT式自回归预训练建模患者轨迹。CLMBR\[39 (https://arxiv.org/html/2608.21712#bib.bib20)\]通过自回归下一代码预测学习可迁移的患者表示。这些研究共同证明了预训练和上下文化表示学习对临床预测的价值。尽管取得了这些进展,基于Transformer的EHR模型架构仍主要手工设计,模型配置通常通过手动调优或有限超参数搜索选择。这一局限性推动了使用NAS系统化探索用于下游临床预测任务的Transformer架构。
### 2.2 医疗模型的NAS
NAS通过定义搜索空间、搜索策略和性能评估方案\[38 (https://arxiv.org/html/2608.21712#bib.bib23)\]实现架构设计自动化。近期进展,包括基于梯度的优化\[23 (https://arxiv.org/html/2608.21712#bib.bib24)\]和权重共享超网络方法\[12 (https://arxiv.org/html/2608.21712#bib.bib22)\],已大幅降低架构搜索的计算成本。NAS也通过Evolved Transformer\[32 (https://arxiv.org/html/2608.21712#bib.bib25)\]、HAT\[36 (https://arxiv.org/html/2608.21712#bib.bib26)\]、NAS-BERT\[40 (https://arxiv.org/html/2608.21712#bib.bib27)\]、AutoBERT-Zero\[11 (https://arxiv.org/html/2608.21712#bib.bib28)\]和Primer\[33 (https://arxiv.org/html/2608.21712#bib.bib29)\]等方法扩展到Transformer架构。然而,这些方法主要针对自然语言和视觉任务开发,未明确考虑纵向EHR数据的特性。在医疗领域,NAS主要应用于医学成像\[1 (https://arxiv.org/html/2608.21712#bib.bib30),34 (https://arxiv.org/html/2608.21712#bib.bib31)\]和多模态学习\[42 (https://arxiv.org/html/2608.21712#bib.bib32),6 (https://arxiv.org/html/2608.21712#bib.bib33)\]。对于结构化EHR数据,现有工作主要集中在模态融合和多任务预测。MUFASA\[42 (https://arxiv.org/html/2608.21712#bib.bib32)\]和AutoFM\[6 (https://arxiv.org/html/2608.21712#bib.bib33)\]搜索模态特定架构和融合策略以整合纵向EHR记录与临床笔记,近期研究也探索了用于多任务疾病预测的NAS\[6 (https://arxiv.org/html/2608.21712#bib.bib33)\]。据我们所知,现有EHR NAS方法主要针对融合或任务共享结构,而非Transformer主干的内部架构。因此,针对不同临床预测任务定制的Transformer主干架构搜索在很大程度上尚未被探索。
### 2.3 LLM驱动的NAS
近期研究探索了使用LLM进行NAS,利用预训练中编码的架构知识生成和优化候选架构。早期研究表明,LLM可在NAS流程中充当架构生成器或搜索控制器。GENIUS\[47 (https://arxiv.org/html/2608.21712#bib.bib34)\]将LLM作为黑盒架构优化器,通过自然语言交互迭代提出和优化候选架构,而EvoPrompting\[2 (https://arxiv.org/html/2608.21712#bib.bib35)\]将基于LLM的变异和交叉算子整合到进化搜索框架中。后续工作进一步将LLM推理与传统搜索策略结合。GPT-NAS\[45 (https://arxiv.org/html/2608.21712#bib.bib36)\]将GPT引导的架构生成与进化优化耦合,而LLMatic\[25 (https://arxiv.org/html/2608.21712#bib.bib37)\]将基于LLM的代码生成与质量多样性搜索结合,以发现多样且鲁棒的神经架构。LLM驱动的NAS在医疗领域的应用仍然有限,主要集中在医学成像。例如,近期用于组织病理学诊断的框架使用LLM迭代优化一次性NAS流程的搜索空间,从而能够发现跨多个病理任务的轻量级和可迁移模型\[34 (https://arxiv.org/html/2608.21712#bib.bib31)\]。尽管取得了这些进展,LLM驱动的NAS尚未被系统探索用于纵向EHR建模。此外,现有方法通常将每次架构搜索视为独立的优化问题,未明确重用跨相关临床任务或医疗系统的先前搜索架构知识。ATHENA通过结合多智能体LLM搜索与检索到的高性能架构及跨医院架构效应先验,扩展了这一新兴范式,用于基于Transformer的EHR模型设计。
## 3 方法
### 3.1 概述
ATHENA是面向EHR Transformer知识引导NAS的两阶段框架(图1 (https://arxiv.org/html/2608.21712#S3.F1)\)。设\(\mathcal{S}\)表示源医院,\(H\)为目标保持医院,\(\mathcal{T}\)为临床预测任务。目标医院被排除相似文章
GRAFT-ATHENA:用于自主发现和进化数值算法的自我改进智能体团队
本文介绍了 GRAFT-ATHENA,这是一个自我改进的智能体框架,能够自主发现并进化用于解决科学问题的数值算法。它在物理信息机器学习基准测试中展示了接近机器精度的准确率,并成功应对了复杂的工程挑战。
代理式神经架构发现:AIRA-Compose与AIRA-Design
本文介绍了AIRA-Compose和AIRA-Design,这两个双重框架利用AI智能体自主发现超越标准Transformer且高效扩展的神经架构。
AutoMedBench:迈向基于智能体AI模型的医学自动研究
AutoMedBench是一个面向自主医学AI研究工作流的基准测试,评估智能体在五个阶段中处理多种医学影像任务的表现。阶段级评分显示,验证阶段最弱,凸显了智能体工作流中可靠验证的必要性。
MiGHT-EHR:面向异质时序电子健康记录的多任务图变换器
本文介绍了MiGHT-EHR,一种针对异质时序EHR数据的多任务图变换器,联合建模临床实体、时间轨迹和任务依赖。在MIMIC-III和MIMIC-IV上,它在药物推荐、住院时长、死亡率和再入院预测方面均优于现有最先进方法。
智能体神经架构搜索
介绍AgentNAS,一种利用大语言模型(LLM)生成初始架构并将其分解为槽位架构的机制,从而为传统神经架构搜索(NAS)定义任务特定的搜索空间,在17项任务中的11项上取得了最先进的结果。