基础智能体遇见智能深度研究:基于证据的临床代码预测
摘要
本文介绍了ICD-Deepresearch,一个结合EHR基础模型与语言模型及医学搜索的系统,用于预测患者就诊的未来ICD代码,实现了比基线方法更高的准确性和医生评价的有用性。
arXiv:2608.17075v1 Announce Type: new
摘要:下一次就诊ICD预测从预先可用的纵向记录中预测未来就诊将记录哪些标准化诊断代码。该任务是前瞻性和多标签的:目标笔记尚不存在,且多个代码可能正确。结构化EHR基础模型捕获复发和时间进展,而语言基础模型生成灵活的诊断假设。我们介绍ICD-Deepresearch,一个将这些预测性基础模型与医学搜索和ICD字典组合的DeepResearch工作流。由于没有来源揭示未来代码集,研究在固定top-K预算下通过链接患者证据、外部临床关系和精确代码语义来评估候选转换。候选生成使用SparseEHR生成一个EHR先验,该先验初始化两个有界的Research Expansion轮次;一个独立的GPT-5 Direct Forecast提供补充候选。最终选择验证、去重并联合排名两条路径,之后一个单独模块在不改变预测的情况下编写理由。最后,ICD-Deepresearch在MIMIC-III上实现了24.60/35.09%的患者平均精确度/召回率,在MIMIC-IV上实现了25.14/48.32%。医生评价51%和68%其检索的文档有用,相比之下,独立的GPT-5网络搜索为22%和39%,Medical Deep Research为32%和41%。因此,ICD-Deepresearch改进了注册的本地比较器,同时检索到的证据具有比独立研究系统更高的医生评价有用性。
查看缓存全文
缓存时间: 2026/08/19 09:46
# 基础模型遇见智能深度研究:基于循证的临床代码预测
来源:https://arxiv.org/html/2608.17075
作者:Meysam Ghaffari、Akshat Choube、Mohsen Sharifi Renani、Hong Yu、Carlos Morato
###### 摘要
下一次就诊ICD预测是指根据已有的纵向记录,预测未来就诊中会记录哪些标准化诊断代码。该任务具有前瞻性和多标签特性:目标就诊记录尚未存在,且可能有多个正确的诊断代码。结构化电子健康记录基础模型能捕捉复发模式和时序进展,而语言基础模型则能生成灵活的诊断假设。我们推出了ICD-Deepresearch,这是一个将预测性基础模型与医学搜索和ICD词典相结合的深度研究工作流。由于没有任何来源能直接揭示未来的代码集,该研究通过结合患者证据、外部临床关系和精确代码语义,在固定的top-K预算下评估候选转换。
候选生成使用SparseEHR生成电子健康记录先验,该先验初始化两个有界的研究扩展轮次;独立的GPT-5直接预测则提供补充候选。最终选择阶段对两条路径的候选进行验证、去重和联合排序,随后由单独的模块生成推理说明,而不改变预测结果。最终,ICD-Deepresearch在MIMIC-III数据集上实现了24.60%/35.09%的患者平均精确率/召回率,在MIMIC-IV数据集上达到25.14%/48.32%。医师评估认为其检索文档的有用率分别为51%和68%,相比之下,独立GPT-5网络搜索的有用率为22%和39%,Medical Deep Research的有用率为32%和41%。因此,ICD-Deepresearch在性能上优于已注册的本地对比系统,并且检索到的证据具有比独立研究系统更高的医师评定有用率。代码将在论文接收后公开。
## 1 引言
电子健康记录随门诊就诊和住院过程不断积累。每次就诊记录包含诊断、检查、手术操作和治疗方案,因此形成的记录描述的是纵向轨迹而非单一临床状态。医院使用国际疾病分类代码来记录已标注的诊断,这些标准化标识符用于疾病分类、报告和报销。
我们研究**下一次就诊ICD预测**:给定患者截至就诊t的记录,预测在就诊t+1中可能被记录的代码,并返回top-K个结果。在预测时,模型仅能观察截至就诊t记录的信息;无法使用就诊t+1期间产生的任何信息,包括主诉症状、检查结果、新检测结果、手术操作或临床记录。目标是该次就诊中记录的完整ICD代码集。该任务具有前瞻性,因为目标超出观测窗口;同时具有多标签性,因为一次就诊可能获得多个诊断代码。
这一前瞻性任务得益于两类互补的基础模型工具:纵向电子健康记录模型从患者轨迹中学习复发和进展模式,提供患者特异性先验;语言基础模型则利用更广泛的医学知识提出额外诊断假设。这些假设可能发现遗漏的转换,但无需基于患者记录验证。在固定的top-K预算下,核心挑战是确定哪些候选需要调查、验证和保留。
这一控制问题启发了深度研究方法:智能体维护状态、规划问题、调用工具并根据证据修正假设。其中基础模型生成候选,而医学搜索和ICD词典提供转换证据和语义验证。
预测与答案检索不同,因为没有来源包含未来的代码集。外部证据可以支持某个转换或验证某个代码,但只有目标前记录才能将其锚定于患者;研究还会引入竞争相同top-K位置的候选。因此深度研究必须选择调查什么、区分患者、关系和代码证据,并在固定预算下联合选择候选。
ICD-Deepresearch围绕这些决策设计(图1)。候选生成调用SparseEHR生成电子健康记录先验,而并行的直接预测则调用GPT-5生成独立代码列表。仅电子健康记录先验初始化研究扩展,使研究议程锚定于纵向记录,同时保留语言模型候选作为独立路径。研究扩展随后执行两个有界的查询规划、检索、阅读和验证轮次,将候选与定向临床证据和精确代码语义连接起来。最终选择对两条路径的候选进行验证、去重和联合排序。支持性推理仅在预测结果确定后生成。
我们在MIMIC-III和MIMIC-IV数据集上评估了ICD-Deepresearch。它在两个评估截止点上均优于仅候选生成和独立GPT-5网络搜索,且联合选择优于孤立的候选路径和独立研究系统(包括Medical Deep Research)。医师审核进一步表明,研究扩展检索更少文档却产生更高比例的有用证据。这些结果共同表明,当深度研究控制候选扩展、证据获取和固定预算选择,而非将搜索视为检索未来答案的手段时,能有效提升预测性能。
## 2 相关工作
#### 纵向多标签预测
先前模型生成未来就诊记录,并改进复发建模、多模态鲁棒性、代码感知排序或校准。这些方法从观测记录、学习参数和静态代码资源进行预测。SparseEHR为我们的候选生成模块提供结构化电子健康记录骨干;ICD-Deepresearch通过直接生成、基于患者条件的证据获取和联合选择来增强该模块的初始候选状态。
#### 自适应检索与潜在查询搜索
自适应检索增强生成系统学习何时以及多深入地检索,而最新的研究智能体交替执行查询分解、阅读、记忆和决策更新。临床智能体检索特定诊断或决策支持。Medical Deep Research提供开源多智能体工作流,可分解医学问题并协调专用数据库、网络搜索、分析和报告生成。我们将其作为独立领域特定研究对比系统进行评估。
下一次就诊预测从轨迹开始,没有显式查询;研究扩展将患者锚点与候选转换配对,检索该关系的证据,映射到精确代码,并更新候选排序。
#### 回溯编码与前瞻解释
回溯自动编码在目标就诊记录完成后分配ICD标签;其证据来自已完成的、已描述相关诊断的记录。下一次就诊预测在不同的信息边界下操作:当预测进行时,目标就诊、其记录及其ICD代码集均不可用。前瞻解释必须将目标前记录中的证据与合理的定向临床转换及预测代码的精确语义相连接,而非将代码定义视为事件发生的证据。我们的选择后审核通过分别评估观测到的患者事实、外部临床关系、ICD语义、预测不确定性和预测集覆盖度来体现这一区别。
## 3 方法
### 系统概述
ICD-Deepresearch包含三个预测阶段,后跟单独的解释阶段(图2)。第一阶段并行运行两条候选路径:候选生成将结构化纵向记录映射为电子健康记录先验,而直接预测则将完整的目标前记录映射为独立的GPT-5代码列表。仅电子健康记录先验初始化研究扩展,该扩展恰好执行两个有界的迭代:查询规划、检索、阅读、验证和状态更新。最终选择在统一的top-K预算下验证并联合排序研究候选与直接候选。预测结果确定后,选择后解释生成支持性推理,不改变已选代码或其顺序。
### 任务、输入与输出
对于数据集d,令Ω_d表示其有效的诊断代码词汇表。患者i在保留的目标就诊前有m_i次观测就诊。可用的目标前记录为 H_i = (d_i, E_i^1, ..., E_i^{m_i}, N_i),(1) 其中 d_i 包含人口统计学信息,E_i^j 是就诊j记录的诊断和手术操作事件集合,N_i 是截止点前可用的可能为空的记录集合。其结构化部分为 H_i^{str} = (d_i, E_i^1, ..., E_i^{m_i})。目标 Y_i ⊆ Ω_d 是在保留就诊中记录的去重诊断代码集。所有推理时的生成、工具使用、排序和解释仅基于 H_i 操作。预测器返回一个有限有序列表 π_i = (π_{i1}, ...),包含词汇表内唯一的代码。所有被评估系统至少返回20个此类代码。对于 K ∈ {10, 20},精确K预测集为 Ŷ_i^{(K)} = {π_{ij} : 1 ≤ j ≤ K}。(2) 因此单个排序支持两个报告截止点的评估。
### 两条候选路径
#### 候选生成:电子健康记录先验
令 G_F 表示完整的候选生成映射。它将结构化记录转换为有限的、目标不可知的种子排序 π_i^F 及其无序候选集 B_i:π_i^F = G_F(H_i^{str}; Ω_d),B_i = set(π_i^F) ⊆ Ω_d。(3) 对于ICD-9-CM和ICD-10-CM预测,SparseEHR提供学习到的结构化电子健康记录骨干。完整映射还包括特定任务的输入构建、词汇表接口、验证和已注册的输出排序。仅候选生成控制评估此完整映射,包括SparseEHR骨干。π_i^F 中的身份和原始排序在研究扩展开始前已固定。
#### 直接预测:独立路径
令 G_D 表示GPT-5直接预测映射。它使用完整的目标前记录返回有限有序列表 D_i:D_i = G_D(H_i; Ω_d)。(4) 因此,π_i^F 和 D_i 是有序列表,而 B_i 是集合。直接预测可同时使用结构化事件和目标前记录,但其状态在最终选择前保持在研究循环之外。因此它可以贡献电子健康记录先验中缺失的假设,而不决定研究扩展调查哪些候选。
### 研究扩展
研究扩展从电子健康记录先验集 B_i 开始。对于每个假设,它保持三个信息角色分离:观测到的患者线索、关于可能临床转换的外部证据以及提议ICD代码的精确含义。一次迭代应用:规划→工具调用→阅读绑定→验证→更新排序。工具调用使用谷歌或固定的PMC/arXiv语料库;其余操作构建和更新研究状态。令 Z_i^{(r)} 表示研究迭代 r 后的候选假设、候选绑定证据记忆、支持和验证字段以及未解决方向。初始状态为 Z_i^{(0)} = (B_i, ∅),其中 ∅ 表示空的证据、验证和未解决方向字段。令 DR 表示一个固定的、已注册的研究扩展状态转移。相似文章
DeepER-Med:通过智能体AI推进医学深度循证研究
DeepER-Med引入了一个用于循证医学研究的智能体AI框架,具有明确的证据评价标准和新的基准数据集(DeepER-MedQA),包含100个专家精选的医学问题,相比生产平台表现更优,并通过真实案例的临床验证。
理解代理式ICD编码的局限性
本文评估了用于ICD-10-CM编码的神经网络、工作流和代理系统,识别了罕见和复杂编码上的失败模式,并表明工具增强的代理配置可以在特定子集上恢复性能。
EHR基础模型中ICD代码的分层建模
本文研究了在EHR基础模型中显式编码ICD-10-CM层级结构的方法,采用层级令牌增强和基于图结构的代码表示。在MIMIC-IV和eICU上的实验表明,与扁平代码表示相比,该方法在域内和跨数据集预测任务中均有改进。
DeepCode:开放式智能体编程
DeepCode 是一个完全自主的框架,用于从文档到代码库的合成,通过原则性的信息流管理将科学论文转化为生产级代码,在 PaperBench 上取得了最先进的结果,并超越了博士级人类专家。
LearnActCoder:用于自适应临床编码代理的角色感知错误记忆框架
本文介绍了LearnActCoder,一个角色感知错误记忆框架,通过将错误转化为结构化教训来适应临床编码代理,在不更新模型权重的情况下提高CPT编码性能。