在代表性不足的癫痫护理中教导LLMs进行推荐与转诊

arXiv cs.LG 论文

摘要

本文介绍了Manana,一种非参数提示学习框架,它教导LLMs在代表性不足的癫痫护理环境中推荐抗癫痫药物并转诊不确定的病例,在乌干达队列上提高了准确性,并实现了高精度的选择性预测。

arXiv:2606.31036v1 Announce Type: new 摘要:在资源受限的环境中,癫痫专科知识稀缺,这使得基于LLM的决策支持对管理长期治疗的一线临床医生具有吸引力。此类系统必须适应当地的处方实践,并知道何时转诊。我们在乌干达儿科癫痫护理中研究了这一问题,从纵向非结构化临床笔记中预测抗癫痫药物方案。标准提示与医生处方取得了非平凡的一致性,但神经科医生的审查表明,许多错误反映了分布校准不当的处方默认值,而非解析本地记录的失败。我们引入了MANANA,一种非参数提示学习框架,它从少量的患者级训练集中学习本地处方指导。MANANA将观察到的处方错误转换为可审计的提示记忆,以单智能体和多智能体变体实现,并在两个独立收集的乌干达队列上优于经典ML模型、直接LLM提示和提示优化基线。我们进一步提出了贝叶斯提示平均,它将学习到的提示轨迹转换为处方似然和基于不确定性的转诊信号。在独立收集的保留队列上,这使就诊级前三处方准确率比提示优化基线提高了4-8个百分点,并实现了选择性预测:系统可以以95%的精度自动处理最自信的一半病例,或以99%的精度处理最自信的四分之一,同时将较低置信度的病例转诊给专家审查。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:33

# 教授LLMs在代表性不足的癫痫护理中进行推荐与转诊
来源: https://arxiv.org/html/2606.31036
Shreyas Rajesh1,\*,Kartik Sharma1,\*,Tonmoy Monsoor1,Mehmet Yigit Turali1,Richard Idro3,Juliana Kayaga3,Robert Sebunya4,Tracy Tushabe Namata3,Jessica Nichole Pasqua2,Vwani Roychowdhury1,Rajarshi Mazumder2
1电气与计算机工程系,加州大学洛杉矶分校
2神经病学系,加州大学洛杉矶分校
3马凯雷雷大学
4圣弗朗西斯医院,恩桑比亚
\* 同等贡献。
![[无标题图片]](https://arxiv.org/html/2606.31036v1/figs/github_mark.png)
GitHub: github.com/roychowdhuryresearch/Manana (https://github.com/roychowdhuryresearch/Manana)

###### 摘要
在资源有限的环境中,癫痫专科专业知识稀缺,这使得基于LLM的决策支持系统对负责长期治疗管理的一线临床医生具有吸引力。这类支持系统不仅要应用医学知识,还必须适应当地的处方实践,并知道何时应转诊。当前的公共医学AI基准主要由高收入临床环境主导,低资源环境下的处方实践、药物可用性和随访模式在很大程度上未被充分体现。我们通过乌干达儿科癫痫护理中的一项多学科合作来研究这一问题。任务是利用当地临床医生在连续就诊中记录的纵向非结构化笔记来预测抗癫痫药物方案。标准提示方法与医生处方达到了非平凡的吻合度,但神经科医生对模型推理轨迹的审查表明,其错误源于与分布不匹配的处方默认值,而非当地护理环境本身。我们引入了Manana,一种非参数化提示学习框架,该框架从少量患者级训练集中学习如何推理当地的处方决策。Manana将观察到的处方错误转化为可审计的提示记忆,实现了单智能体和多智能体两种变体,并在两个独立收集的乌干达队列中优于经典的机器学习模型、直接LLM提示和提示优化基线。为了使系统具有不确定性感知能力,我们提出了贝叶斯提示平均法(BPA),这是一种对学习到的提示轨迹进行贝叶斯模型平均的程序。它将一系列学习到的提示转化为处方可能性,并产生转诊信号。在独立收集的保留队列上,BPA的访次级别前三名处方准确率比提示优化基线提高了4-8个百分点。更重要的是,它实现了临床上有意义的选择性预测:系统可以以95%的精度自动处理最自信的一半病例,或以99%的精度处理最自信的四分之一病例,同时将低置信度病例转交专家审核。这些结果表明,一条通往本地化适应临床LLM系统的路径是可行的,该系统从有限的特定站点数据中学习,并将稀缺的专家注意力保留给不确定性最高的病例。我们的代码位于: https://github.com/roychowdhuryresearch/Manana
参见图注
图1:Manana工作流程。(A) 在适应阶段,使用当前记忆状态处理每批患者记录:预测器提出三种方案,检查器将其与作为监督信号揭示的医生处方进行比较,提议的候选学习结果累积在一个仅附加的缓冲区中。每批处理一次,架构师将反复出现的跨案例信号整合到下一个共享记忆中,可以是单一修正规则列表或多专家提示集合。(B) 在推理时,将学习到的记忆轨迹视为一组提示状态的集成。贝叶斯提示平均将其候选方案预测转化为处方概率,从而实现高置信度辅助或转诊给专家。

## 1 引言
神经系统疾病是全球健康负担的主要且分布不均的来源。全球超过30亿人患有神经系统疾病,超过80%的神经系统疾病死亡和健康损失发生在低收入和中等收入国家(LMICs)(GBD 2021 Nervous System Disorders Collaborators,2024 (https://arxiv.org/html/2606.31036#bib.bib38))。癫痫影响着全球约0.8%的人口(约5000万人);其中近80%生活在LMICs,许多人得不到所需的治疗(World Health Organization,2024 (https://arxiv.org/html/2606.31036#bib.bib39))。在许多LMICs,专科癫痫护理仍然稀缺,诊断和治疗由全科医生承担(World Health Organization and World Federation of Neurology,2017 (https://arxiv.org/html/2606.31036#bib.bib40))。在这些环境中,长期癫痫药物管理具有挑战性,因为临床医生必须在诊断信息不完整、脑电图或影像学检查受限、药物库存不足、合并症、不良反应以及随访不规律的情况下随时间调整治疗。一线临床医生需要决定何时启用或更换抗癫痫药物、调整剂量、管理突破性癫痫发作或副作用,并在超负荷的系统中识别需要转诊至专科医生的患者。因此,基于LLM的决策支持系统颇具吸引力:一个依赖本地临床笔记并辅助治疗决策的系统,可以将专科医生的推理扩展到这些专业知识稀缺的环境中(Diessen et al.,2024 (https://arxiv.org/html/2606.31036#bib.bib25))。然而,部署该系统需要的不仅仅是回答医学考试问题。医学LLM智能体主要在标准化问答、诊断或EHR操作基准上进行评估(Kim et al.,2024 (https://arxiv.org/html/2606.31036#bib.bib12); Jiang et al.,2025 (https://arxiv.org/html/2606.31036#bib.bib15))。此外,药物推荐系统通常使用来自高收入国家高资源环境的结构化医院数据,如MIMIC(Shang et al.,2019 (https://arxiv.org/html/2606.31036#bib.bib2); Yang et al.,2021b (https://arxiv.org/html/2606.31036#bib.bib3),a (https://arxiv.org/html/2606.31036#bib.bib4); Sun et al.,2022 (https://arxiv.org/html/2606.31036#bib.bib5); Fan et al.,2025 (https://arxiv.org/html/2606.31036#bib.bib16); Johnson et al.,2023 (https://arxiv.org/html/2606.31036#bib.bib18))。在代表性不足的诊所中,一个现实的决策支持系统需要两个额外特性。首先,其推荐必须与当地实践相校准:药物可用性、成本和随访规范。其次,系统必须在医疗决策中显现不确定性,因为稀缺的专家注意力应集中在模型最不可靠的病例上。我们在乌干达的纵向癫痫护理中研究这些要求,其任务是在连续的临床就诊中预测抗癫痫药物方案。

在此,我们将性能衡量为与治疗医生选择的抗癫痫药物(ASM)方案的一致性。每个预测都基于该患者可用的临床笔记,而非来自高资源EHR的结构化诊断代码或用药史。在此背景下,我们测试LLM是否可以从临床笔记中恢复当地处方实践,并在连续就诊中可靠地执行。直接提示提供了一个有用的基准,但并非可部署的系统:尽管单智能体LLM与医生处方达到了非平凡的吻合度,但神经科医生的审计显示存在系统性错误,这些错误源于西方处方先验,而非乌干达临床实践。因此,问题不在于缺失医学知识,而是在目标医疗系统中应用了错误的先验。我们询问,LLM在无需参数权重更新的情况下,是否可以从本地病例中学习部署特定的处方修正,并利用由此产生的适应轨迹来估计不确定性以进行转诊。这一约束之所以重要,是因为新的临床部署需要适应本地数据,而无需权重更新所需的重新训练、验证和审计负担,尤其是在数据和计算资源有限的情况下。我们引入了Manana,一个基于错误驱动的提示学习框架,旨在解决这些问题。Manana从患者笔记和医生处方中学习,无需临床医生编写规则或专家审查模型推理轨迹。Manana是一个多智能体学习框架:一个智能体提出药物方案,第二个智能体分析相对于医生处方的错误,第三个智能体将反复出现的经验教训整合到可解释的提示记忆中。这个循环将观察到的失败转化为部署特定的推理指导,同时保留临床医生可以审查的可审计的文本表示。我们提出了两种变体:Manana-Single,学习一个单一的共享学习集;以及Manana-Multi,实例化具有学习提示的专家智能体。为了将提示学习转化为不确定性感知的决策支持,我们提出了贝叶斯提示平均法(BPA):对学习到的提示轨迹进行贝叶斯模型平均。每一轮学习产生一个不同的提示状态,这些提示状态构成了药物方案估计器的集成。由于每个状态反映了证据积累的不同阶段,轨迹捕获了一系列从校准数据中学习到的合理的当地处方规则。根据后验支持加权这些估计器,可以产生处方概率而不仅仅是排序预测,从而实现选择性预测:高置信度病例无需额外专家审核即可继续处理,而低置信度病例可转交临床医生进一步审核。这将稀缺的专家注意力集中在系统最不确定的病例上。我们将贡献总结如下:
1. 我们提出了Manana,一个非参数化提示学习框架,它从患者临床笔记和医生处方中学习如何推理当地的处方决策,实现了单智能体和多智能体两种变体。
2. 我们表明,仅使用少量患者级训练集,Manana在两个独立收集的乌干达癫痫队列上取得了出色的保留性能,优于经典的机器学习模型、单智能体LLM和现有的提示优化方法。
3. 我们进一步提出了贝叶斯提示平均法(BPA),一个对学习到的提示轨迹进行贝叶斯模型平均的框架,生成处方概率和转诊信号,允许高置信度病例无需额外专家审核即可继续处理,同时将低置信度病例路由给进一步的临床审查。

## 2 Manana
Manana通过无需权重更新地学习一个显式记忆状态来调整LLM的预测。在学习阶段,系统观察一个小的本地训练病历集,每个病历对将处方前可用的患者病史与治疗临床医生开出的方案配对。在我们的实验中,这个学习集包含50名患者;第3节 (https://arxiv.org/html/2606.31036#S3)给出了完整的分割和评估协议。Manana是一个多智能体学习系统,包含三个组件。*预测器*是产生方案的LLM:给定患者病史和当前记忆状态,它从10种药物的临床行动空间中返回三个候选方案。*检查器*将这些方案与临床医生处方进行比较,并编写结构化报告和候选学习结果。*架构师*跨候选学习结果和近期报告聚合证据,然后通过特定变体的更新规则更新记忆状态。目标是学习一个记忆状态序列m0,m1,...,mTm\_\{0\},m\_\{1\},\\ldots,m\_\{T\},从这些示例中捕获重复出现的部署特定的处方修正。所有三个组件都是使用相同基础模型和角色特定提示实现的LLM调用,因此学习通过记忆状态更新而不是参数更新进行。图1 (https://arxiv.org/html/2606.31036#S0.F1)给出了端到端的适应和推理工作流程。

### 2.1 学习
我们将每次临床就诊表示为(xi,yi)(x\_\{i\},y\_\{i\}),其中xix\_\{i\}是处方决策前可用的累积患者病史,yiy\_\{i\}是医生处方。令mtm\_\{t\}表示第tt轮学习后的记忆状态。学习过程从空记忆开始,m0=∅m\_\{0\}=\\emptyset。在第tt轮,Manana使用当前记忆mt−1m\_\{t-1\}处理一批临床就诊Bt\\mathcal\{B\}\_\{t\}。对于每次就诊,预测器返回 y^i,1:3=Pred(xi;mt−1)。\\hat\{y\}\_\{i,1:3\}=\\mathrm\{Pred\}(x\_\{i\};m\_\{t-1\})。然后检查器将这三个候选方案与医生处方进行比较,并输出一个结构化报告ρi\\rho\_\{i\}和一个*候选学习结果*cic\_\{i\},一个基于笔记的简洁建议经验教训:(ρi,ci)=Insp(xi,y^i,1:3,yi)。\(\\rho\_\{i\},c\_\{i\}\)=\\mathrm\{Insp\}(x\_\{i\},\\hat\{y\}\_\{i,1:3\},y\_\{i\})。候选学习结果不会立即添加到记忆中。它们首先进入一个仅追加的*证据缓冲区*C\\mathcal\{C\}, ΔCt=((i,ci))(xi,yi)∈Bt,Ct=Ct−1∥ΔCt,C0=∅,\\Delta\\mathcal\{C\}\_\{t\}=\\bigl\(\(i,c\_\{i\}\)\\bigr\)\_\{\(x\_\{i\},y\_\{i\}\)\\in\\mathcal\{B\}\_\{t\}\},\\qquad\\mathcal\{C\}\_\{t\}=\\mathcal\{C\}\_\{t-1\}\\,\\\|\\,\\Delta\\mathcal\{C\}\_\{t\},\\qquad\\mathcal\{C\}\_\{0\}=\\emptyset,其中ii索引就诊,∥\\\|表示仅追加累积。当前批次报告为 Rt=((i,ρi))(xi,yi)∈Bt。\\mathcal\{R\}\_\{t\}=\\bigl\(\(i,\\rho\_\{i\}\)\\bigr\)\_\{\(x\_\{i\},y\_\{i\}\)\\in\\mathcal\{B\}\_\{t\}\}。与证据缓冲区不同,Rt\\mathcal\{R\}\_\{t\}不是持久的:它为每一批次重新计算,并为架构师提供当前批次的局部诊断上下文。然后架构师更新记忆为 mt=Arch(mt−1,Ct,Rt),m\_\{t\}=\\mathrm\{Arch\}(m\_\{t-1\},\\mathcal\{C\}\_\{t\},\\mathcal\{R\}\_\{t\}),具体的更新规则由记忆变体决定。第2.2节 (https://arxiv.org/html/2606.31036#S2.SS2)描述了单智能体和多智能体变体的这些更新规则。候选学习结果与记忆更新之间的分离是我们与现有提示优化方法(如TextGrad(Yuksekgonul et al.,2024 (https://arxiv.org/html/2606.31036#bib.bib13)))的主要区别之一:区别不在于文本反馈,而在于更新的单元。TextGrad通过文本梯度下降重写一个可变的提示变量,产生全局规则,其支持未逐个案例地跟踪每条规则。Manana将错误诊断与记忆更新分开:检查器编写候选学习结果,证据缓冲区以案例来源保留它们,架构师应用由所选变体定义的受限记忆更新。关于这种设计选择的经验含义,我们在第4节 (https://arxiv.org/html/2606.31036#S4)中讨论。

### 2.2 记忆更新
Manana使用相同的预测器–检查器–架构师循环,架构师更新有两种变体。

**单智能体。** 在Manana-Single中,记忆状态是LtL\_\{t\}条学习规则的列表,mt=(r1,...,rLt)m\_\{t\}=(r\_\{1\},\\ldots,r\_\{L\_\{t\}\})。架构师要么从证据缓冲区中重复出现的候选学习结果中综合出一条新规则并附加,要么保持不变:
mt∈{mt−1,mt−1‖rnew},|mt|−|mt−1|≤1。m\_\{t\}\\in\\\{m\_\{t-1\},\\,m\_\{t-1\}\\\|r\_\{\\mathrm\{new\}\}\\\},\\qquad\|m\_\{t\}\|-\|m\_\{t-1\}\|\\leq 1。
由于记忆从空开始,这意味着Lt≤tL\_\{t\}\\leq t。只有当提议的规则得到至少N=2N=2个来自不同临床访问的学习结果支持时,才允许附加操作。

相似文章

测量LLMs在误导性医疗语境下的认知韧性

Hugging Face Daily Papers

介绍了MedMisBench,用于测量LLMs在误导性语境下维持正确医疗推理的能力。结果显示,在对抗性条件下,准确率从71.1%骤降至38.0%,临床专家组指出存在潜在危害。

人机对话提升急诊诊疗的诊断准确性

arXiv cs.AI

本研究评估了通过与大型语言模型(LLM)的交互式对话(通过 MedSyn 系统)如何提高急诊科医生在急诊环境中的诊断准确性,结果显示住院医师在处理疑难病例时的诊断准确率有显著提升。