Aletheia:面向低资源医疗环境的离线优先临床决策支持系统,用于鉴别诊断
摘要
Aletheia 是一个离线优先的临床决策支持系统,基于 Qwen2.5-3B-Instruct 模型,使用 QLoRA 在 27,000 个临床推理样本上进行微调,旨在服务于撒哈拉以南非洲的低资源医疗环境,达到了 80% 的 Top-1 准确率,且符合内存限制。
arXiv:2607.24814v1 公告类型:新提交
摘要:在撒哈拉以南非洲地区,获取专业临床专业知识仍然极为有限,农村地区医生与患者的比例可能低于 1:25,000。现有的人工智能辅助诊断工具主要依赖可靠的互联网连接和高规格硬件,这使得它们在地区医院和卫生中心的一线医疗工作者中难以实际应用。本文介绍了 Aletheia,这是一个专为撒哈拉以南非洲低资源医疗环境设计的离线优先临床决策支持系统。Aletheia 基于 Qwen2.5-3B-Instruct 构建,使用量化低秩适配(QLoRA)在包含 27,000 个临床推理样本的精选数据集上进行微调,这些样本涵盖了东非地区流行率较高的 50 种疾病。评估结果显示,在十个代表性临床病例类别中,Top-1 诊断准确率达到 80.0%,Top-3 准确率为 100.0%,BERTScore-F1 为 0.909,METEOR 为 0.467。该系统实现了 0.275 的期望校准误差(ECE),并通过了非洲深科技挑战赛 2026(ADTC 2026)的 7,168 MB 内存预算限制,在标准化基准笔记本电脑上峰值推理 RAM 约为 3,630 MB。这些结果证明,在无需云基础设施的资源受限环境中,在初级保健层面部署基于大语言模型的临床推理是可行的。
查看缓存全文
缓存时间: 2026/07/29 09:52
# 面向低资源医疗环境的离线优先临床决策支持系统,用于鉴别诊断 来源:https://arxiv.org/html/2607.24814 Joseph Walusimbi∗, Ann Move Oguti, Abubakhari Sserwadda, Precious Boss Kasasira, and Charles Brian Okoboi J. Walusimbi, A. M. Oguti, and A. Sserwadda are with the Department of Electronics and Computer Engineering, Soroti University, Soroti, Uganda. ∗Corresponding author: J. Walusimbi (e-mail: [email protected]). A. M. Oguti (e-mail: [email protected]). A. Sserwadda (e-mail: [email protected]). P. B. Kasasira and C. B. Okoboi are with the School of Health Sciences, Soroti University, Soroti, Uganda (e-mail: [email protected]; [email protected]). ###### 摘要 在撒哈拉以南非洲,获取专业临床知识仍然极为有限,农村地区的医患比例可能低于1:25,000。现有的人工智能辅助诊断工具主要依赖于可靠的互联网连接和高规格硬件,这使得它们在区级医院和卫生中心的基层医疗工作者中难以应用。本文提出了 **Aletheia**,一个专为撒哈拉以南非洲低资源医疗环境设计的离线优先临床决策支持系统。Aletheia 基于 Qwen2.5-3B-Instruct 构建,采用量化低秩适配(QLoRA)技术在包含27,000个临床推理样本的精选数据集上进行微调,这些样本涵盖了在东部非洲发病率较高的50种疾病。评估结果显示,在十个代表性临床案例类别中,Top-1诊断准确率为80.0%,Top-3准确率为100.0%,BERTScore-F1为0.909,METEOR为0.467。系统预期校准误差(ECE)为0.275,并且通过了非洲深度科技挑战赛2026(ADTC 2026)7,168 MB的内存预算限制,在标准化基准笔记本电脑上实现了约3,630 MB的峰值推理内存占用。这些结果表明,在缺乏云基础设施的资源受限环境中,在初级医疗层面部署基于大语言模型的临床推理是可行的。 ## I. 引言 撒哈拉以南非洲的疾病负担相对于临床专业知识的可用性而言异常沉重。乌干达人口超过4800万,医生密度约为每千人0.17名[1](https://arxiv.org/html/2607.24814#bib.bib1)——处于全球最低水平之列。在乌干达东部索罗提区等农村和城乡结合部,一名临床医生可能每天负责80–120名患者的诊治,每位患者的病史采集、体格检查、鉴别诊断和检查计划安排时间不足五分钟。在这种情况下,诊断错误和关键表现漏诊是因认知负荷过重而非临床能力不足导致的必然结果。 人工智能辅助的临床决策支持系统(CDSS)在高收入环境中已显示出巨大潜力,在放射学[2](https://arxiv.org/html/2607.24814#bib.bib2)、皮肤科[3](https://arxiv.org/html/2607.24814#bib.bib3)和普通内科[4](https://arxiv.org/html/2607.24814#bib.bib4)领域,其诊断准确性已可与专科医生媲美。然而,绝大多数此类系统需要持续的互联网连接、基于云的推理基础设施以及远超撒哈拉以南非洲医疗机构现有条件[5](https://arxiv.org/html/2607.24814#bib.bib5)的硬件规格。 近期在大语言模型(LLM)压缩方面的进展,特别是通过 GGUF 格式实现的4位量化和低秩适配(LoRA)微调,为在无需互联网连接的普通硬件上部署可用的临床AI推理创造了新的可能性[6](https://arxiv.org/html/2607.24814#bib.bib6),[7](https://arxiv.org/html/2607.24814#bib.bib7)。这些技术的结合使得一个30亿参数的语言模型可以压缩至2 GB以下,并在标准笔记本电脑上以实用的推理速度运行。 本文提出了 **Aletheia**(源于希腊语,意为 **真理** 或 **揭示**),一个离线优先的临床决策支持系统,它能够: - 完全在设备本地运行,无需依赖互联网,适用于撒哈拉以南非洲区级医院和卫生中心的部署; - 提供带有概率估计的排序鉴别诊断、基于证据的检查建议、临床推理依据、红色警报识别以及后续问题生成; - 在权重偏向非洲疾病流行病学——特别强调东非发病率模式——的数据集上进行微调,涵盖了在公开医疗AI基准测试中很少出现的疾病; - 满足非洲深度科技挑战赛2026(ADTC 2026)[29](https://arxiv.org/html/2607.24814#bib.bib29)的内存约束要求,该挑战要求模型在标准化笔记本电脑(Intel Core i5 10代至12代,8 GB DDR4,Ubuntu 22.04,无独立GPU)上在7,168 MB内存内运行,而 Aletheia 的峰值RAM需求约为3,730 MB——低于上限3,438 MB。 本文其余部分的结构如下。第二部分[II](https://arxiv.org/html/2607.24814#S2)回顾了医疗LLM及适用于低资源环境的临床决策支持的相关工作。第三部分[III](https://arxiv.org/html/2607.24814#S3)描述了训练数据集。第四部分[IV](https://arxiv.org/html/2607.24814#S4)介绍了模型架构、微调方法和部署流水线。第五部分[V](https://arxiv.org/html/2607.24814#S5)详细说明了实验设置和评估指标。第六部分[VI](https://arxiv.org/html/2607.24814#S6)报告了定量结果。第七部分[VII](https://arxiv.org/html/2607.24814#S7)讨论了研究结果、局限性和未来方向。第八部分[VIII](https://arxiv.org/html/2607.24814#S8)对本文进行总结。 ## II. 相关工作 ### II-A 大语言模型在临床医学中的应用 自 GPT-4[8](https://arxiv.org/html/2607.24814#bib.bib8)及其后继模型发布以来,基于 Transformer 的语言模型在临床推理中的应用显著加速。Med-PaLM 2[9](https://arxiv.org/html/2607.24814#bib.bib9)在 USMLE 式医学问题上达到了专家级水平,而 BioMedLM[10](https://arxiv.org/html/2607.24814#bib.bib10)和 ClinicalBERT[11](https://arxiv.org/html/2607.24814#bib.bib11)则展示了领域特定预训练的价值。然而,这些系统主要在美国或欧洲的临床基准上进行评估,并且需要基于云的推理基础设施,限制了它们在资源受限环境中的适用性。 ### II-B 低资源环境下的临床决策支持 此前针对撒哈拉以南非洲的 CDSS 工作主要集中于基于规则的专家系统[12](https://arxiv.org/html/2607.24814#bib.bib12)、移动健康(mHealth)应用[13](https://arxiv.org/html/2607.24814#bib.bib13)和远程医疗平台[14](https://arxiv.org/html/2607.24814#bib.bib14)。尽管这些方法已显示出实用性,但它们要么缺乏现代LLM的推理深度,要么核心功能依赖互联网连接。诸如 Ada[15](https://arxiv.org/html/2607.24814#bib.bib15)和 Babylon[16](https://arxiv.org/html/2607.24814#bib.bib16)之类的症状检查应用提供了结构化的鉴别诊断,但需要持续向云端推理端点传输数据。 ### II-C 高效 LLM 部署 用于边缘部署的大语言模型量化工作已通过 GPTQ[17](https://arxiv.org/html/2607.24814#bib.bib17)、AWQ[18](https://arxiv.org/html/2607.24814#bib.bib18)以及 llama.cpp[7](https://arxiv.org/html/2607.24814#bib.bib7)支持的 GGUF 格式取得进展。QLoRA[6](https://arxiv.org/html/2607.24814#bib.bib6)证明了在量化模型上实现高质量微调是可行的,且仅需最低限度的硬件,从而能够在消费级 GPU 上微调7B及更大的参数模型。QLoRA 微调与 GGUF 部署的结合,使得训练可在可用的云硬件上进行,而生成的模型则可在普通的本地硬件上进行部署。 ### II-D 非洲医疗 AI 专门的非洲医疗 AI 数据集和基准仍然稀缺。WHO AFRO 健康统计数据[19](https://arxiv.org/html/2607.24814#bib.bib19)和区域流行病学报告提供的结构化临床 AI 基准数据有限。MedQA[20](https://arxiv.org/html/2607.24814#bib.bib20)和 MedMCQA[21](https://arxiv.org/html/2607.24814#bib.bib21)数据集提供了大规模医学问答数据,但其临床背景分别主要针对美国和印度。Aletheia 通过一个专门构建的、权重反映东非疾病流行病学的合成数据集来弥补这一空白。 ## III. 数据集 ### III-A 数据集构成 Aletheia 训练数据集由三个来源构建而成: 1. **Aletheia-Synthetic**:根据50个手工制作的临床案例模板生成的20,000个结构化临床推理样本,覆盖了东非常见的疾病。 2. **MedQA-USMLE**[20](https://arxiv.org/html/2607.24814#bib.bib20):来自 MedQA 数据集的9,358个经过筛选的问题,通过一个包含180个关键词的过滤器筛选出与热带医学、传染病、产科和儿科相关的问题。 3. **MedMCQA**[21](https://arxiv.org/html/2607.24814#bib.bib21):来自 MedMCQA 数据集的10,000个经过筛选的问题,使用相同的关键词过滤器,并限制在10,000个样本以内。 在应用60/20/20混合比例以及最小令牌质量过滤器(50个令牌)后,最终数据集包含27,000个训练样本和3,000个评估样本,共计30,000个样本——比最初单一来源配置增加了25%。表一总结了数据集统计数据。 **表一:训练数据集统计** ### III-B 临床疾病 选择的50种临床疾病反映了东非疾病负担,涵盖八个类别:感染性和热带病(12种)、呼吸系统(3种)、心血管(3种)、妇产科(4种)、儿科(4种)、神经科(2种)、肾脏和内分泌(4种)、外科和创伤(3种)以及其他专科(15种)。疾病根据东非的估计发病率进行权重分配(africa_weight 参数,范围3–5),其中疟疾、HIV/艾滋病、结核病、脑型疟疾、子痫、严重急性营养不良和新生儿败血症获得最高权重。 ### III-C 推理任务类型 每个临床案例通过八种推理任务类型进行实例化,以教授多步骤临床推理,而不仅仅是简单的诊断回忆: 1. **初始鉴别诊断** —— 根据呈现症状排列鉴别诊断; 2. **检查建议** —— 基于证据的检查优先级排序; 3. **证据更新** —— 检查结果后的贝叶斯概率修正; 4. **理由解释** —— 通俗语言的临床推理; 5. **后续问题** —— 生成最具区分度的下一个问题; 6. **严重程度评估** —— 急症分类和护理级别确定; 7. **治疗提示** —— 区级医院的即时处理方案; 8. **红色警报识别** —— 需要立即升级的触发点。 ## IV. 方法论 ### IV-A 基础模型选择 选择 Qwen2.5-3B-Instruct[22](https://arxiv.org/html/2607.24814#bib.bib22) 作为基础模型,原因如下: - 参数数量(3.09B)足以支持多步临床推理,同时量化后在 ADTC 内存预算范围内; - 原生 bfloat16 支持,可在 A100 硬件上进行稳定训练,避免数值不稳定性; - 在指令遵循任务上具有强大的基准性能,减少了微调所需的样本数量; - 宽松的许可协议支持在公共卫生环境中进行开放部署。 ### IV-B 使用 QLoRA 进行微调 我们应用量化低秩适配(QLoRA)[6](https://arxiv.org/html/2607.24814#bib.bib6)对 Qwen2.5-3B-Instruct 进行微调。在 A100 训练硬件上,我们使用完整的 bfloat16 精度,未进行量化,以最大化训练质量。LoRA 适配器附加到所有线性投影层:`q_proj`、`k_proj`、`v_proj`、`o_proj`、`gate_proj`、`up_proj` 和 `down_proj`。 表二总结了训练配置。 **表二:实验配置** ### IV-C 部署流水线 微调后,使用 PEFT 库[23](https://arxiv.org/html/2607.24814#bib.bib23)将 LoRA 适配器合并到基础模型权重中。然后通过 llama.cpp[7](https://arxiv.org/html/2607.24814#bib.bib7)将合并后的模型转换为 GGUF 格式,采用两步流程:先转换为 16 位浮点 GGUF(6.18 GB),然后使用 `llama-quantize` 进行 Q4_K_M(1.93 GB)和 Q2_K(1.27 GB)的量化。主要部署目标是 Q4_K_M 量化,它在文件大小仅为 31% 的情况下达到约 98% 的 F16 质量。 系统为临床使用提供两种界面:用于脚本编写和集成的终端 CLI,以及基于 Gradio 构建的、在浏览器中本地运行且无需互联网连接的 Web 图形用户界面。两种界面都接受结构化的临床输入,并返回结构化的 JSON,其中包含排序的鉴别诊断、推荐检查、推理依据和红色警报。 ### IV-D 离线优先架构 Aletheia 实现了一种本地优先、有网络时同步的架构: - **离线模式**:完全诊断能力,无性能下降。1.93 GB 的 GGUF 模型和推理引擎完全在设备本地运行; - **联网模式**:可选的模型更新下载,匿名汇总的使用日志记录用于质量改进; - **更新安全**:新模型版本在激活前会在保留的测试集上进行验证;回滚到先前版本的功能保留 30 天。 ## V. 实验设置 ### V-A 训练基础设施 训练在 Google Colab Pro 上使用 NVIDIA A100-SXM4-80GB GPU(85.1 GB 显存)进行,软件环境包括 PyTorch 2.11.0、Transformers 4.44.2、PEFT 0.12.0、TRL 0.10.1 和 Accelerate 0.34.2。完整训练运行用时 1.92 小时,共 4,050 步,跨越 3 个 epoch。 ### V-B 评估协议 模型性能从四个维度进行评估: #### V-B1 临床准确性 通过检查正确诊断是否出现在模型的 Top-1 或 Top-3 排序鉴别诊断中,计算 Top-k 准确率。在 10 个核心评估案例类别上计算每个疾病的精确率、召回率和 F1 值。进一步按临床严重程度(危急、高、中、低)和推理任务类型对准确性进行分层。 #### V-B2 语言质量 文本生成质量通过 ROUGE-1、ROUGE-2 和 ROUGE-L[24](https://arxiv.org/html/2607.24814#bib.bib24)(F1 分数)、使用 `roberta-large` 编码器的 BERTScore-F1[25](https://arxiv.org/html/2607.24814#bib.bib25) 以及 METEOR[26](https://arxiv.org/html/2607.24814#bib.bib26) 进行评估。 #### V-B3 校准 概率校准通过预期校准误差(ECE)[27](https://arxiv.org/html/2607.24814#bib.bib27)、最大校准误差(MCE)和按临床严重程度分层的 Brier 分数[28](https://arxiv.org/html/2607.24814#bib.bib28)进行评估。使用 10 个等宽分箱构建可靠性图。 #### V-B4 基线对比 将微调后的 Aletheia 模型与
相似文章
面向安全的假设演绎框架用于AI辅助鉴别诊断
AegisDx是一个面向安全的框架,它利用专门的LLM组件和验证门进行假设演绎临床推理,在医学病例报告上,将鉴别诊断准确率比单独的LLM提高了7-17个百分点。
Reasoning-Medical0.1-27B(Qwen3.5-27B 医疗微调版本,声称超越 MedGemma)
EpistemeAI 发布了 Reasoning-Medical0.1-27B,这是 Qwen3.5-27B 的医疗推理微调版本,声称通过在精心策划的 10 万条记录数据集上引入链式思维推理,在多项医疗基准测试中超越了 MedGemma。
一种专门用于加速罕见病诊断的推理型大型语言模型:一项随机AI医生辅助试验
本文介绍了RaDaR,一个320亿参数的开源推理型大语言模型,基于公开和合成的罕见病病例进行训练。在诊断基准测试中,其表现优于DeepSeek-R1等更大模型,并在随机试验中将医生诊断准确率提升了21.44个百分点。
一种用于自主、免微调临床症状检测的多智能体系统:开发与验证研究
Pythia是一个多智能体系统,能够自主编写和优化用于临床概念的提取提示,无需手动提示工程或微调,使用本地托管的开放权重模型。在临床症状检测中,其平均敏感度为0.76,特异度为0.95,在特异度上优于基于词典的方法。
基于数字孪生模拟的治疗响应优化临床决策支持AI系统
本文提出了一种在线自适应的临床决策支持AI系统,该系统整合了治疗效果估计、数字孪生模拟和强化学习,以在安全、临床医生监督的方式下推荐治疗方案,并在合成模拟器和TCGA卵巢癌数据集上进行了验证。