面向南非结核病诊疗的领域专用大语言模型开发与初步评估
摘要
研究人员使用QLoRA与GraphRAG对BioMistral-7B进行微调,构建面向南非结核病诊疗的LLM,在上下文对齐方面优于基座模型。
arXiv:2604.19776v1 公告类型:new
摘要:结核病(TB)是全球最致命的传染病之一,在南非给医疗体系带来沉重负担。本文报告了一项实验研究,开发面向结核病诊疗的领域专用大语言模型(DS-LLM),以减轻患者与医护人员的压力。首先,通过文献综述梳理当前医学领域LLM开发策略;随后,收集南非TB指南、精选TB文献及现有医学基准数据集。我们采用量化低秩适配(QLoRA)算法对医学LLM BioMistral-7B进行微调,并引入GraphRAG实现检索增强生成。最终DS-LLM与原始BioMistral-7B及通用LLM对比,通过自动化指标与定量评分评估。结果显示,DS-LLM在南非结核病诊疗的上下文对齐(词汇、语义、知识)方面表现更佳。
查看缓存全文
缓存时间: 2026/04/23 10:02
# 南非结核病诊疗领域专用大语言模型的开发与初步评估 来源:https://arxiv.org/abs/2604.19776 查看 PDF(https://arxiv.org/pdf/2604.19776) > 摘要:结核病(TB)是全球最致命的传染病之一,在南非,它给该国医疗体系带来沉重负担。本文报告了一项实验研究,旨在开发一款面向结核病诊疗的领域专用大语言模型(DS-LLM),以减轻患者与医护人员的压力。研究首先通过文献综述梳理当前医学领域 LLM 的开发策略;随后收集南非 TB 指南、精选 TB 文献及现有医学基准数据集。我们采用量化低秩适配(QLoRA)算法对医学 LLM BioMistral-7B 进行微调,并引入基于图的检索增强生成(GraphRAG)。通过自动化指标与人工量化评分,将所构建的 DS-LLM 与基础 BioMistral-7B 及通用 LLM 进行对比。结果显示,DS-LLM 在南非结核病场景下的语境对齐(词汇、语义与知识)表现优于基础模型。 ## 投稿历史 来自:Olawande Daramola 教授 [查看邮件](https://arxiv.org/show-email/a3ae5965/2604.19776) **\[v1\]** 2026 年 3 月 28 日(周六)11:22:05 UTC(651 KB)
相似文章
面向急诊科决策支持的本地可部署小语言模型:微调策略的系统性基准测试
这篇arXiv论文对八种开源小语言模型在不同微调策略下进行了基准测试,用于急诊科决策支持,发现LoRA微调的小语言模型在分诊和转诊任务上可以超越商业基线模型,同时保持本地可部署性。
一个用于医学大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
本文提出了一个多领域红队框架,用于在690个临床相关场景中评估医学大语言模型的安全性、鲁棒性和公平性。结果表明,高聚合准确率可能掩盖关键失败,而结合临床专家审核的混合评估对于可信的安全性评估是必要的。
用于生物医学声明验证的小型LLM:经济高效的微调、结构化数据集捷径与跨域泛化
使用QLoRA对小型LLM(3B-7B)进行生物医学声明验证的微调,以44.5倍更低的成本实现了比GPT-4o和GPT-5更高的F1分数,并揭示了SciFact中的一个结构伪影。该研究表明,在结构合理的数据上进行训练可实现稳健的跨域迁移。
弥合英语-阿拉伯语医学知识鸿沟:基于因果层选择的定向低秩适配
本文探讨了LLM在阿拉伯语医学任务中表现不佳的原因,通过机制分析表明知识存在于模型内部但未能浮现,随后提出了TLoRA,一种定向低秩适配方法,在医学问答上优于全网络LoRA,并引入了一个新的阿拉伯语临床对话基准。
强化学习用于大型语言模型的寻求证据诊断推理
本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。