一种专门用于加速罕见病诊断的推理型大型语言模型:一项随机AI医生辅助试验
摘要
本文介绍了RaDaR,一个320亿参数的开源推理型大语言模型,基于公开和合成的罕见病病例进行训练。在诊断基准测试中,其表现优于DeepSeek-R1等更大模型,并在随机试验中将医生诊断准确率提升了21.44个百分点。
查看缓存全文
缓存时间: 2026/06/24 07:47
# 用于加速罕见病诊断的专用推理型大型语言模型:一项随机人工智能医师辅助试验 来源:https://arxiv.org/abs/2606.24510 作者:Haichao Chen (https://arxiv.org/search/cs?searchtype=author&query=Chen,+H)、Songchi Zhou (https://arxiv.org/search/cs?searchtype=author&query=Zhou,+S)、Zhengyun Zhao (https://arxiv.org/search/cs?searchtype=author&query=Zhao,+Z)、Shikai Hu (https://arxiv.org/search/cs?searchtype=author&query=Hu,+S)、Xianghong Jin (https://arxiv.org/search/cs?searchtype=author&query=Jin,+X)、Hongwei Ji (https://arxiv.org/search/cs?searchtype=author&query=Ji,+H)、Li He (https://arxiv.org/search/cs?searchtype=author&query=He,+L)、Shuli Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+S)、Yiming Qin (https://arxiv.org/search/cs?searchtype=author&query=Qin,+Y)、Xin Tan (https://arxiv.org/search/cs?searchtype=author&query=Tan,+X)、Runfeng Shi (https://arxiv.org/search/cs?searchtype=author&query=Shi,+R)、Yih Chung Tham (https://arxiv.org/search/cs?searchtype=author&query=Tham,+Y+C)、Jiaye Zhu (https://arxiv.org/search/cs?searchtype=author&query=Zhu,+J)、Ye Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+Y)、Ye Jin (https://arxiv.org/search/cs?searchtype=author&query=Jin,+Y)、Longhao Cao (https://arxiv.org/search/cs?searchtype=author&query=Cao,+L)、Dawei Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+D)、Honghan Wu (https://arxiv.org/search/cs?searchtype=author&query=Wu,+H)、Hongqiu Gu (https://arxiv.org/search/cs?searchtype=author&query=Gu,+H)、Guanqiao Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+G)、Tudor Groza (https://arxiv.org/search/cs?searchtype=author&query=Groza,+T)、Chunying Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+C)、Dian Zeng (https://arxiv.org/search/cs?searchtype=author&query=Zeng,+D)、Weihong Yu (https://arxiv.org/search/cs?searchtype=author&query=Yu,+W)、Gareth Baynam (https://arxiv.org/search/cs?searchtype=author&query=Baynam,+G)、Saumya Shekhar Jamuar (https://arxiv.org/search/cs?searchtype=author&query=Jamuar,+S+S)、Min Shen (https://arxiv.org/search/cs?searchtype=author&query=Shen,+M)、Shuyang Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+S)、Bin Sheng (https://arxiv.org/search/cs?searchtype=author&query=Sheng,+B)、Sheng Yu (https://arxiv.org/search/cs?searchtype=author&query=Yu,+S)、Tien Yin Wong (https://arxiv.org/search/cs?searchtype=author&query=Wong,+T+Y) 查看PDF (https://arxiv.org/pdf/2606.24510) > **摘要:**罕见病影响着全球数百万患者,但由于专业临床诊疗经验的匮乏,及时诊断仍然是一项重大的公共卫生挑战。尽管大型语言模型(LLMs)在辅助罕见病诊断方面展现出潜力,但现有模型受限于临床部署能力不足、临床依据有限以及训练数据稀缺。在此,我们提出RaDaR(罕见病导航器),一个专为罕见病诊断而设计的开源、紧凑型推理大语言模型(参数规模320亿)。RaDaR基于49,170个公开可用的自由文本病例和104,666个通过推理增强训练生成的合成病例进行训练。在公共基准测试和四个外部验证中心中,RaDaR在评估的开源模型中表现出最强的性能,包括671B参数的DeepSeek-R1。在一项回顾性队列研究中,RaDaR在61.06%的病例中将最终诊断优先排在临床怀疑记录之前,相当于潜在的提前时间为1.87个月,占中心内间隔的50.18%。在一项随机医生辅助试验中,与仅使用互联网搜索相比,RaDaR辅助将医生的罕见病诊断准确性提升了21.44个百分点。合成数据消融实验表明,基于表型的叙述为长尾罕见病提供了有效的训练信号,在测试数据范围内呈现出单调缩放趋势。综上,RaDaR及其开发和验证框架提供了一个可部署的罕见病推理模型,以及一个在数据稀缺条件下可复现的诊断人工智能开发框架。 ## 提交历史 来自:Haichao Chen [查看邮件](https://arxiv.org/show-email/914669c4/2606.24510) **[v1]** 2026年6月23日 星期二 12:42:23 UTC (1,748 KB)
相似文章
RareDxR1:超越人类标注的罕见病诊断自主医疗推理
介绍RareDxR1,一种端到端的以推理为中心的大语言模型,用于从非结构化临床笔记中进行开放域罕见病诊断,采用渐进式训练框架和反思增强推理采样,实现了最先进的准确率。
利用人工智能帮助医生诊断影响儿童的罕见遗传疾病
来自Boston Children's Hospital、Harvard和OpenAI的研究人员使用OpenAI o3 Deep Research reasoning模型重新分析了376例未解决的罕见疾病病例,经过专家审查和临床确认后,额外确诊了18例(确诊率4.8%)。这项发表在NEJM AI上的研究展示了人工智能辅助工作流程如何帮助专家在科学知识不断发展的情况下重新审视疑难病例。
强化学习用于大型语言模型的寻求证据诊断推理
本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。
DeepLens诊断代理:智能体工作流设计让小推理模型能与前沿大语言模型竞争
DeepLens诊断代理采用五阶段智能体工作流,结合小型医疗推理模型(7B),在包含915个病例的基准测试中实现了60.14%的诊断准确率,以更低成本超越了Claude Sonnet 4.5和Gemini 3.1 Pro等前沿大语言模型。仅工作流设计就比基础模型提升了36个百分点,表明结构化流程约束对于诊断推理至关重要。
@OpenAI: 罕见病诊断充满挑战,因为测序可能揭示数百万种变异,而医学知识不断变化……
OpenAI 强调 o3 Deep Research 如何通过整合临床特征、遗传模式、变异证据和科学文献,为专家提供可操作的假设,从而帮助罕见病诊断。