一种专门用于加速罕见病诊断的推理型大型语言模型:一项随机AI医生辅助试验

arXiv cs.AI 论文

摘要

本文介绍了RaDaR,一个320亿参数的开源推理型大语言模型,基于公开和合成的罕见病病例进行训练。在诊断基准测试中,其表现优于DeepSeek-R1等更大模型,并在随机试验中将医生诊断准确率提升了21.44个百分点。

arXiv:2606.24510v1 Announce Type: new Abstract: 罕见病影响全球数百万人,但由于缺乏专业临床知识,及时诊断仍是一项重大公共卫生挑战。尽管大型语言模型(LLMs)在支持罕见病诊断方面显示出潜力,但当前模型受到临床可部署性不足、临床证据有限以及训练数据稀缺的制约。本文介绍了RaDaR(Rare Disease navigatoR),一个开源、紧凑的推理型大语言模型(320亿参数),用于罕见病诊断。RaDaR使用49,170个公开的纯文本病例和104,666个合成病例进行推理增强训练。在公开基准测试和四个外部验证中心中,RaDaR在评估的开源模型中表现最强,包括671B参数的DeepSeek-R1。在一个回顾性队列中,RaDaR在61.06%的病例中优先于记录临床怀疑之前给出最终诊断,对应的潜在提前时间为1.87个月,占中心内间隔的50.18%。在一项随机医生辅助试验中,与仅使用互联网搜索相比,RaDaR辅助将医生罕见病诊断准确率提高了21.44个百分点。合成数据消融实验表明,表型锚定叙事为长尾罕见病提供了有用的训练信号,在测试数据范围内呈现单调缩放趋势。总之,RaDaR及其开发和验证框架提供了一个可部署的罕见病推理模型,以及一个在数据稀缺条件下用于诊断AI的可复现开发框架。
查看原文
查看缓存全文

缓存时间: 2026/06/24 07:47

# 用于加速罕见病诊断的专用推理型大型语言模型:一项随机人工智能医师辅助试验
来源:https://arxiv.org/abs/2606.24510
作者:Haichao Chen (https://arxiv.org/search/cs?searchtype=author&query=Chen,+H)、Songchi Zhou (https://arxiv.org/search/cs?searchtype=author&query=Zhou,+S)、Zhengyun Zhao (https://arxiv.org/search/cs?searchtype=author&query=Zhao,+Z)、Shikai Hu (https://arxiv.org/search/cs?searchtype=author&query=Hu,+S)、Xianghong Jin (https://arxiv.org/search/cs?searchtype=author&query=Jin,+X)、Hongwei Ji (https://arxiv.org/search/cs?searchtype=author&query=Ji,+H)、Li He (https://arxiv.org/search/cs?searchtype=author&query=He,+L)、Shuli Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+S)、Yiming Qin (https://arxiv.org/search/cs?searchtype=author&query=Qin,+Y)、Xin Tan (https://arxiv.org/search/cs?searchtype=author&query=Tan,+X)、Runfeng Shi (https://arxiv.org/search/cs?searchtype=author&query=Shi,+R)、Yih Chung Tham (https://arxiv.org/search/cs?searchtype=author&query=Tham,+Y+C)、Jiaye Zhu (https://arxiv.org/search/cs?searchtype=author&query=Zhu,+J)、Ye Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+Y)、Ye Jin (https://arxiv.org/search/cs?searchtype=author&query=Jin,+Y)、Longhao Cao (https://arxiv.org/search/cs?searchtype=author&query=Cao,+L)、Dawei Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+D)、Honghan Wu (https://arxiv.org/search/cs?searchtype=author&query=Wu,+H)、Hongqiu Gu (https://arxiv.org/search/cs?searchtype=author&query=Gu,+H)、Guanqiao Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+G)、Tudor Groza (https://arxiv.org/search/cs?searchtype=author&query=Groza,+T)、Chunying Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+C)、Dian Zeng (https://arxiv.org/search/cs?searchtype=author&query=Zeng,+D)、Weihong Yu (https://arxiv.org/search/cs?searchtype=author&query=Yu,+W)、Gareth Baynam (https://arxiv.org/search/cs?searchtype=author&query=Baynam,+G)、Saumya Shekhar Jamuar (https://arxiv.org/search/cs?searchtype=author&query=Jamuar,+S+S)、Min Shen (https://arxiv.org/search/cs?searchtype=author&query=Shen,+M)、Shuyang Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+S)、Bin Sheng (https://arxiv.org/search/cs?searchtype=author&query=Sheng,+B)、Sheng Yu (https://arxiv.org/search/cs?searchtype=author&query=Yu,+S)、Tien Yin Wong (https://arxiv.org/search/cs?searchtype=author&query=Wong,+T+Y)

查看PDF (https://arxiv.org/pdf/2606.24510)

> **摘要:**罕见病影响着全球数百万患者,但由于专业临床诊疗经验的匮乏,及时诊断仍然是一项重大的公共卫生挑战。尽管大型语言模型(LLMs)在辅助罕见病诊断方面展现出潜力,但现有模型受限于临床部署能力不足、临床依据有限以及训练数据稀缺。在此,我们提出RaDaR(罕见病导航器),一个专为罕见病诊断而设计的开源、紧凑型推理大语言模型(参数规模320亿)。RaDaR基于49,170个公开可用的自由文本病例和104,666个通过推理增强训练生成的合成病例进行训练。在公共基准测试和四个外部验证中心中,RaDaR在评估的开源模型中表现出最强的性能,包括671B参数的DeepSeek-R1。在一项回顾性队列研究中,RaDaR在61.06%的病例中将最终诊断优先排在临床怀疑记录之前,相当于潜在的提前时间为1.87个月,占中心内间隔的50.18%。在一项随机医生辅助试验中,与仅使用互联网搜索相比,RaDaR辅助将医生的罕见病诊断准确性提升了21.44个百分点。合成数据消融实验表明,基于表型的叙述为长尾罕见病提供了有效的训练信号,在测试数据范围内呈现出单调缩放趋势。综上,RaDaR及其开发和验证框架提供了一个可部署的罕见病推理模型,以及一个在数据稀缺条件下可复现的诊断人工智能开发框架。

## 提交历史

来自:Haichao Chen [查看邮件](https://arxiv.org/show-email/914669c4/2606.24510) **[v1]** 2026年6月23日 星期二 12:42:23 UTC (1,748 KB)

相似文章

利用人工智能帮助医生诊断影响儿童的罕见遗传疾病

Reddit r/singularity

来自Boston Children's Hospital、Harvard和OpenAI的研究人员使用OpenAI o3 Deep Research reasoning模型重新分析了376例未解决的罕见疾病病例,经过专家审查和临床确认后,额外确诊了18例(确诊率4.8%)。这项发表在NEJM AI上的研究展示了人工智能辅助工作流程如何帮助专家在科学知识不断发展的情况下重新审视疑难病例。

强化学习用于大型语言模型的寻求证据诊断推理

arXiv cs.AI

本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。

DeepLens诊断代理:智能体工作流设计让小推理模型能与前沿大语言模型竞争

arXiv cs.AI

DeepLens诊断代理采用五阶段智能体工作流,结合小型医疗推理模型(7B),在包含915个病例的基准测试中实现了60.14%的诊断准确率,以更低成本超越了Claude Sonnet 4.5和Gemini 3.1 Pro等前沿大语言模型。仅工作流设计就比基础模型提升了36个百分点,表明结构化流程约束对于诊断推理至关重要。