The Daily Dose:放射肿瘤学中工作流集成的大语言模型自动化临床总结与试验识别系统
摘要
本文介绍了The Daily Dose(TDD),一个由大语言模型驱动的系统,用于自动化临床总结和临床试验识别,并集成到日常放射肿瘤学实践中,早期评估显示其具有良好的可用性和时间节省效果。
arXiv:2605.26346v1 公告类型:新
摘要:目的:描述The Daily Dose(TDD)的设计与早期临床评估,该系统是一个由大语言模型驱动的自动化临床总结和临床试验识别系统,集成到日常放射肿瘤学实践中。方法:采用混合方法评估,在系统部署1个月后对临床医生进行横断面匿名问卷调查。干预措施:每日自动发送基于RadOnc-GPT生成的医生专属电子邮件摘要,包括患者日程安排、从电子健康记录中提取的简明临床状态摘要,以及针对新就诊或会诊患者自动识别可能相关的临床试验。主要结果与衡量指标:主要结局包括自我报告的可用性、满意度、感知有用性、对工作流程的感知影响、时间节省以及持续使用意愿。内部一致性信度通过Cronbach's $\alpha$评估。结果:在55名受访者中,52人(94.5%)在放射肿瘤学领域工作,38人(69.1%)为主治医师。大多数参与者(83.6%)报告每天或每周数次使用TDD。平均(标准差)评分为:可用性和满意度3.89(1.04),感知有用性3.43(1.24),对影响和未来使用的评分3.80(1.17)(5点Likert量表)。总体满意度与感知时间节省呈正相关($p < .001$)。参与者报告的时间节省效果不一,27%的人估计每天节省$\geq 10$分钟。问卷表现出极好的内部一致性(总体Cronbach's $\alpha$ = 0.97)。
查看缓存全文
缓存时间: 2026/05/27 09:02
# 每日剂量:工作流集成的大语言模型自动化——用于放射肿瘤学临床摘要与临床试验识别 来源:https://arxiv.org/abs/2605.26346 作者:Jason Holmes (https://arxiv.org/search/cs?searchtype=author&query=Holmes,+J), Federico Mastroleo (https://arxiv.org/search/cs?searchtype=author&query=Mastroleo,+F), Mariana Borras\-Osorio (https://arxiv.org/search/cs?searchtype=author&query=Borras-Osorio,+M), Srinivas Seetamsetty (https://arxiv.org/search/cs?searchtype=author&query=Seetamsetty,+S), Satomi Shiraishi (https://arxiv.org/search/cs?searchtype=author&query=Shiraishi,+S), Mirek Fatyga (https://arxiv.org/search/cs?searchtype=author&query=Fatyga,+M), Judy C\. Boughey (https://arxiv.org/search/cs?searchtype=author&query=Boughey,+J+C), Cornelius A\. Thiels (https://arxiv.org/search/cs?searchtype=author&query=Thiels,+C+A), William G\.Breen (https://arxiv.org/search/cs?searchtype=author&query=G.Breen,+W), Daniel J\. Ma (https://arxiv.org/search/cs?searchtype=author&query=Ma,+D+J), Daniel K\. Ebner (https://arxiv.org/search/cs?searchtype=author&query=Ebner,+D+K), David M\. Routman (https://arxiv.org/search/cs?searchtype=author&query=Routman,+D+M), Brady S\. Laughlin (https://arxiv.org/search/cs?searchtype=author&query=Laughlin,+B+S), Carlos E\. Vargas (https://arxiv.org/search/cs?searchtype=author&query=Vargas,+C+E), Samir H\. Patel (https://arxiv.org/search/cs?searchtype=author&query=Patel,+S+H), Sujay A\. Vora (https://arxiv.org/search/cs?searchtype=author&query=Vora,+S+A), Nadia N\. Laack (https://arxiv.org/search/cs?searchtype=author&query=Laack,+N+N), Andrew Y\.K\. Foong (https://arxiv.org/search/cs?searchtype=author&query=Foong,+A+Y), Wei Liu (https://arxiv.org/search/cs?searchtype=author&query=Liu,+W), Mark R\. Waddle (https://arxiv.org/search/cs?searchtype=author&query=Waddle,+M+R) 查看 PDF (https://arxiv.org/pdf/2605.26346) > **摘要:** > **目的:** 描述“每日剂量”(The Daily Dose, TDD)系统的设计及其早期临床评估。该系统是一个由大语言模型驱动的自动化临床摘要与临床试验识别系统,已集成到常规放射肿瘤学实践中。 > **设计:** 采用混合方法评估,在系统部署一个月后,进行横断面匿名临床医生问卷调查。 > **暴露:** 每日自动发送医生定制的电子邮件摘要,内容基于RadOnc-GPT生成,包括患者日程、基于电子健康记录提取的简明临床状态摘要,以及针对新就诊或会诊患者自动识别潜在相关的临床试验。 > **主要结局指标:** 主要结局包括自评的可用性、满意度、感知有用性、对工作流程的感知影响、时间节省以及继续使用的意愿。内部一致性信度采用Cronbach's $\alpha$ 进行评估。 > **结果:** 在55名受访者中,52人(94.5%)从事放射肿瘤学工作,38人(69.1%)为主治医师。大多数参与者(83.6%)报告每天或每周多次使用TDD。均值(标准差)评分为:可用性和满意度3.89(1.04),感知有用性3.43(1.24),影响与未来使用3.80(1.17)(5级Likert量表)。总体满意度与感知时间节省呈正相关($p < .001$)。参与者报告的时间节省情况各异,27%的人估计每天节省$\geq 10$分钟。问卷表现出极好的内部一致性(总体Cronbach's $\alpha = 0.97$)。 ## 提交历史 来自:Jason Holmes 博士 [查看电子邮件 (https://arxiv.org/show-email/961fdff1/2605.26346)] **[v1]** 2026年5月25日 星期一 21:43:19 UTC (586 KB)
相似文章
人在回路的大语言模型框架用于皮肤免疫相关不良事件识别
本文提出了一种检索增强的多智能体LLM框架,结合人在回路机制,用于从临床记录中检测皮肤免疫相关不良事件。与人工审查相比,该框架实现了更高的准确率(F1=0.88 vs 0.77)、更优的评估者间一致性(Cohen's kappa系数为0.82 vs 0.50),并将平均审查时间缩短约一半。
一种专门用于加速罕见病诊断的推理型大型语言模型:一项随机AI医生辅助试验
本文介绍了RaDaR,一个320亿参数的开源推理型大语言模型,基于公开和合成的罕见病病例进行训练。在诊断基准测试中,其表现优于DeepSeek-R1等更大模型,并在随机试验中将医生诊断准确率提升了21.44个百分点。
大型语言模型作为统一多模态学习器用于临床预测
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
基于LLM生成的合成数据训练的模型的临床沟通处理:结构化综述与新型应用案例研究
本文综述了使用LLM生成的合成数据进行临床沟通处理的研究,并展示了13个案例研究,涵盖EMS报告、护士交接等场景,表明合成数据能够助推临床NLP系统的构建。
语言模型能否识别乳腺癌放疗的副作用?
本文提出了一种面向部署的压力测试框架,用于评估大型语言模型在识别乳腺癌放疗副作用方面的表现。该研究揭示了LLM在可靠性方面的局限性,例如对文档细微变化的敏感性以及对罕见副作用的低召回率,表明以临床医生整理的清单为输出依据可提高鲁棒性。