基于LLM生成的合成数据训练的模型的临床沟通处理:结构化综述与新型应用案例研究

arXiv cs.CL 论文

摘要

本文综述了使用LLM生成的合成数据进行临床沟通处理的研究,并展示了13个案例研究,涵盖EMS报告、护士交接等场景,表明合成数据能够助推临床NLP系统的构建。

arXiv:2608.05993v1 公告类型:新 摘要:许多临床价值并非通过结构化记录传递,而是通过沟通传递:患者描述症状、临床医生推理并给出指导、救护车向急诊科交接、护士进行轮班交接等交流过程。这类语言与表格数据不同,因为其含义取决于说话者角色、意图、因果性、不确定性、信息省略和信道噪声。因此,医疗自然语言处理必须解释信息所传达的内容,而非编码后的内容。这需要良好标注的语料库,但由于真实的交流具有私密性、碎片化且标注成本高昂,此类语料库十分稀缺。大语言模型提供了一条前进之路:将临床来源(如记录、诊断标签、症状列表或护理计划)转换为供下游模型使用的书面和转录沟通内容。我们提出了一项结构化叙述性综述,按来源表示、沟通形式与参与者、生成方法和下游任务进行组织,并辅以十三个新颖的案例研究。这些研究在没有标注真实世界数据的情况下,为沟通渠道和语言构建了临床NLP系统,包括EMS到达前报告、野战电台伤员文档、护士交接、患者门户分诊以及低资源出院沟通。它们表明,合成沟通可以引导这样的系统。研究结果包括:微调编码器模型在评估中优于零样本基线,以及故意降级的沟通对鲁棒性的价值。主要局限性在于,大多数研究是在留出的合成沟通数据上进行评估,而在合成数据上训练、在真实数据上测试的证据仍然有限。我们得出结论:合成临床沟通正在成为一种实用的研究资源;但要将其确立为可复用的临床基础设施,还需要真实数据迁移、安全性和外部验证。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:52

# 使用基于LLM生成合成数据训练的模型进行临床沟通处理:结构化综述与新型应用案例研究
Source: https://arxiv.org/abs/2608.05993
查看PDF (https://arxiv.org/pdf/2608.05993)

> 摘要:大量临床价值并非通过结构化记录传递,而是通过沟通交流来传递:患者描述症状、临床医生推理并给出指示、救护车向急诊部门交班、护士进行轮班交接。这类语言与表格化数据不同,因为其含义取决于说话者角色、意图、因果性、不确定性、省略行为以及信道噪声。因此,医疗自然语言处理必须解读信息被传达的方式,而非仅仅依赖编码信息。这需要高质量的标注语料库,而由于真实交流具有隐私性、碎片化且标注成本高昂,这类语料十分稀缺。大型语言模型提供了一条可行路径,可将临床来源(如病历、诊断标签、症状列表或护理计划)转换为面向下游模型的书面或转录式沟通内容。我们呈现了一篇结构化叙述性综述,按来源表示、沟通形式与参与者、生成方法和下游任务进行组织,并辅以十三个新颖的案例研究。这些研究在缺乏标注真实世界数据的情况下,为沟通渠道和语言构建了临床NLP系统,涵盖急救医疗系统(EMS)到达前报告、野战无线电伤员记录、护士交接、患者门户分诊以及低资源出院沟通。研究表明,合成沟通可以为这类系统提供启动基础。研究结论包括:微调的编码器模型在评估的零样本基线上具有竞争力,以及刻意降级的沟通对鲁棒性的价值。主要局限在于,大多数研究在留出的合成沟通数据上进行评估,而“在合成数据上训练、在真实数据上测试”的证据仍然有限。我们得出结论:合成临床沟通正成为一种实用的研究资源;但要将其确立为可复用的临床基础设施,还需真实数据迁移、安全性验证和外部验证。

## 提交历史

来自:Yehudit Aperstein [查看邮件](https://arxiv.org/show-email/821d157c/2608.05993) **\[v1\]** 2026年8月6日星期四 13:04:42 UTC (930 KB)

相似文章

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。

利用大型语言模型生成合成消费者洞察

arXiv cs.AI

本研究探讨了大型语言模型能否为投射技术生成合成消费者数据,通过比较人类与LLM在城市旅游感知上的回应,发现两者在主题上高度重叠,但在风格、语言结构和多样性生成方式上存在重要差异。

在标准化病例中评估大语言模型在动态临床决策中的表现

Hugging Face Daily Papers

研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。