评估AI生成的癌症患者摘要
摘要
本研究采用双重评估框架,使用人类领域专家和LLMs作为评估者,评估面向癌症患者的AI生成摘要,重点关注医疗保健应用中的准确性、临床相关性和安全性。
arXiv:2608.26154v1 Announce Type: new
摘要:大型语言模型(LLMs)正日益被整合到数字健康平台中,以生成复杂医疗数据的摘要。尽管这些模型可以提高患者参与度和沟通,但这些系统也引发了对临床环境中准确性、忠实性和安全性的担忧。本研究使用双重评估框架评估癌症患者护理应用中的AI生成摘要。人类领域专家,包括肿瘤科临床医生和面向患者的护理人员,对摘要质量在准确性、临床相关性和可读性方面提供了基准评估。同时,我们采用了LLMs作为评估者(LLM-as-a-judge)。在生成的摘要中发现了一些局限性,例如偶尔的遗漏和轻微的不准确。这些局限性被系统地分析,并用于迭代改进提示设计、基础设置和安全防护措施。
查看缓存全文
缓存时间: 2026/08/28 09:22
# 癌症患者AI生成摘要的评估 来源:https://arxiv.org/html/2608.26154 ###### 摘要 大型语言模型(LLMs)正日益被整合到数字健康平台中,用于生成复杂医疗数据的摘要。尽管这些模型可以提升患者的参与度和医患沟通效率,但它们在临床情境下的准确性、忠实度和安全性也引发了关注。本研究通过双重评估框架,在癌症患者护理应用中评估AI生成的摘要。人类领域专家(包括肿瘤科临床医生和面向患者的护理人员)从准确性、临床相关性和可读性等维度对摘要质量进行了真值评估。同时,我们采用作为评估者的LLM(LLM-as-a-judge)进行平行评估。研究发现生成的摘要存在一些局限性,例如偶尔的遗漏和细微的不准确。我们对这些问题进行了系统分析,并用于迭代改进提示设计、信息依据和安全防护机制。 ## I引言 医疗系统在不同就诊场景、护理环境和时间段内生成大量临床文档。临床医生需要常规性地整合这些信息以支持决策、护理协调以及与患者及照护者的沟通。然而,电子健康记录(EHRs)常将临床相关信息分散在病程记录、出院小结、医嘱和辅助文档中,增加了认知负担并导致信息过载[6 (https://arxiv.org/html/2608.26154#bib.bib19),2 (https://arxiv.org/html/2608.26154#bib.bib20)]。大型语言模型(LLMs)的最新进展使得从异构临床数据自动生成简洁的叙述性摘要成为可能[24 (https://arxiv.org/html/2608.26154#bib.bib11),21 (https://arxiv.org/html/2608.26154#bib.bib6)]。AI生成的患者摘要正日益被探索作为一种面向临床医生的工具,旨在支持病历查阅、护理过渡、交接以及患者沟通准备。在此背景下,摘要并非直接提供给患者,而是作为患者状态的综合呈现,供临床医生审阅、编辑或纳入后续文档和讨论中。 尽管LLM生成的摘要具有提升效率和情境感知能力的潜力,但它们也带来了独特的临床风险。错误或遗漏可能在临床工作流程中传播,影响临床医生的理解、文档记录或与患者的沟通。与传统的抽取式摘要不同,生成式模型可能引入未经证实的陈述、错误陈述数值,或微妙地重构临床重点[13 (https://arxiv.org/html/2608.26154#bib.bib5)]。由于这些摘要可能在多次就诊中重复使用或为后续文档提供信息,即使微小的不准确也可能随时间累积或持续存在,可能导致患者受到伤害。因此,有必要在真实世界环境中评估患者摘要。 目前大多数关于医疗领域LLM的研究都集中在面向临床医生的文档辅助、医学问答或决策支持方面。AI生成的患者摘要在临床工作流程中占据独特地位,因为它们既非原始临床笔记,也非最终面向患者的文档。相反,它们充当塑造临床医生解读和后续沟通的中间产物。这种中介角色意味着摘要必须与源数据一致,符合临床医生的意图,并且应对其不确定性和模型局限性保持透明[19 (https://arxiv.org/html/2608.26154#bib.bib13)]。评估生成模型在此用例中的表现仍然具有挑战性。传统的自然语言生成指标无法捕捉临床相关的故障模式,例如遗漏关键诊断、跨时间不一致或误述护理计划[15 (https://arxiv.org/html/2608.26154#bib.bib15)]。此外,关于如何在部署后监控这些系统的指导有限,特别是在模型行为漂移、底层数据分布变化以及患者亚组间性能差异等方面[8 (https://arxiv.org/html/2608.26154#bib.bib29)]。 在这项工作中,我们考察AI生成的患者摘要作为生成式AI面向临床医生的、安全关键的应用。我们聚焦于在临床环境中负责任部署AI生成摘要所需的评估、治理和监控实践。我们采用一个框架,重点关注具有临床意义的质量维度,如连贯性、流畅性、一致性、相关性和临床用途,以评估此类摘要的质量。我们还探讨了在某些场景下,作为评估者的LLM可能不如用于生成摘要的LLM准确的情况。LLM生成摘要的质量由Guy’s and St Thomas’ Hospital的临床人员进行评估。通过在生产环境中使用人类参与和LLM-as-a-judge评估AI生成的摘要,我们展示了如何利用此类评估的见解来改进AI生成摘要在临床环境中的部署和使用。 ## II相关工作 早期的临床摘要研究侧重于应用于结构化或半结构化电子健康记录(EHR)数据的基于模板的方法,包括出院小结、病程记录和放射学报告[11 (https://arxiv.org/html/2608.26154#bib.bib1),14 (https://arxiv.org/html/2608.26154#bib.bib2)]。这些系统强调事实准确性和可追溯性,但在灵活性和个性化方面往往受限。较新的方法利用在大型临床语料库上训练的神经摘要模型,展示了改进的流畅性和连贯性[7 (https://arxiv.org/html/2608.26154#bib.bib3),28 (https://arxiv.org/html/2608.26154#bib.bib4)]。然而,多项评估强调了语言质量与忠实度之间的权衡,包括遗漏临床显著细节和产生虚构内容[13 (https://arxiv.org/html/2608.26154#bib.bib5)]。随着大型语言模型的出现,多项研究探讨了临床笔记的零样本或少样本摘要[21 (https://arxiv.org/html/2608.26154#bib.bib6)]。尽管这些模型表现出强大的表层性能,但实证评估显示了与数值错误、未经证实的断言以及跨提示变异性相关的风险[9 (https://arxiv.org/html/2608.26154#bib.bib7)]。这些发现突显了在临床环境中部署基于LLM的摘要时,需要领域特定的约束和评估框架。 另一项并行工作研究了将临床医生编写的文档转换为患者可理解语言。关于通俗语言出院说明、访视后摘要和共同决策工具的研究表明,可读性和相关性显著影响患者的理解、依从性和满意度[26 (https://arxiv.org/html/2608.26154#bib.bib8),5 (https://arxiv.org/html/2608.26154#bib.bib9)]。最近的基于LLM的系统在生成更自然和富有同理心的解释方面显示出潜力[3 (https://arxiv.org/html/2608.26154#bib.bib10)]。面向患者的摘要引入了独特的安全考量,因为错误可能直接影响患者在临床监督之外的理解和行为。除了患者使用外,LLM在医疗保健中的应用已扩展到临床文档辅助、决策支持和患者参与等多个领域[24 (https://arxiv.org/html/2608.26154#bib.bib11),20 (https://arxiv.org/html/2608.26154#bib.bib12)]。需要指出的是,对此类摘要的真实世界评估强调,模型输出应被视为辅助性的而非权威性的[19 (https://arxiv.org/html/2608.26154#bib.bib13)]。 AI生成的摘要可能导致幻觉、事实不准确和遗漏。人在回路设计、检索增强生成和有界知识源已成为应对此类问题的常见缓解策略[10 (https://arxiv.org/html/2608.26154#bib.bib14)]。然而,需要注意的是,在医疗领域评估生成模型会带来其自身独特的挑战,例如传统NLP指标(如ROUGE和BLEU)与临床有用性和安全性相关性较低[15 (https://arxiv.org/html/2608.26154#bib.bib15)]。因此,最近的工作强调围绕事实性、相关性和可操作性等维度进行人类评估,以及针对幻觉和遗漏的特定任务错误分类[17 (https://arxiv.org/html/2608.26154#bib.bib16)]。在医疗环境中,对大型语言模型的实证评估已证明其存在临床显著的幻觉率以及跨专科的表现差异。研究强调了当这些系统用于患者沟通或临床决策支持时的风险[18 (https://arxiv.org/html/2608.26154#bib.bib25)]。评估医学问答和出院小结生成的研究进一步表明,正确性和潜在危害必须由临床医生明确评估,而非从自动化分数中推断[27 (https://arxiv.org/html/2608.26154#bib.bib24)]。 医疗保健中的偏见和公平性对于LLM输出也日益受到关注。研究记录了在不同人口群体、临床状况和语言变体之间的性能差异[22 (https://arxiv.org/html/2608.26154#bib.bib17)]。在面向患者的应用中,这种差异可能加剧现有的健康不平等,因此需要偏见审计、亚组分析以及针对漂移和非预期行为的部署后监控[25 (https://arxiv.org/html/2608.26154#bib.bib18)]。此外,源自电子健康记录和临床文档的训练数据可能编码了获取、诊断和治疗方面的历史不平等,如果未明确处理,生成式系统可能会放大这些不平等[16 (https://arxiv.org/html/2608.26154#bib.bib23)]。语言模型也可能在英语能力有限的患者或需要文化细微差别的健康叙事方面表现不佳,引发对公平沟通和理解的担忧[18 (https://arxiv.org/html/2608.26154#bib.bib25)]。因此,医疗保健领域中关注公平性的评估方案越来越多地纳入分层性能报告、反事实测试和利益相关者参与,以确保基于LLM的系统不会系统性地损害弱势群体[1 (https://arxiv.org/html/2608.26154#bib.bib22)]。 参见标题图1:评估分数的层次聚类突显了AI生成摘要的三种不同质量表型 ## III癌症护理监测应用 AI生成摘要的环境是一个癌症护理应用,该应用是数字癌症护理协调和远程监测平台的一部分,旨在支持患者、照护者和肿瘤团队在整个治疗过程中。该应用使患者能够实时报告症状、跟踪药物、记录生命体征并记录情绪或幸福感。患者还可以选择添加自由文本的日记条目。总之,应用中的数据是他们在医院环境之外健康的纵向记录。在传统医院接触点之外收集纵向患者报告和生理数据非常有价值,因为它捕捉了疾病和治疗在真实世界环境中的亲身体验,否则这些对临床医生是不可见的。许多具有临床意义的事件,例如早期毒性信号、功能下降、用药不依从、情绪恶化或细微的症状升级,发生在两次就诊之间。像这样的持续和结构化的远程数据收集减少了回忆偏倚,能够更早地发现恶化情况,并支持主动干预而非被动护理。从系统的角度来看,此类数据还丰富了预测建模,改进了风险分层,并允许基于真实世界轨迹(而非门诊就诊时的片段快照)优化护理路径[12 (https://arxiv.org/html/2608.26154#bib.bib26)]。鉴于数据量庞大,其摘要成为临床医生有用的概览。 ## IV评估方法论 患者报告的数据(包括药物、症状、体重、生命体征(心率、血压、体温、血氧饱和度)、情绪和自由文本日记等)被输入LLM(Claude Sonnet 3.7),该模型根据预定义的提示生成摘要。然后,由人类领域专家和通过自动化验证(LLM-as-a-judge)对摘要进行验证。我们与英国NHS信托旗下的Guy’s and St Thomas’ Hospital合作进行验证。医院的一组临床医生自愿支持测试。该团队包括一个跨职能的领域专家小组:急性肿瘤评估临床医生、乳腺专科护士、皮肤肿瘤科医生、老年肿瘤联络发展(GOLD)团队成员和肿瘤科物理治疗师。专家们需要完成评审并对不同患者的AI生成摘要进行评分。 专家们需要导航到患者资料,阅读AI生成的摘要,并手动审查患者的数据。然后,他们需要根据多个标准对摘要进行评分。专家被要求对每个单独的测试案例按1-5分进行评分,其中1分极低,5分极高,评分标准如下: 参见标题图2:发散堆叠条形图显示了专家对AI生成临床摘要在各评估维度的评分分布,响应分为负面(1-2)、中性(3)和正面(4-5)类别。 - •准确性:摘要正确反映了患者的临床事实,没有错误。 - •完整性:包含所有临床相关细节。 - •清晰度:易于理解,无歧义。 - •临床相关性:聚焦于决策重要的信息。 - •忠实度:没有超出数据的无依据推断。 - •无偏见:避免了带有污名化或文化敏感性的陈述。 此外,还有开放式问题,专家可以提供反馈。 - •摘要是否遗漏了任何重要的临床细节?摘要遗漏了哪些重要的临床细节? - •摘要是否做出了任何不受数据支持的过度概括或假设?摘要做出了哪些不受数据支持的过度概括或假设? - •摘要是否包含任何事实错误?摘要包含了哪些事实错误? - •摘要是否使用了任何模糊或令人困惑的语言?摘要包含了哪些模糊或令人困惑的语言? - •摘要是否包含任何潜在的不安全陈述? - •摘要包含了哪些潜在的不安全陈述?总体质量评分(1-5) - •您在真实临床环境中会信任这个摘要吗?摘要的优势有待改进的领域在临床决策中使用的潜在风险对AI系统的额外意见或建议 专家们还给出了摘要的总体评分,可以理解为该摘要是否满足基本正确性和安全期望。例如,在摘要可能不符合标准的情况下,例如关键错误(如事实性错误)
相似文章
人工智能代理起草转化影响摘要的真实世界评估
本文对一种为临床学者起草转化影响摘要的人工智能代理进行了真实世界评估,结果显示,每位学者的工作人员时间从15小时减少到14分钟,可用率为81.7%。
技能增强型AI代理在医学研究分析中的应用:一项NSCLC转录组生物标志物任务中的探索性多模型人类评估
本探索性研究在NSCLC生物标志物任务中使用多模型人类评估,评估将AI代理与医学研究技能包相结合是否能提高转录组研究分析输出的质量(与原生AI相比)。结果显示有方向性但无统计显著性的改善,强调了进行更大规模、更稳健评估的必要性。
忠实设计:为多利益相关方受众评估和改进LLM生成的临床试验摘要
本文引入了一个基准评估框架,用于衡量针对不同利益相关方受众的LLM生成临床试验摘要的忠实性。该研究测试了GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash模型在1,800份摘要上的表现,并提出了一种知识图谱增强的检索系统,显著提升了忠实性得分。
在信息缺失情况下评估医疗人工智能:同源评审者与人工评分者改变表观安全性
本文将信息缺失压力测试推广至开放式医疗对话,发现大语言模型评审者的选择会显著改变表观安全性,且LLM评审者比临床医生更为宽松。
通过非专业摘要放射报告提高健康素养:对BioNER与检索增强生成的评估
本研究评估了检索增强生成(RAG)和命名实体识别(NER)在改善放射报告自动非专业摘要中的应用,发现NER提升了可读性和质量,而RAG的效果因微调而异。