忠实设计:为多利益相关方受众评估和改进LLM生成的临床试验摘要
摘要
本文引入了一个基准评估框架,用于衡量针对不同利益相关方受众的LLM生成临床试验摘要的忠实性。该研究测试了GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash模型在1,800份摘要上的表现,并提出了一种知识图谱增强的检索系统,显著提升了忠实性得分。
arXiv:2607.09932v1 公告类型:新发布
摘要:大型语言模型越来越多地被用于为医疗保健提供者、患者和支付方总结临床试验结果,但在这种高风险场景中,其产生幻觉的倾向带来了显著风险。本研究引入了一个基准评估框架,用于衡量LLM生成的临床试验摘要针对三个利益相关方受众的忠实性。该框架包含200项分层试验,这些试验来自ClinicalTrials.gov数据库的聚合分析,并使用针对特定受众的提示模板和六维忠实性标注模式进行评估。针对GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash模型,在1,800份生成的摘要上建立了基线测量结果,这些摘要使用交叉编码器自然语言推理(NLI)模型进行评分。在所有三个模型中,无依据声明被确定为主要的失败模式,平均标注得分为1.55分(满分3分)。开发了一个知识图谱增强的检索系统,并与基线进行了对比评估,结果显示基于NLI的忠实性得分在统计上显著提升(蕴涵增加0.0125,忠实性增加0.0130,p < 0.0001)。改进路径因模型而异,GPT-4o主要通过减少矛盾来提升,而Claude Sonnet 4.6和Gemini 2.5 Flash则通过增加蕴涵来实现改进。
查看缓存全文
缓存时间: 2026/07/14 04:21
# 忠实设计:面向多利益相关方受众评估与改进LLM生成的临床试验总结 来源:https://arxiv.org/html/2607.09932 罗伯特·威廉姆斯 ###### 摘要 大型语言模型日益被用于为医疗提供者、患者和支付方总结临床试验结果,但它们产生幻觉的倾向在这一高风险场景中构成显著风险。本研究引入了一个基准评估框架,用于衡量LLM生成的临床试验总结在三个利益相关方受众中的忠实度。该框架包含从ClinicalTrials.gov聚合分析数据库中抽取的200项分层试验,使用受众特定的提示模板和六维度忠实度标注模式进行评估。针对GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash三个模型,在1800篇生成的总结上建立了基线测量,并使用交叉编码器自然语言推理(NLI)模型进行评分。在所有三个模型中,“无依据声明”被确定为主要的失败模式,平均标注得分为1.55分(满分3分)。我们开发了一个基于PubMed知识图谱的知识图谱增强检索系统,并在基线基础上进行了评估,结果在基于NLI的忠实度评分上产生了统计学显著改善(蕴含度+0.0125,忠实度+0.0130,p<0.0001)。改善途径因模型而异:GPT-4o主要通过减少矛盾来改善,而Claude Sonnet 4.6和Gemini 2.5 Flash则通过增加蕴含度来改善。 临床试验总结,忠实度评估,幻觉检测,知识图谱,检索增强生成,NLI,大型语言模型 ††会议:UT奥斯汀AI健康;2026年春季;得克萨斯州奥斯汀††CCS:计算方法学→自然语言处理††CCS:应用计算→健康信息学 ## 1. 引言 临床试验结果是医疗领域最具影响力的文件之一。它们支撑着监管批准,指导处方和治疗决策,引导支付方的覆盖范围确定,并且必须以通俗语言传达给患者以支持知情同意。一项完成的试验可能需要为医疗提供者、患者和支付方分别提供不同的总结,每种总结都需要对相同的潜在证据进行不同的框架处理。ClinicalTrials.gov目前列出了超过40万项注册试验,这种总结工作目前落在熟练的医学写作者身上,他们必须为每个受众翻译复杂的研究结果而不歪曲事实。 大型语言模型(LLMs)是自动化这一过程的自然候选者。它们能够综合复杂的科学文本,针对不同受众调整语气和框架,并以人类写作者无法匹及的速度和规模运行(landman2024llm, https://arxiv.org/html/2607.09932#bib.bib1)。然而,LLMs已知会产生幻觉,产出与源材料不忠实却看似流畅连贯的输出(min2023factscore, https://arxiv.org/html/2607.09932#bib.bib2)。在一项涉及12,999个临床医生标注句子的临床总结研究中,Asgari等人发现幻觉率为1.47%,其中44%的幻觉被归类为重大幻觉,意味着它们具有真实影响患者诊断或临床管理的潜力(asgari2025framework, https://arxiv.org/html/2607.09932#bib.bib3)。在临床试验沟通的背景下,即使很低的幻觉率也是不可接受的:虚构的效应量、隐瞒的不良事件或夸大的益处都可能扭曲处方决策、覆盖范围确定或患者对自身治疗的理解。 尽管存在这种风险,目前尚无标准化的框架来系统评估LLMs在多个利益相关方受众中如何忠实地总结临床试验结果。现有的基于NLI的忠实度指标虽是为通用总结任务开发的(jia2023zeroshot, https://arxiv.org/html/2607.09932#bib.bib4;zhang2024finegrained, https://arxiv.org/html/2607.09932#bib.bib5),但尚未针对医疗领域最具后果的失败模式(无依据声明、选择性报告和统计误导)进行验证。 本文做出三项贡献。首先,我们引入了一个基准评估框架,包含从ClinicalTrials.gov聚合分析(AACT)数据库中抽取的200项分层试验,针对三个利益相关方受众使用受众特定提示模板和六维度忠实度标注模式(在一到三的有序量表上评分)进行评估。其次,我们应用该框架为三个领先的LLM(GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash)建立了基线忠实度测量,生成了1800篇总结,由交叉编码器NLI模型(DeBERTa-v3-small)(he2021deberta, https://arxiv.org/html/2607.09932#bib.bib6)进行评分,发现“无依据声明”是所有三个模型的主要失败模式,平均标注得分为1.55分(满分3分)。第三,我们引入了一个基于Xu等人开发的PubMed知识图谱(PKG)的知识图谱检索增强生成(KG-RAG)系统(xu2020pubmed, https://arxiv.org/html/2607.09932#bib.bib7),将PubMedBERT密集相似性搜索与PKG概念基础相结合,以用相关的生物医学文献增强LLM提示。KG-RAG在整体NLI忠实度评分上产生了统计显著的改善(蕴含度+0.0125,忠实度+0.0130,p<0.0001),且在所有三个模型中均呈现一致的改善方向。 本文其余部分组织如下:第2节回顾了临床试验总结、LLM忠实度评估和生物医学NLP中KG-RAG的相关工作。第3节描述了方法。第4节呈现结果。第5节和第6节提供讨论和结论。 ## 2. 相关工作 临床试验内容的总结已在NLP文献中有所探索,尽管先前的工作主要集中在结构化信息提取和抽取式总结,而非对生成输出的忠实度评估。早期的许多工作证明了自动化方法可以从临床试验文本中提取和总结结构化信息,为临床试验文本处理奠定了基础(gulden2019extractive, https://arxiv.org/html/2607.09932#bib.bib8;alhussaini2022ccs, https://arxiv.org/html/2607.09932#bib.bib9)。更近期的工作直接将LLMs应用于临床监管文件,包括为临床研究报告生成安全总结,并针对单一监管受众衡量与源表格的事实准确性(landman2024llm, https://arxiv.org/html/2607.09932#bib.bib1)。虽然这些研究证明了自动试验总结的可行性,但它们并未评估总结在多个利益相关方受众(如患者、临床医生和支付方)中的忠实度,因为每个受众需要相同试验结果的不同框架。此外,它们也未提供可跨所有模型和治疗领域复用的评估框架。本研究填补了这一空白。 NLI已成为评估AI生成总结忠实度的首选自动化替代指标(zhang2024finegrained, https://arxiv.org/html/2607.09932#bib.bib5)。核心方法将临床试验的源文档视为前提,每个生成句子视为假设,使用蕴含概率作为事实基础的度量。先前的工作已证明,基于NLI的零样本忠实度指标在抽象式总结任务中与人工判断具有有意义的关联,为注释密集型评估流程提供了一种可扩展的替代方案(jia2023zeroshot, https://arxiv.org/html/2607.09932#bib.bib4;zhang2024finegrained, https://arxiv.org/html/2607.09932#bib.bib5)。本研究在1800篇LLM生成的总结中,在句子级别应用交叉编码器NLI模型(DeBERTa-v3-small),使用蕴含均值作为主要忠实度指标。 KG-RAG已在生物医学NLP任务中显示出性能提升(soman2023biomedical, https://arxiv.org/html/2607.09932#bib.bib10;mortezaagha2026graph, https://arxiv.org/html/2607.09932#bib.bib11)。Xu等人引入了PKG,这是一种大规模资源,通过BioBERT提取的生物医学实体(包括药物、疾病和基因)链接PubMed摘要,并提供生物医学文献上的结构化概念级基础(xu2020pubmed, https://arxiv.org/html/2607.09932#bib.bib7)。进一步的研究表明,将知识图谱整合到RAG流程中比单独使用密集检索能产生更基于事实的输出(soman2023biomedical, https://arxiv.org/html/2607.09932#bib.bib10;mortezaagha2026graph, https://arxiv.org/html/2607.09932#bib.bib11)。本研究将PKG2020S4作为混合检索系统的概念基础层,将PKG实体匹配与密集的PubMedBERT嵌入相结合,以检索临床试验总结的证据丰富上下文。结果在所有三个模型上均有统计显著的改善,整体蕴含度提高了0.0125,忠实度得分提高了0.0130(两者p<0.0001)。 ## 3. 方法 ### 3.1. 数据集 本研究使用两个公开可得的数据源:AACT数据库和通过NCBI Entrez API检索的PubMed摘要。AACT提供构成忠实度评估真值的结构化试验记录;PubMed摘要构成KG-RAG系统使用的检索语料库。 AACT由临床试验转型倡议维护,提供完整ClinicalTrials.gov注册库的结构化平面文件导出(tasneem2012aact, https://arxiv.org/html/2607.09932#bib.bib12)。忠实度评估要求试验数据包含实际结果数据;因此,仅使用标记为“已完成”且已发布结果日期的研究。然后,每个记录使用AACT条件表中的条件关键词按治疗领域进行标记。选择了三个代表不同临床沟通挑战的治疗领域:肿瘤学、心理健康和2型糖尿病。肿瘤学试验通常涉及复杂多臂设计和分子靶向治疗;心理健康试验严重依赖患者报告的结果指标;2型糖尿病试验通常遵循良好标准化的终点惯例。过滤和标记后,三个领域共剩下15,546条试验记录:11,400条肿瘤学、2,634条心理健康和1,512条2型糖尿病。 每个试验记录为整个评估中使用的提示模板贡献了七个结构化字段:简短标题、简要总结、研究阶段、入组参与者数量、干预名称、主要结果和结果数据。这些字段共同代表了医学写作者或AI系统在生成面向利益相关方的总结时可用的信息。结果数据的包含使该数据集区别于仅含协议注册库,并使评估生成的总结是否准确代表试验结果(而非试验旨在测量的内容)成为可能。 PubMed摘要通过NCBI Entrez API检索,以作为KG-RAG系统的检索语料库。并非获取完整的PubMed档案,而是采用一种针对性方法:使用AACT的研究参考文献表识别范围内每项试验对应已发表结果论文的PubMed记录标识符(PMIDs),并仅获取这些摘要(ncbi2010entrez, https://arxiv.org/html/2607.09932#bib.bib13)。这产生了13,746篇唯一摘要,链接到数据集中的7,510项试验,每条记录包含标题、摘要文本、出版年份、期刊名称和MeSH术语。这些摘要代表了与待评估试验最直接相关的已发表证据基础,并作为混合检索器选择支持上下文文档的池。 为了使评估在计算上可行,我们从15,546条记录的池中构建了一个200项试验的分层基准。跨治疗领域应用分层随机抽样,以保留注册库的自然分布:146项肿瘤学试验、34项心理健康试验和20项2型糖尿病试验。抽样前,应用了质量过滤器,要求每个选定试验具有非空的总结、主要结果字段和结果数据字段,确保评估中的每个提示都是完整的,并且没有从部分记录生成总结。所有抽样使用固定的随机种子42,以确保跨运行的可重复性。图1(https://arxiv.org/html/2607.09932#S3.F1)显示了按治疗领域划分的基准组成。实施完整评估流程的代码可在https://github.com/rgw3/ai_in_healthcare_hrp获取。 图1:按治疗领域划分的基准组成(n=200项试验):146项肿瘤学(73%)、34项心理健康(17%)和20项2型糖尿病(10%)。 ### 3.2. 评估框架 该评估框架围绕三个利益相关方受众组织,每个受众代表一种不同的临床试验结果沟通场景。医疗提供者需要支持临床决策的总结;对于这一受众,忠实度侧重于疗效结果、不良事件、剂量背景和患者选择标准的准确表示。患者需要支持知情同意的通俗语言总结(donner2025patient, https://arxiv.org/html/2607.09932#bib.bib14);因此,针对这一受众的忠实度核心是无依据声明的缺失、风险与益处的比较,以及避免淡化或隐瞒不良发现的措辞。支付方需要支持覆盖范围和处方集决策的总结,这意味着针对这一受众的忠实度核心是主要终点、统计显著性和试验结果的比较有效性框架的准确表示。(amcp2024format, https://arxiv.org/html/2607.09932#bib.bib15) 为了在这三个受众中实现忠实度评估的操作化,我们开发了一个六维度标注模式。这些维度的动机来自两个来源:临床试验报告标准——特别是CONSORT 2010指南,涉及结果、不良事件和统计结果的透明报告(consort2010, https://arxiv.org/html/2607.09932#bib.bib16)——以及已建立的基于NLI的忠实度评估框架(jia2023zeroshot, https://arxiv.org/html/2607.09932#bib.bib4;zhang2024finegrained, https://arxiv.org/html/2607.09932#bib.bib5)。每个维度在一到三的有序量表上评分,其中三分表示完全忠实,二分表示小问题(如小的遗漏或不精确性,不会实质性地误导),一分表示明显的忠实度违规(如捏造的结果、无依据的声明或关键的遗漏)。六个维度是:事实准确性,定义为数值结果(包括效应量、百分比和p值)的正确表示;结果覆盖范围,定义为主要结果的存在和关键遗漏的缺失;风险与安全表示,定义为不良事件的准确和适当表示
相似文章
FaithMed:训练LLMs进行忠实的循证医学推理
FaithMed 是一个框架,通过将临床医生设计的评分标准与使用步骤级过程奖励分配的强化学习相结合,训练LLMs进行忠实的循证医学推理,在多个医学基准上相比基线取得了显著改进。
构建即忠实:基于主张锚定的多文档摘要归因
本文介绍了 CAMS,一个模块化的多文档摘要框架,它提取带有词元级来源的原子性主张,对等价主张进行聚类,并将其重写为具有细粒度、多源可追溯性的摘要,显著提升了忠实度和引用精度。
一个基于人类反馈循环的LLM科学摘要简化语料库
本文介绍了一种基于人类反馈循环的工作流程,用于创建LLM简化的科学摘要语料库,使用SciSummNet和GPT-4o-mini,结合非专家和专家反馈,以提高跨学科的可读性。
测量AI的忠实度——无论好坏
本文讨论了LLM优化中忠实度的重要性,引入了一种结构忠实度分数,通过测量词汇重叠、约束保留和任务类型匹配的漂移,确保提示优化不牺牲意图。
论提高文档生成播客的忠实度
本文首次系统研究了文档接地播客生成中的忠实度问题,提出了一个轮次级别的LLM作为评委的评估框架,以及一个与模型无关的捕获-修复方法,该方法能跨领域提高忠实度。