真实世界临床护理中的推理:为什么大语言模型尚不能安全用于自主临床决策支持
摘要
这篇观点文章认为,大语言模型尚不能安全用于自主临床决策支持,尤其是在对未分诊患者进行分诊时,原因在于缺乏在不完整信息和漏诊不对称成本条件下的稳健评估。
arXiv:2607.28677v1 公告类型:新
摘要:大语言模型(LLM)现已通过医学执业资格考试,并且在精选病例中,其诊断推理能力可与医生媲美。这些进展加速了LLM在症状评估和临床决策支持中的应用,涉及诊断与治疗指导、行政文档记录以及基于规则的警报增强。本观点文章关注其中最具影响力的应用:在几乎没有临床医生参与的情况下,对自行就诊、未分诊患者进行自主分诊。就这一任务而言,安全性的证据尚不存在。差距不在于医学知识,而在于临床评估的保真度:一个以继续生成最可能文本为优化目标的模型,并未针对在安全答案是可能性极低但不可漏诊的诊断时安全行动而优化。安全分诊不是选择最可能的诊断;它是在不对称成本下的序贯决策,其中一次灾难性漏诊抵得过许多次误报,而决定性信号可能是患者未曾主动提供的信息——也是模型未被训练去主动寻求的信息。因此,核心缺陷在于不确定性下的信息收集。在病史不完整的情况下,LLM系统可能无法表现出安全分诊所需的行为:拓宽鉴别诊断范围;主动寻找缺失的危险信号;降低升级处置的阈值;在获得足够信息之前暂缓判断;以及在高危害诊断未被排除时升级关注。考虑到迄今为止的评估往往使用完整、精心整理、基于置信度门控的模拟,LLM的这些失败模式可能难以被发现。在这些条件下应用LLM,若未受临床分诊逻辑约束,可能因类似助手的表现和正向偏差而被放大,包括轻信、迎合倾向和校准不良。
查看缓存全文
缓存时间: 2026/08/03 07:29
# 真实临床护理中的推理:为什么大语言模型尚不足以安全用于自主临床决策支持 来源:https://arxiv.org/html/2607.28677 Shayndhan SivanathanAtman Labs牛津大学医院纳菲尔德骨科、风湿病学和肌肉骨骼科学系,牛津大学NIHR牛津生物医学研究中心Mehdi ZademAtman LabsRyaan SultanAtman Labs帝国理工学院Nicolas von MallinckrodtAtman Labs慕尼黑工业大学Max SolovyevAtman LabsAlexey MatyushkinAtman LabsSumon SadhuAtman LabsGabriele C DeLuca纳菲尔德临床神经科学系,牛津大学Sanjeeva Jeyaretna牛津神经外科系纳菲尔德外科科学系,牛津大学James Hillis马萨诸塞总医院神经科马萨诸塞总医院布莱根人工智能,马萨诸塞总医院布莱根哈佛医学院Manoj RamachandranBarts Health NHS TrustPrakash Jayakumar德克萨斯大学奥斯汀分校戴尔医学院外科与围手术期护理系 ###### 摘要 大语言模型(LLM)现已通过医学执业考试,并且在精选病例中,其诊断推理能力可与医生媲美。这些进展加速了大语言模型在症状评估和临床决策支持中的应用,涵盖诊断与治疗指导、行政文档记录以及基于规则的警报增强。本视角文章关注的是这些应用中最具后果性的一种:在几乎没有临床医生参与的情况下,对自我就诊、未分诊患者进行自主分诊。对于这一任务,安全性的证据尚不存在。 差距并不在于医学知识,而在于临床评估的保真度:一个以延续最可能文本为优化目标的模型,并未被优化为在安全答案是可能性极低的“不可漏诊”诊断时安全行事。安全分诊不是选择最可能的诊断;它是在不对称成本下的序贯决策,其中一次灾难性的漏诊胜过无数次误报,而决定性信号可能是患者未曾主动提供的——也是模型未被训练去主动寻求的。因此,核心缺陷在于不确定性条件下的信息收集能力。在不完整病史下,LLM系统可能无法表现出安全分诊所需的行为:扩大鉴别诊断范围;主动寻找缺失的危险信号;降低升级处置的门槛;在获得足够信息之前暂缓判断;以及在存在高危害诊断未被排除时升级关切。 考虑到迄今为止的评估通常使用完整、精心策划、基于置信度门控的模拟,LLM的这些失败模式可能难以被发现。这些模拟并不适合测试在信息缺失条件下的推理能力。此外,在这些条件下应用LLM可能会被类似助手的行為和正向偏差所放大,包括轻信、迎合和校准不良——当这些行为未被临床分诊逻辑约束时尤为如此。我们提出一个前提要求:关于自主临床决策支持的声明以及基于AI推理的评估,应在经过验证的合成患者和真实患者遭遇中纳入不完整信息和不对称成本压力测试。 关键词:大语言模型;临床决策支持;人工智能;分诊;医学推理;患者安全;基准有效性 通讯作者:Shayndhan Sivanathan MBBS,英国牛津大学医院。电子邮箱:[email protected] (https://arxiv.org/html/2607.28677v1/mailto:[email protected]) ## 1 准备就绪的幻象:通过考试并不等于胜任实践 按照传统标准,大语言模型(LLM)已经进入医学领域。它们在医学执业考试中取得近乎满分的成绩,而最强大的推理模型现在在要求较高的诊断任务上可与医生匹敌甚至超越医生[1 (https://arxiv.org/html/2607.28677#bib.bib1)]。这一表现几乎完全建立在基准测试上:对模型进行评分的标准化精选病例测试集。例如,OpenAI o1在经验证的基准测试中获得了近乎完美的临床推理质量分数,并且在针对真实急诊科病例的盲法比较中,在测得的每个诊断接触点上均优于主治医师[1 (https://arxiv.org/html/2607.28677#bib.bib1)]。我们关注的不是面向临床医生的辅助工具,而是目前正被提议用于一线应用的场景:对未分诊患者进行自主分诊,几乎没有临床医生参与。然而,有两项发现暴露了这一结果与自主分诊胜任能力之间的距离。首先,该模型纳入“不可漏诊”诊断的比例并未显著高于它在其他方面超越的医生。其次,即使是初次分诊时的“有限信息”,也是由医生撰写的结构化临床文档,而不是患者的非结构化前瞻性叙述——患者并不清楚哪些细节重要。用作者自己的话来说,这项评估是在基于文本的输入上进行的,这些输入依赖于“临床医生精心策划和‘整理’病例的工作”[1 (https://arxiv.org/html/2607.28677#bib.bib1)]。在基准测试中,这种结构由出题者提供——即临床医生在模型看到病例之前就组装并完善了病例。在临床中,这种结构必须在不确定性条件下通过提出正确的问题来构建。这正是当前基准测试很少设定的任务。 这一差距的规模已被直接测量。在一项针对1,298名公众的随机、预注册研究中,三个前沿LLM(GPT-4o、Llama 3、Command R+)在使用精选输入进行测试时,在94.9%的场景中识别出相关疾病,但一旦真实用户通过对话表达自己的问题,这一比例降至不足34.5%[2 (https://arxiv.org/html/2607.28677#bib.bib2)]。使用这些模型辅助的参与者的表现并不优于完全没有AI的对照组[2 (https://arxiv.org/html/2607.28677#bib.bib2)]。知识没有改变;输入改变了。关键在于,失败并不仅仅是患者描述症状不佳。模型通常会在对话中途浮现出正确疾病,却未能引出缺失的细节,或未能确保该细节最终体现在决策中[2 (https://arxiv.org/html/2607.28677#bib.bib2)]。模型拥有提问的知识——但它没有提问的目标。在临床中,这项工作由临床医生完成:结构化病史并非患者主动提供的,而是医生通过定向提问构建出来的。当出题者的角色被移除时,它所产生的高表现也随之消失。 这并不是单一研究的特殊性。一项对445个基准的系统综述发现,该领域通常通过缺乏构念效度的代理指标来测量能力——这些任务无法代表它们声称要评估的现象[3 (https://arxiv.org/html/2607.28677#bib.bib3)]。执照分数证明的是在结构化问题上的回忆能力,而不是在面对未结构化、信息透露不完整的患者时进行安全推理的能力。这种失败并非均匀分布:模型鲁棒性在最罕见和最模糊的临床术语上退化最为严重[4 (https://arxiv.org/html/2607.28677#bib.bib4)],而恰恰集中在非典型、不可漏诊的表现所在之处——即定义安全性而非平均准确性的病例。当被用来推断自主分诊的胜任能力时,执照分数不仅不足,而且指向了错误的方向:恰恰在能力未被测试的地方证明了能力。 LLM正从工程基准测试转向被提议用于一线护理:嵌入搜索结果、作为症状检查器提供、并作为面向临床医生的决策支持进行试点。这些场景在自主性、监督和风险方面差异巨大——人类参与度应在这种谱系中被明确界定,而非默认假设[5 (https://arxiv.org/html/2607.28677#bib.bib5)]。自主分诊位于这一谱系的最远端,而这正是该领域已经在迈出的一步,目前已有“自主”初级保健和急诊系统的报道[6 (https://arxiv.org/html/2607.28677#bib.bib6),7 (https://arxiv.org/html/2607.28677#bib.bib7),8 (https://arxiv.org/html/2607.28677#bib.bib8),9 (https://arxiv.org/html/2607.28677#bib.bib9),10 (https://arxiv.org/html/2607.28677#bib.bib10)]。 更深层的问题在于,这一底层基础从未被设计来做这件事。LLM训练优化的目标有两个:预训练教会模型延续最可能的文本——扩展已有的内容,但这不会登记缺失的内容;对齐则将其调谐为符合人类偏好和有用性。这两个目标都不代表安全分诊的逻辑,这种逻辑是不对称的:一次灾难性的漏诊和一次不必要的扫描并非等价的错误,而且决定性信息可能是患者未曾主动提供的。当前模型仍然是医学知识和综合能力方面可用的最强基础;缺陷不在于知识。而在于训练的任何阶段都没有要求它们表征犯错的非对称代价——也没有任何基准,以其完整的题干和单一最佳答案,来测试它们是否做到这一点。 以下各节将展开论证:从沉默中推理需要什么,为什么现有证据掩盖了其缺失,辅助行为如何加剧这一问题,以及部署应要求什么样的证据。 参见图注图1:基准测试表现并不能测试安全分诊所依赖的能力。当前的评估(左列)提供完整的、临床医生撰写的病例题干,并对诊断准确性进行评分。在这些条件下,前沿模型实现了近乎完美的推理分数,并能在94.9%的病例中识别相关疾病[2 (https://arxiv.org/html/2607.28677#bib.bib2)]。真实分诊(最右列)则以不完整、极简的患者叙述开始,其中决定性的细节——改变处置决策的危险信号——往往未被主动提供。当真实用户表达自己的问题时,疾病识别率从94.9%降至34.5%以下[2 (https://arxiv.org/html/2607.28677#bib.bib2)]。这一差距代表了我们认为当前标准基准很少评分的三种行为:(1)主动寻找缺失的危险信号;(2)信息不足时推迟判断;以及(3)根据危险性而非可能性对诊断进行升级处置。根本原因是目标不匹配(底部面板):预训练(下一个词延续)和对齐(有用性和偏好)都无法代表漏诊诊断的不对称代价。 ## 2 从沉默中推理:证据缺失并不等于疾病不存在 我们将从沉默中推理定义为从具有诊断信息价值的缺失信息中进行推断:识别出患者未说出的内容可能反映的是信息收集不完整,而非症状真正不存在。 考虑这个代表性病例:一名41岁女性打开一个消费者分诊工具,报告从前一天开始头痛。她天性寡言:她没有主动提及疼痛在几秒钟内达到峰值,这是她一生中最严重的头痛,或者是在她提起行李箱时突然开始的。模型没有追问。根据所给的片段信息,它产生了一个看起来很专业的回答:紧张型头痛、偏头痛,并在被追问时提及蛛网膜下腔出血是可能之一。然后它建议腰椎穿刺没有指征,并将她分配至常规随访。它被告知的所有内容都没有被误解。危险完全在于它从未问过的事情。 这种情况并不反映知识失败。给定完整病史,同一类模型能识别出正确诊断,包括以97.5%的准确率识别出蛛网膜下腔出血[11 (https://arxiv.org/html/2607.28677#bib.bib11)]。缺陷不在于知识,而在于目标:一个被训练为延续最可能文本的模型,对于从未被告知的危险没有内在表征——而分诊要求推理关于缺失的内容,而不仅仅是已有的内容。 面对稀疏病史,临床医生被训练做三件事,而以概率最大化为目标的模型不会做这些事。他们会扩大鉴别诊断而非缩小,因为不确定性提高了而非降低了风险。他们会降低检查的门槛,因为漏诊蛛网膜下腔出血的代价与一次不必要扫描的代价不对称——前者要大出几个数量级。而在做出决定所需的信息确实缺失时,他们会推迟并追问。在稀疏病史评估中,模型在这三个维度上往往都失败了。 一项大规模压力测试在更大规模上证实了这一失败模式。在跨越全部交流风格和信息完整度谱系的1,000次模拟头痛咨询中,前沿模型并未随着病史变稀疏而变得更加谨慎——即使出错时仍保持自信。当信息从完整病史降到20%的完整信息时,模型认识到自己尚无法决定的比率几乎没有变化,仅从5.2%上升到13.8%,而其鉴别诊断范围根本没有扩大[11 (https://arxiv.org/html/2607.28677#bib.bib11)]。在一个测试模型是否认识到自身知识局限的基准上,几乎没有一个模型能标记出因信息缺失而无法回答的问题,而是以完全自信作答[12 (https://arxiv.org/html/2607.28677#bib.bib12)]。模型根据眼前的信息进行推理;缺失的内容对其置信度不产生任何作用。 模式是一致的:模型将未被告知的内容视为不具有任何权重,而将被告知的内容——无论信息多么碎片化、无论由谁提供——视为足以做出决定。它将证据缺失与疾病不存在混为一谈。一个适合分诊的系统应当反其道而行之:将未提出的问题视为其手中最具决策相关性的信息量,将未排除的灾难性诊断视为最无权忽视的东西。当前系统两者都不可靠地做到。 ## 3 为什么证据看不到失败:成功是在错误的患者群体上测量的 如果这种失败是真实的,为什么证据没有暴露它?因为最常被引用为临床准备就绪证据的研究,恰恰是在最不可能暴露这一问题的环境中进行的[6 (https://arxiv.org/html/2607.28677#bib.bib6),7 (https://arxiv.org/html/2607.28677#bib.bib7),8 (https://arxiv.org/html/2607.28677#bib.bib8),9 (https://arxiv.org/html/2607.28677#bib.bib9),10 (https://arxiv.org/html/2607.28677#bib.bib10)]。所报道的成功是真实的。但它们是有条件的:是在高急性度或模糊表现已被排除的人群上测量的。 这种模式始于基础性演示。AMIE是最突出的对话式诊断系统,在病史采集和诊断质量的大多数方面达到或超过了初级保健医生。然而,它是在经过验证的标准化患者演员的咨询中实现的,通过其作者自己称为“在临床实践中不熟悉”的同步文本界面进行,且处于公认的“实验性模拟病史采集的有限范围”内[13 (https://arxiv.org/html/2607.28677#bib.bib13)]。其纵向管理评估重复了相同的模式,其作者指出其病例“缺乏真实患者护理中用于确定临床病史所需的图表审查的大部分内容”,且病例组合“不能指示或代表真实临床实践环境”[14 (https://arxiv.org/html/2607.28677#bib.bib14)]。模拟患者不会隐瞒他们不知道的内容——他们表演的是完整剧本中的角色。它们无法模拟省略的说服力,即患者不知道什么才是相关信息的真实描述。当评估论文承认这些限制时,它们仍被引用为自主临床部署的证据。
相似文章
强化学习用于大型语言模型的寻求证据诊断推理
本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。
大语言模型在代理式临床推理中的信息寻求失败
本文为血液肿瘤学中的临床推理开发了一个代理式评估框架,发现大语言模型的主要失败原因在于系统性的信息寻求缺陷,而非知识不足,其错误模式类似于新手临床医生的认知偏差。
在标准化病例中评估大语言模型在动态临床决策中的表现
研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。
人为不容忍:临床文档中的污名化语言扭曲大语言模型决策
这项研究表明,大语言模型会继承并放大临床笔记中污名化语言带来的偏见,导致患者管理趋于保守,且当前的缓解策略效果有限。
ClinicalMC:面向大语言模型的多疗程临床决策基准
ClinicalMC是一个基准,旨在评估大语言模型在多疗程临床决策中的表现,包含中文和英文数据集以及一个多智能体评估框架。