临床证据的强度可从语言模型表示中恢复,但无法从其陈述的等级中获取
摘要
本文表明,大型语言模型在内部编码了临床证据对主张的强度,但在被询问时未能准确表达这一强度,其陈述的证据等级表现近乎随机。
arXiv:2606.29034v1 Announce Type: new
摘要:大型语言模型(LLM)越来越多地用于总结临床证据,其中主张的分量取决于其得到支持的强度。然而,这些模型在传达置信度方面表现不佳,并且它们从未陈述的属性(例如真实性)通常可以从其激活中读取。临床模型是否记录了证据强度(区别于真实性)并在被询问时加以陈述,这一点尚未经过测试,而且任何此类信号都可能是词汇层面的。我们整理了来自六个公开来源的45,134条临床主张,将20,611条根据三个独立框架统一为四级证据等级,并测试了来自多个开发者的22个本地、开放权重的大语言模型(参数规模0.6-700亿;通用、医学和推理型),同时进行了词汇、真实性和跨框架控制。线性估计器在每个模型中均恢复了证据等级(中位AUROC 71.8),但可解码性并未随规模增加而提升,且在推理模型中表现最弱。模型陈述的等级降至随机水平,比估计器低25-27个百分点。可恢复的信号主要是词汇层面的,且无法跨主题或框架迁移,但它与事实真实性不同,并且仍然能标记出支持薄弱的声明(AUROC 69.2)。因此,临床LLM携带了一个有序的证据强度信号却未予表达,因此它们陈述的等级无法传达主张的支持度,即使该支持度可从其表示和文本中恢复。
查看缓存全文
缓存时间: 2026/06/30 05:29
# 临床证据的强度可从语言模型表示中恢复,但无法从其声称的等级中恢复 来源:https://arxiv.org/html/2606.29034 11institutetext:亚琛工业大学医学人工智能实验室,德国亚琛 22institutetext:亚琛大学医院诊断与介入放射学系,德国亚琛 33institutetext:斯坦福大学泌尿外科学系,美国加利福尼亚州斯坦福 44institutetext:斯坦福大学放射学系,美国加利福尼亚州斯坦福 ## 摘要 大型语言模型\(LLMs\)越来越多地用于总结临床证据,而某个主张的分量取决于其得到支持的程度。然而,这些模型传达置信度的能力较差,并且它们从未明确陈述的属性(如真实性)往往可以从其激活状态中读取。临床模型是否能够感知证据强度(与真实性不同),并在被询问时明确陈述该强度,这一点尚未得到检验,而任何此类信号可能都停留在词汇层面。我们整理了来自六个公开来源的45,134个临床主张,在三个独立框架下将20,611个主张统一为四级证据等级,并测试了来自多个开发者的22个本地开源权重LLMs(参数规模0.6–700亿;涵盖通用、医学和推理模型)。通过线性估计器,我们能够在每个模型中恢复证据等级(中位AUROC为71.8%),但可解码性并未随模型规模增大而提升,且在推理模型中表现最差。模型所陈述的等级仅达到随机水平,比估计器低25–27个百分点。可恢复的信号主要停留在词汇层面,无法跨主题或框架迁移,但与事实真实性有所区别,并且仍然能够标记支持薄弱的声明(AUROC为69.2%)。因此,临床LLMs携带着一个有序的证据强度信号,但它们并未表达该信号;因此,即使从它们的表示和文本中可以恢复出证据强度,它们所陈述的等级也无法传达主张的支持程度。 *通讯作者:Soroosh Tayebi Arasteh () ## 引言 大型语言模型\(LLMs\)正从基准测试演示转向临床实践,它们回答医学问题、起草临床文档,并为临床医生和患者总结证据\[42 (https://arxiv.org/html/2606.29034#bib.bib1), 50 (https://arxiv.org/html/2606.29034#bib.bib2), 54 (https://arxiv.org/html/2606.29034#bib.bib3), 43 (https://arxiv.org/html/2606.29034#bib.bib4)\]。在医学中,一个断言的价值不仅取决于它是否正确,还取决于它得到支持的强度:一项由多个大型随机对照试验\(RCTs\)支持的建议,与仅基于单一小型研究或专家意见的建议分量不同。为了让LLM的输出能够安全使用,读者必须能够区分其哪些主张得到充分支持,哪些则不然。然而,LLMs传达置信度的能力较差。它们所陈述的确定性校准不良,且常常无法跟踪答案是否正确\[27 (https://arxiv.org/html/2606.29034#bib.bib6), 31 (https://arxiv.org/html/2606.29034#bib.bib7), 51 (https://arxiv.org/html/2606.29034#bib.bib8), 57 (https://arxiv.org/html/2606.29034#bib.bib9)\],而且它们提供的解释可能会让读者比模型自身内部估计更加自信\[45 (https://arxiv.org/html/2606.29034#bib.bib10)\]。这些失败在医学领域尤其严重,因为当前模型在判断真实临床病例时仍会出错,同时几乎不表现出犹豫\[22 (https://arxiv.org/html/2606.29034#bib.bib5), 50 (https://arxiv.org/html/2606.29034#bib.bib2)\]。一个将初步发现与确定结论同样自信地陈述出来的模型,无法向读者提供证据强度的信号,而这正是临床判断所依赖的关键信号。 可解释性研究表明,缺失的信号或许仍然存在于模型内部。LLMs无法可靠陈述的属性(包括事实主张的真实性)往往可以从其隐藏激活状态中线性解码出来\[4 (https://arxiv.org/html/2606.29034#bib.bib13), 8 (https://arxiv.org/html/2606.29034#bib.bib12), 30 (https://arxiv.org/html/2606.29034#bib.bib14), 33 (https://arxiv.org/html/2606.29034#bib.bib11)\],最近的研究还认为,内部表示对模型自身正确性的编码程度超过了其输出所揭示的\[37 (https://arxiv.org/html/2606.29034#bib.bib15)\]。这为临床证据提出了一个具体可能性:模型可能在内部识别出一个主张的支持薄弱,但在被提示时却未能传达出来。这一点尚未得到检验,而且有理由保持谨慎。临床证据的强度是一个分级属性,由诸如建议评估、制定和评价分级\(GRADE\)框架和美国预防服务工作组\(USPSTF\)\[38 (https://arxiv.org/html/2606.29034#bib.bib34), 53 (https://arxiv.org/html/2606.29034#bib.bib35)\]的建议等级等系统正式定义,并且它与真实性不同:得到充分支持的主张有时会被推翻,既定实践的逆转足够常见,使得这种区别具体可感\[23 (https://arxiv.org/html/2606.29034#bib.bib17)\]。与此同时,看似内部的信号可能很浅层。近期分析表明,隐藏状态读取往往捕捉的是模型是否依赖记忆的统计关联,而不是陈述是否真实,并且这类信号部分由表面词汇线索驱动,无法跨数据集泛化\[9 (https://arxiv.org/html/2606.29034#bib.bib16), 37 (https://arxiv.org/html/2606.29034#bib.bib15)\]。因此,任何关于模型编码了证据强度的主张都必须与词汇线索、事实真实性以及测量语料库区分开来。 在此,我们通过22个本地开源权重LLMs(涵盖通用领域系列、医学领域适应模型\[28 (https://arxiv.org/html/2606.29034#bib.bib21)\]、推理蒸馏模型\[20 (https://arxiv.org/html/2606.29034#bib.bib23), 11 (https://arxiv.org/html/2606.29034#bib.bib22)\],参数规模从0.6亿到700亿)来探究:临床主张的证据等级是否可以从模型的隐藏状态中恢复出来?模型是否能够陈述它?我们构建了一个包含45,134个临床主张的语料库,全部来自公开可用的生物医学来源,包括自动提取的RCT证据\[34 (https://arxiv.org/html/2606.29034#bib.bib18), 29 (https://arxiv.org/html/2606.29034#bib.bib19), 36 (https://arxiv.org/html/2606.29034#bib.bib20)\]、国家预防保健建议以及既定实践的逆转编目\[23 (https://arxiv.org/html/2606.29034#bib.bib17)\],每个主张均在三个独立分级框架之一下进行了证据强度评级。通过线性估计器,并结合词汇和表面混淆因素的控制、将等级与事实真实性去相关的平衡设计,以及留一框架泛化测试,我们描述了这些模型编码了什么以及表达了什么。我们发现了一致的解离现象。证据等级在每个模型中都可以线性恢复,但与预期相反(更大或更专业的模型应具有更清晰的内部结构),在更大模型和经推理调优的模型中,解码效果并没有更好,反而常常更差。这些模型无法陈述其激活状态所编码的等级:口头表述的等级降至随机水平,在内部可恢复和表达的内容之间出现了较大且系统性的差距。这种可恢复的信号主要停留在词汇层面,无法跨主题或分级框架迁移,并且与事实真实性可分离。最后,尽管模型不会报告该信号,但外部评估者可以将其读出来,以标记支持薄弱的声明供审查。图1 (https://arxiv.org/html/2606.29034#Sx1.F1)总结了本研究。 \ \ 图 1: 研究概览。 a,在临床医学中,断言的分量取决于其得到证据支持的强度,这里以四级量表从高到非常低的支持强度进行顺序排列。 b,本研究探究语言模型是否在其隐藏激活状态中内部感知到这一强度,以及是否在其输出中陈述相同等级,即编码等级与陈述等级是否一致。 c,从六个公开生物医学来源整理了一个包含45,134个临床主张的语料库,其中20,611个在三个独立分级框架下统一为四级证据等级,并有一个子集额外标明了事实真实性。 d,该语料库用于评估22个开源权重语言模型,涵盖通用领域、医学领域适应和推理蒸馏系列,参数规模从0.6亿到700亿。 e,对于每个主张,提取冻结模型最终token的隐藏状态,训练线性估计器从表示中读取证据等级,同时单独提示模型陈述等级,从而定义了可恢复等级与陈述等级之间的核心比较。 f,进一步分析包括:该可恢复信号是否是词汇层面的、是否跨临床主题和分级框架泛化、是否与事实真实性可分离、是否可被引导,以及是否可以用于标记支持薄弱的声明。 ## 方法 ### 伦理声明 本研究仅使用公开可用、不可识别身份的二次数据,不涉及人类参与者,也没有涉及个人患者记录;因此无需机构审查委员会批准。所有数据来源均按照其各自的许可和使用条款使用;所有来源均已引用,且不重新分发任何派生语料库。所有模型均按照其各自的许可和可接受使用政策进行访问和使用;对于需要接受或访问请求的检查点,已在下载前完成。 ### 研究设计 我们测试了临床主张背后的证据强度是否可以从冻结的开源权重LLMs的内部状态中恢复,以及相同的模型在被询问时是否陈述该强度。分析单位是一个原子临床主张:一个简短的、陈述性的、无上下文的断言,例如某项服务对某个特定人群有益,并带有四级证据等级,以及在可确定的情况下带有事实真实性标签。我们通过公开生物医学来源整理了这样一个主张语料库,从22个LLMs(涵盖通用领域、医学和推理蒸馏系列)中提取每个主张的隐藏表示,并训练线性估计器从这些表示中读取证据等级。然后,我们将估计器恢复的内容与模型口头表述的内容进行比较,并运行一系列控制实验(针对表面和词汇线索、事实真实性以及跨主题和分级框架的泛化能力),以检验任何恢复的信号是否反映了可迁移的证据强度表示,还是仅仅反映了表面相关性。所有模型均使用冻结权重;未进行微调。 ### 临床主张语料库 该语料库包含从六个公开来源自动整理的45,134个独特临床主张,且在任何阶段均未进行人工整理。完整的构建流程(包括按来源提取、过滤、拆分以及所有按来源统计和交叉表)详见补充说明(补充说明1:临床主张语料库构建) (https://arxiv.org/html/2606.29034#Sx11)以及补充表格1 (https://arxiv.org/html/2606.29034#Sx11.T1)、2 (https://arxiv.org/html/2606.29034#Sx11.T2)和3 (https://arxiv.org/html/2606.29034#Sx11.T3)。三个来源提供了在既定框架下分级的临床推荐。USPSTF建议声明(带有A、B、C、D和I等级)从公开建议索引中收集(122个主张);将针对不同子人群分配不同等级的主题拆分为每个子人群和等级的一个中立主张,且主张文本仅由主题和服务类型构建,以便等级永远不会出现在措辞中。社区预防服务工作组\(CPSTF\)社区指南发现(224个主张)从官方所有活跃发现列表中解析为推荐、不推荐和证据不足三种发现\[7 (https://arxiv.org/html/2606.29034#bib.bib24)\]。医学逆转(395个主张)——曾经的标准实践后来被随机试验推翻——来自eLife逆转补充材料\[23 (https://arxiv.org/html/2606.29034#bib.bib17)\];每个反转持有其明显逆转前的等级和一个虚假的真实性标签,从而填充了本为空白的强等级但虚假的单元格。另外三个来源提供了试验级别的证据和主张多样性。Trialstreamer\[34 (https://arxiv.org/html/2606.29034#bib.bib18)\]是一个自动维护的RCT报告数据库,贡献了19,870个从提取的关键发现文本构建的主张;由于其偏倚风险得分严重右偏,试验依据语料库内分位数带进行分级(顶部带为中等,中间带为低,底部带为非常低)而非固定阈值,这是一个相对质量层级,按此报告;单个试验结果标记为真实性不确定。Evidence Inference \(EI\)\[29 (https://arxiv.org/html/2606.29034#bib.bib19)\]提供了19,670个声明试验报告结果方向的主张;每个显著方向结果还会生成其相反方向的反事实作为已验证的虚假主张,因此该来源在单一写作风格中携带了大量真假平衡信号,而零结果标记为真实性不确定。EBM-NLP\[36 (https://arxiv.org/html/2606.29034#bib.bib20)\]包含约4,853个带有手动标注人群、干预措施和结局的RCT摘要,每个摘要提供一个模板化主张以增加主题和词汇多样性,且既不携带等级也不携带真实性标签。每个来源都标准化为共同的行模式,记录主张文本、来源、临床主题、证据等级、原始框架等级、真实性标签、交叉单元格以及表面协变量(包括模糊限制语密度、token频率代理变量和主张长度)。在分裂之前,构建过程移除了非主张退化行:少于四个单词的行、字母字符少于一半的行(统计片段和引用),以及勘误、更正和撤回通知。在对主张文本进行完全去重后,语料库包含n=45,134个主张,其中n=20,611个带有四级证据等级;六个来源中有四个是分级的,另外两个(EI和EBM-NLP)未分级(图2 (https://arxiv.org/html/2606.29034#Sx2.F2)a)。完整组成见补充表格4 (https://arxiv.org/html/2606.29034#Sx11.T4)。 ### 证据分级与事实真实性标注 每个框架的原生等级统一为通用的四级有序量表(高、中等、低、非常低)。USPSTF等级A、B、C、D或I分别映射至高、中等、低、非常低;CPSTF中推荐和不推荐结果的强强度映射至高,充分或未说明强度映射至中等,证据不足结果映射至低;Trialstreamer的顶部、中间和底部严谨性带分别映射至中等、低、非常低;逆转则携带其明显逆转前的等级,高或(如已标注)中等。完整映射见补充表格5 (https://arxiv.org/html/2606.29034#Sx11.T5),关于映射的敏感性分析(用绝对阈值规则替代Trialstreamer分位数带)与主要可解码性结果一并报告。分级子集(n=20,611)包含...
相似文章
大型语言模型在医学推理中表现出元认知敏感性
一项对照研究评估了大型语言模型在医学推理中的元认知敏感性,发现部分但存在缺陷的置信度校准,其随证据强度和冲突情境而变化。
相同证据,不同目标:从语言模型状态解码诊断证据如何关联因果问题
本文研究语言模型是否能正确判断诊断证据如何支持或挑战不同的因果主张,并引入了仅改变因果目标的配对提示。在Qwen2.5-7B-Instruct等模型的倒数第二个Transformer隐藏状态上进行的线性读出显示,平衡准确率适中(0.654-0.659),并在49对中恢复了18-21对,表明因果相关性具有一定程度的线性可解码性。
医学因果假设验证与大语言模型
本文介绍了一项初步研究,评估大语言模型在验证医学因果假设方面的准确性,发现尽管它们表现出较高的召回率,但往往无法提供有效的科学证据或拒绝无支持的声明。
人为不容忍:临床文档中的污名化语言扭曲大语言模型决策
这项研究表明,大语言模型会继承并放大临床笔记中污名化语言带来的偏见,导致患者管理趋于保守,且当前的缓解策略效果有限。
真实世界临床护理中的推理:为什么大语言模型尚不能安全用于自主临床决策支持
这篇观点文章认为,大语言模型尚不能安全用于自主临床决策支持,尤其是在对未分诊患者进行分诊时,原因在于缺乏在不完整信息和漏诊不对称成本条件下的稳健评估。