临床时序推理中的后见之明偏差:未来数据暴露如何影响大型语言模型的判断

arXiv cs.CL 论文

摘要

本文提出了一个用于衡量大型语言模型临床时序推理中后见之明偏差的基准,表明暴露于未来数据会导致偏差,而时间掩蔽能降低偏差且不降低准确性。

arXiv:2609.13454v1 公告类型:新 摘要:临床决策是前瞻性的,但临床语言模型通常在回顾性记录上进行评估,这些记录揭示了最终诊断、治疗反应和结果。这种评估可能奖励使用未来信息,而不是在决策点存在的不确定性下进行推理。我们引入了一个配对基准,用于衡量与临床时序推理中后见之明偏差一致的结果条件偏移。该基准包含来自PubMed Central开放获取子集的171个病例报告——40个败血症和131个GLP-1/糖尿病病例——以文本叙述以及人工标注和LLM生成的文本时间序列(TTS)表示。对于每个病例,问题与一个临床上有意义的截止点相关联,并与一个前瞻性参考答案和一个与结果一致的\emph{后见之明陷阱}配对。模型使用在截止点截断的TTS或完整时间线来回答每个问题;附加条件改变叙述来源(原始或合成)和TTS标注来源(人工或LLM)。我们评估准确性(Acc)、后见之明陷阱率(HTR)、答案不稳定率(AIR)和后见之明偏差率(HBR),每个指标捕捉后见之明偏差的不同信号。在GPT 5.6 Sol、Gemma 4、GLM 5.2和Opus 5中,完整时间线暴露产生一致的后见之明敏感偏移,而时间掩蔽降低偏差且不降低准确性。
查看原文
查看缓存全文

缓存时间: 2026/09/15 08:34

# 临床时序推理中的后见之明偏见:未来数据暴露如何影响大语言模型的判断
来源:https://arxiv.org/html/2609.13454 \\mlhtrack proceedings \[3pt\]
Sayantan Kumar2Ojas Kadam3Jeremy C\. Weiss2
1凯斯西储大学凯斯工程学院,美国 2美国国立卫生研究院国家医学图书馆,美国 3莱斯大学,美国
#### 摘要
临床决策是前瞻性的,但临床语言模型通常基于回顾性记录进行评估,这些记录揭示了最终诊断、治疗反应和结局。此类评估可能会奖励使用未来信息,而非在决策点存在的不确定性下进行推理。我们引入了一个配对基准,用于测量与临床时序推理中后见之明偏见一致的结果条件化转变。该基准包含来自PubMed Central开放获取子集的171份病例报告——40例脓毒症和131例GLP-1/糖尿病病例——以文本叙述以及人工标注和LLM生成的文本时间序列(TTS)形式表示。对于每个病例,问题都与临床有意义的时间截点相关联,并与前瞻性参考答案和结果一致的*后见之明陷阱*配对。模型使用在时间截点处截断的TTS或完整时间线来回答每个问题;其他条件变化包括叙述来源(原始或合成)和TTS标注来源(人工或LLM)。我们评估了准确率(Acc)、后见之明陷阱率(HTR)、答案不稳定率(AIR)和后见之明偏见率(HBR),每个指标捕捉不同维度的后见之明偏见信号。在GPT 5.6 Sol、Gemma 4、GLM 5.2和Opus 5中,完整时间线暴露产生了持续的后见之明敏感性转变,而时间掩蔽在不降低准确率的情况下减少了偏见。
††workshop:Machine Learning for Health \(ML4H\) 2026††proceedings:: Submitted to ML4H 2026:\\mlhtrackname††workshop:Machine Learning for Health \(ML4H\) 2026
###### 关键词
后见之明偏见;临床时序推理;大语言模型;临床问答,基准评估
参考图
图1:用于测量后见之明敏感性临床推理的基准流程。模型使用掩蔽和完整的病例轨迹回答相同问题,评估回答的正确性、不稳定性以及向结果一致的后见之明陷阱的偏移。
## 1引言
临床决策本质上是前瞻性的。决定收治、治疗、升级护理或出院的临床医生必须仅利用当时可得的证据采取行动,而后续轨迹和结果尚未知晓。临床人工智能系统继承了相同的信息约束:旨在时间t支持决策的模型,应使用时间t之前可获得的信息进行评估,而非事件过程中稍后记录的信息。这种评估设置创造了后见之明偏见的条件,即对结果的了解改变了对先前可知或可预测内容的判断(Fischhoff, 1975 (https://arxiv.org/html/2609.13454#bib.bib9))。后见之明偏见已在医生估计诊断概率(Arkes et al., 1981 (https://arxiv.org/html/2609.13454#bib.bib1); Dawson et al., 1988 (https://arxiv.org/html/2609.13454#bib.bib6))和评估早期护理时被观察到。在一项随机情景研究中,临床医生在三个病例中,有两个在死亡结局后对与恢复或死亡结果相同的前期护理评价更为严苛,并且更高的资历并未消除这种影响(Banham-Hall and Stevens, 2019 (https://arxiv.org/html/2609.13454#bib.bib2))。然而,并非所有证据增加后的答案改变都是偏见。如果任务要求的是最终诊断,后续证据理应相应地更新答案。这里研究的更窄的失败模式是:当后续信息改变了一个判断,而该判断旨在针对早期参考点时,什么是可以被支持的。测量这种失败需要固定临床问题和先验证据,同时变化对参考点之后信息的获取。先前配对的临床情景研究表明,当结果线索被操纵时,通用和专注于推理的LLM可能表现出后见之明偏见,但这些评估基于单个情景,而非纵向临床病例语料库(Wang and Redelmeier, 2024 (https://arxiv.org/html/2609.13454#bib.bib19); Degany et al., 2025 (https://arxiv.org/html/2609.13454#bib.bib7))。ExAnte通过施加明确的时间截点来评估通用领域问答中的时间信息泄露(Liu et al., 2026 (https://arxiv.org/html/2609.13454#bib.bib14)),但其目标与我们不同。它评估答案是否得到指定时间之前可获得信息的支持,而我们询问的是,暴露于患者的后续临床轨迹是否改变了模型对早期决策点时什么信息可支持的判断。这需要配对的完整-掩蔽评估,具有固定的前瞻性参考答案和结果一致的后见之明陷阱,使我们能够测量正确性以及问题内答案变化的方向。据我们所知,现有临床基准中没有哪个在真实的纵向病例轨迹语料库上应用了此设计。
##### 贡献。我们引入了(1)一个用于临床后见之明偏见的配对基准,使用前瞻性参考答案和预定义的后见之明陷阱比较掩蔽和完整的轨迹;(2)互补的指标(Δ\\DeltaHTR, AIR和HBR)用于测量方向性的后见之明敏感变化;以及(3)在两个临床队列和多种输入表示上的跨模型评估,表明时间掩蔽在不降低准确率的情况下减少了后见之明偏见。
## 2相关工作
这里我们概述相关工作的概况。详细版本见附录A (https://arxiv.org/html/2609.13454#A1)。
##### 通用时序推理。TRAM、TimeBench、Test of Time和TimE在合成或通用领域设置中评估事件排序、时间算术、持续时间和多步推理(Wang and Zhao, 2024 (https://arxiv.org/html/2609.13454#bib.bib20); Chu et al., 2024 (https://arxiv.org/html/2609.13454#bib.bib4); Fatemi et al., 2025 (https://arxiv.org/html/2609.13454#bib.bib8); Wei et al., 2025 (https://arxiv.org/html/2609.13454#bib.bib21))。ExAnte在时间设置上与我们最接近。它施加明确的截点并测量截点后知识的泄露,但其任务是非临床的(Liu et al., 2026 (https://arxiv.org/html/2609.13454#bib.bib14))。我们的基准则测试患者轨迹中的后续事件是否会将针对早期临床时间点的判断推向后见之明陷阱。
##### 基于纵向记录的临床问答。MedAlign、MIMIC-Instr、EHRNoteQA和EHRSQL评估在纵向笔记和结构化EHR数据上的指令遵循或问答(Fleming et al., 2024 (https://arxiv.org/html/2609.13454#bib.bib10); Wu et al., 2024 (https://arxiv.org/html/2609.13454#bib.bib23); Kweon et al., 2024 (https://arxiv.org/html/2609.13454#bib.bib12); Lee et al., 2022 (https://arxiv.org/html/2609.13454#bib.bib13))。更近期的基准则直接针对时序推理。TIMER将指令关联到患者特定的时间戳,ASCENT评估随着证据积累的诊断,RealICU使用后见之明知情标签评估窗口化ICU决策(Cui et al., 2025 (https://arxiv.org/html/2609.13454#bib.bib5); Choi et al., 2026 (https://arxiv.org/html/2609.13454#bib.bib3); Shen et al., 2026 (https://arxiv.org/html/2609.13454#bib.bib18))。这些任务测量时间定位或逐步推理。我们将相同的问题和截点前证据与完整和掩蔽的时间线配对,以测量答案是否改变以及它是否向结果一致的方向偏移。
##### 基于临床病例报告的推理。MedCaseReasoning评估从开放获取病例报告中得出的诊断答案和推理,而MedR-Bench涵盖检查、诊断和治疗计划(Wu et al., 2025 (https://arxiv.org/html/2609.13454#bib.bib22); Qiu et al., 2025 (https://arxiv.org/html/2609.13454#bib.bib17))。先前的工作也从PubMed Central病例报告中重建了时间定位的脓毒症轨迹,作为文本时间序列(Noroozizadeh and Weiss, 2026 (https://arxiv.org/html/2609.13454#bib.bib16))。我们在此表示基础上研究一个不同的问题:不仅模型是否得出最终结论,而且该结论在后续事件被知晓之前是否可支持。
## 3方法
整体流程如图1 (https://arxiv.org/html/2609.13454#S0.F1)所示,所有使用的提示词列表见附录C (https://arxiv.org/html/2609.13454#A3)。
### 3.1研究设计与数据来源
病例报告选自国家医学图书馆提供的PubMed Central开放获取子集(PMC OA)(National Library of Medicine (2025) (https://arxiv.org/html/2609.13454#bib.bib15))。我们使用了由171份病例报告组成的两个队列:40例脓毒症病例和131例服用胰高血糖素样肽受体激动剂(GLP1-RA)药物的2型糖尿病患者病例。脓毒症和GLP1-RA队列建立在先前发表的工作基础上(Noroozizadeh and Weiss, 2026 (https://arxiv.org/html/2609.13454#bib.bib16); Kumar and Weiss, 2026 (https://arxiv.org/html/2609.13454#bib.bib11)),这些工作提供了由经过临床培训的标注者和LLM提取器独立构建的时间线。选择这两个队列是为了评估基准在不同临床轨迹上的表现:脓毒症中相对密集、急性的护理事件,以及GLP-1/糖尿病中更多样化的纵向轨迹。
### 3.2临床表示
每个病例ii由其原始病例报告叙述NiN\_\{i\}和两个文本时间序列(TTS)表示:一个人工标注的TTSTiHT\_\{i\}^\{\\mathrm\{H\}\}和一个独立生成的LLM TTSTiLT\_\{i\}^\{\\mathrm\{L\}\}。TTS是一个序列Tis=\{\(eijs,tijs\)\}j=1nis,s∈\{H,L\}T\_\{i\}^\{s\}=\\\{\(e\_\{ij\}^\{s\},t\_\{ij\}^\{s\}\)\\\}\_\{j=1\}^\{n\_\{i\}^\{s\}\},\\qquad s\\in\\\{\\mathrm\{H\},\\mathrm\{L\}\\\},其中eijse\_\{ij\}^\{s\}是临床事件,tijst\_\{ij\}^\{s\}是以小时为单位的相对时间。这种表示保留了叙述顺序与临床事件顺序之间的区别,这在回顾性编写的病例报告中可能不同。
### 3.3问题构建
问题由GPT 5.6 Sol使用默认中等推理强度根据原始叙述NiN\_\{i\}和人工TTSTiHT\_\{i\}^\{\\mathrm\{H\}\}生成。对于每个病例,生成器返回十个问题作为模式约束的JSON数组;未通过验证的输出有一次修复机会。在171个病例中,这产生了1,710个问题。图2 (https://arxiv.org/html/2609.13454#S3.F2)展示了一个代表性项目,包括对回答模型可见的字段和用于评估的隐藏元数据。
**病例:**58岁男性因肺炎继发脓毒症休克入院。\[...\]**时间截点:**入院后24小时
**对回答模型可见:**
**问题:**根据患者当前的呼吸状态和血流动力学概况,哪个概率范围最能代表在48小时内需要机械通气的可能性?
**格式:**多项选择(有序)
**选项:**
\[A.\] <10%, \[B.\] 10–30%, \[C.\] 31–60%, \[D.\] >60%
**隐藏评估元数据:**
a∗a^\{\*\}(参考答案):A. <10%
atra^{\mathrm\{trap\}}(后见之明陷阱):D. >60%
**陷阱解释:**患者在36小时时被插管;获得完整轨迹的模型可能会在知道此结果后夸大前瞻性概率估计。
**评估目标:**两者
**截点事件:**动脉血气显示轻度低氧血症;血管加压药需求稳定。
**图2:**代表性基准问题。可见部分(分割线上方)显示给回答模型;隐藏元数据(下方)仅用于评估。参考答案a∗a^\{\*\}是在截点时可支持的答案,而后见之明陷阱答案atra^{\mathrm\{trap\}}则是在最终结果已知后可能显得更引人注目的答案。
问题被分配到准确性、后见之明偏见或两者兼有。准确性项目针对可验证的答案,具有低后见之明敏感性;后见之明偏见项目针对主观判断,如可能性和治疗适宜性,这些可能在后续证据后发生变化;两者兼有的项目则需要一个前瞻性支持的答案和一个合理的陷阱。每个病例的目标是在这些类别中2/3/5的分布。基准包含自由回答、对错判断和四选项多项选择题,多项选择题标记为分类或有序。有序选项使用明确范围,其中aq∗a\_\{q\}^\{\*\}和aqtrap^{\mathrm\{trap\}}放置在最大分离的位置。提示将每种推理类型限制为每个病例两个问题,以最大化多样性。它还省略了可见问题文本中的明确时间参考,以便前瞻性推理依赖于提供的上下文而非显式指令。
### 3.4时间掩蔽与截点位置
对于每个问题qq,生成器在人类TTS的时间坐标中提供一个数值截点cqc\_\{q\}。给定一个TTSTisT\_\{i\}^\{s\},我们保留截点处及之前的事件:Tiq,maskeds=\{\(eijs,tijs\)∈Tis:tijs≤cq\}T\_\{iq,\\mathrm\{masked\}\}^\{s\}=\\\{\(e\_\{ij\}^\{s\},t\_\{ij\}^\{s\}\)\\in T\_\{i\}^\{s\}:t\_\{ij\}^\{s\}\\leq c\_\{q\}\\\} (1),而Ti,fulls=TisT\_\{i,\\mathrm\{full\}\}^\{s\}=T\_\{i\}^\{s\}保留完整轨迹。相同的数值截点应用于人类和LLM TTS。在按数值时间排序有效行并在平局时保留源顺序后,令kq∈\{1,...,ni\}k\_\{q\}\\in\\\{1,\\ldots,n\_\{i\}\\\}表示与截点匹配的时间索引。我们定义RelPos⁡\(q\)=kq−1ni−1,\\operatorname\{RelPos\}\(q\)=\\frac\{k\_\{q\}\-1\}\{n\_\{i\}\-1\},其中0和1分别表示第一个和最后一个记录的事件。
##### 构建合成病例报告。为测试我们的结果是否依赖于原始病例报告的文本,或在独立重建的叙述表示下是否持续存在,我们根据TTS生成了合成叙述。为每个问题qq、截点ciqc\_\{iq\}和标注来源s∈\{H,L\}s\\in\\\{\\mathrm\{H\},\\mathrm\{L\}\\\}生成了一个单独的叙述:每个叙述都源自掩蔽的TTSTiqs,maskT\_\{iq\}^\{s,\\mathrm\{mask\}\},而非完整的TTS,因此没有截点后的信息会泄露到回答模型看到的叙述中。一个具有QiQ\_\{i\}个问题和两个标注来源的病例ii因此最多产生2Qi2Q\_\{i\}个不同的合成叙述,保证了在每个配对条件中叙述与TTS之间严格的时间对齐。对于每个条件,叙述使用与回答相同的模型生成。
### 3.5答案生成
我们评估了GPT-5.6 Sol、Gemma-4-31B、GLM-5.2-FP8和Opus 5。每个模型独立回答每个问题,并且只接收可见的问题字段——问题、格式和选项——以及表1 (https://arxiv.org/html/2609.13454#S3.T1)指定的上下文。其余部分被隐藏;见图2 (https://arxiv.org/html/2609.13454#S3.F2)。回答包含一个答案和简短的支持证据。任何模型都没有访问外部检索、工具或网络。
##### 后见之明警告敏感性分析。我们在GPT和GLM的脓毒症实验中,追加了明确指示要求仅使用同时期可获得的信息并忽略后见之明信息后,重复了实验。

相似文章

训练大型语言模型预测临床事件

arXiv cs.LG

本文通过将按时间排序的临床笔记转换为预测示例,将前瞻性学习扩展到临床事件预测。在120B模型上使用LoRA适配器改善了校准性能,并在留出问题上优于GPT-5。