相同事实,不同诊断:度量并缓解临床语言模型中的叙事锚定

arXiv cs.CL 论文

摘要

本文介绍了一种称为“叙事锚定”的失败模式,即当相同的临床事实以不同的社会语言学语域表达时,临床语言模型会产生不同的诊断结果。作者发布了一个基于USMLE的数据集,并提出了NarrativeShield,这是一个三代理流水线,可将锚定差距降至接近零。

arXiv:2607.27384v1 公告类型:新 摘要:用于临床诊断推理的大型语言模型对社会语言学语域敏感,而不仅仅是临床内容。我们将这种失败模式称为“叙事锚定”:相同的临床事实以不同语域表达时,会导致诊断输出出现分歧。与先前的人口统计学偏见研究(这些研究操纵种族或收入等显式身份标记)不同,我们的基准将语域隔离为唯一的变化渠道,且不包含任何形式的人口统计学标记。我们构建了一个包含1,000个USMLE临床病例(vignettes)的数据集,每个病例被改写成三种社会语言学上不同的人物角色(personas),并经过独立审计的事实保留保证,该保证由另一个从未见过生成提示的模型验证。在跨越三个架构家族和规模尺度的七个语言模型中,直接提示下所有测试模型均显示出统计上显著的叙事锚定,叙事锚定差距(Narrative Anchoring Gap)在0.064到0.151之间。思维链推理和显式去偏指令仅能部分减少该偏差,且其表面上的收益常常因准确性崩溃而混淆。我们引入了NarrativeShield,一个三代理流水线,在诊断推理开始前结构化地提取并验证临床事实,将叙事锚定差距降至接近零(-0.004到0.037),并在所有模型的所有方法中实现了最低的严重不稳定决策率(DSS < 0.8),同时对大多数模型带来了适度且机制上可预期的准确性成本。一项使用非指令调优基础模型的压力测试表明,执行去偏干预本身受限于零样本指令遵循能力,而不仅仅是提示内容。我们发布了经人工验证事实保留的数据集,作为研究基于语域的临床偏见的独立资源。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:01

# 在临床语言模型中衡量与缓解叙事锚定

代码和数据可在 https://github.com/prabhjotschugh/narrativeshield-sdoh-medqa 获取  
来源:https://arxiv.org/html/2607.27384

Prabhjot Singh  
德克萨斯大学奥斯汀分校  
美国德克萨斯州奥斯汀  
prabhjot\.singh@utexas\.edu(https://arxiv.org/html/2607.27384v1/mailto:[email protected])

Pritam Deka  
贝尔法斯特女王大学  
英国贝尔法斯特  
pdeka01@qub\.ac\.uk(https://arxiv.org/html/2607.27384v1/mailto:[email protected])

Vijay Chennareddy  
密德萨斯大学伦敦分校  
英国伦敦  
Vc381@live\.mdx\.ac\.uk(https://arxiv.org/html/2607.27384v1/mailto:[email protected])

###### 摘要

用于临床诊断推理的大型语言模型对社会语言语域敏感,而不仅仅是临床内容。我们将这种失败模式称为“叙事锚定”:相同临床事实以不同语域表达时,会导致诊断输出产生分歧。与先前的人口属性偏见研究不同——那些研究操控种族或收入等显式身份标记——我们的基准将语域作为唯一的变化通道,且任何形式的文本中都不存在人口属性标记。我们构建了一个包含 1,000 个 USMLE 临床病例的数据集,每个病例被改写成三种社会语言上截然不同的人物角色,并附带独立审计的事实保持保证,由另一个从未见过生成提示的模型进行验证。在跨越三个架构家族和多种规模的七个语言模型上,叙事锚定在直接提示条件下于每个测试模型中均具有统计学显著性,叙事锚定差距为 0.064 至 0.151。思维链推理和显式去偏指令只能部分减少偏差,而且其表面上的收益常常因准确率下降而被混淆。我们引入 NarrativeShield,一个三智能体流水线,在诊断推理开始之前结构化地提取并验证临床事实,将叙事锚定差距降至接近零(−0.004 至 0.037),并在所有模型中实现了最低的严重不稳定决策率(DSS < 0.8),且大多数模型的准确率代价适中且机制上可预期。一项针对未经指令微调的基础模型的压力测试表明,能否执行去偏干预取决于零样本指令遵循能力,而非仅取决于提示内容。我们发布的这一数据集经过人工验证的事实保持,可作为研究基于语域的临床偏见的独立资源。

## 1 引言

大型语言模型日益被提议作为临床诊断推理的决策支持工具,从分诊辅助到鉴别诊断生成,这相应地带来了在部署中引入伤害或加剧健康差异的风险。大量相关研究聚焦于人口属性偏见:当患者的种族、性别或社会经济地位被明确陈述时,模型的诊断或治疗建议是否会改变。这一关注是有充分依据的。Zack 等人(2024)表明 GPT-4 持续生成刻板化人口属性表现的临床病例,其鉴别诊断更可能包含与特定种族、民族和性别相关的疾病。EquityMedQA(Pfohel 等人,2024)和 DiversityMedQA(Rawat 等人,2024)等基准通过直接扰动患者人口属性使这种失败模式变得可测量。Poulain 等人(2026)进一步扩展了这一方向,发现反思式提示可以减少有偏结果,而更大规模和经过医学微调的模型并不必然更少偏见。

这条研究路线共享一个结构性假设,因而遗漏了一种临床上真实的失败模式。真实患者不会向临床医生或模型宣告自己的收入阶层或文化背景。他们用自己的语言描述自己的症状,这种描述方式受到以下因素塑造:他们如何被教导谈论疼痛、他们能负担得起何种处理方式、以及他们的家庭对生病之人有何期望。两位症状、病程和生命体征完全相同的患者,可能产生模型截然不同解读的病例——不是因为任何一方提到了人口属性类别,而是因为他们讲述故事所用的语域不同。我们将这种失败模式称为“叙事锚定”:模型的诊断输出随社会语言语域而非临床内容发生偏移,即使所有临床事实保持不变且从未陈述任何人口属性标记时也会出现。

这一机制本身已独立于任何明确标签承载诊断权重。Omar 等人(2025)在九个模型产生的 170 万条输出中发现,与相同事实的匹配对照描述相比,某些社会人口学框架描述的病案被导向了比临床指征更为激进的治疗,而临床内容保持不变。叙事锚定精确地隔离了这一机制:我们的三种人物角色在任何位置都不包含任何人口属性标记——没有种族、收入数字或具名的文化标识符。偏见通道仅仅是语域和框架,而非身份披露,这使我们的基准区别于 EquityMedQA、DiversityMedQA 以及一般的人口属性标签范式,并表明模型无需被告知患者是谁就可能对该患者区别对待。

叙事锚定对于每个病例只呈现一次的基准而言基本上是隐形的:一个被语域锚定的模型,如果从未以两种不同表达方式看到同一患者两次,就永远没有机会暴露这一问题。衡量它需要一个在保持临床内容不变的同时改变语域的数据集,且这一事实保持必须经过独立验证而非假定,因为任何漂移都会将语域效应与真实病例难度相混淆。

我们做出三项贡献:

- 一个包含 1,000 个患者病例的数据集,从 MedQA-USMLE 语料库(Jin 等人,2020)中筛选而来,每个病例被改写成三种社会语言上截然不同的人物角色:对照组、社会经济和文化。事实保持并非由生成模型本身认证,而是由第二个独立调用的模型认证,该模型无法访问生成提示,其唯一任务是验证每个临床事实是否在改写后留存,这遵循了如下发现:单独调用的评估模型比模型自行评分更可靠地接近人类判断(Zheng 等人,2023)。我们进一步通过人工标注验证这一保证。

- 证据表明叙事锚定并非边缘现象。在跨越三个架构家族和多种规模的七个模型中,直接提示在每种模型上都在对照组人物角色与每个标记人物角色之间产生统计学显著的推荐分歧,叙事锚定差距为 0.064 至 0.151。思维链推理(Wei 等人,2023)和显式去偏指令只能部分减少这种偏差,而思维链的表面收益常常因准确率下降而被混淆,这与思维链解释并不能可靠反映模型预测真实原因且可被情境化、非临床线索所引导的证据一致(Turpin 等人,2023)。

- NarrativeShield,一个三智能体流水线,从架构上应对叙事锚定:它在诊断推理开始之前结构化地提取并验证临床事实,将模型推理所依据的内容与患者故事的讲述方式解耦。在所有七个模型中,NarrativeShield 将叙事锚定差距降至接近零(−0.004 至 0.037),并实现了我们测试的所有方法中最低的严重不稳定、依赖人物角色的决策率(决策稳定性得分低于 0.8)。这在大多数模型中伴随着适度且机制上可解释的准确率代价,而一个经过领域适应但未进行指令微调的基础模型(Labrak 等人,2024)则出现显著失败,我们表明这证明了任何去偏干预都以一种并非所有模型都具备的基线零样本指令遵循能力为前提。

因此,风险不仅在于模型因为被告知患者属于不同人口属性群体而以不同方式对待两位患者,还在于模型因为每位患者或其家属描述问题的不同方式而以不同方式对待两位患者。这种偏见通道不需要任何人口属性披露,并且能够存活于仅针对提示内容而非处理内容的架构的干预措施。

## 2 数据集构建

我们构建 NarrativeShield-SDoH,包含 1,000 个 USMLE 式临床病例,每个病例以三种社会语言人物角色表达,在保持临床内容不变的同时改变语域。构建分为两个阶段:确定性过滤与采样,以及人物角色生成与独立事实保持审计。

### 2.1 来源过滤与采样

我们从 MedQA-USMLE(Jin 等人,2020)中抽取候选,混合训练和测试划分,并应用六个过滤器作为单一布尔掩码,固定种子为 42,使过滤完全确定性。每个过滤器针对人物角色改写所需的属性:(1) 患者病例主干 `^(A|An)\s+\d+[\-\s]?(year|month|week|day)[\-\s]?old`;(2) 最少长度 300 个字符,确保超出纯粹记忆的叙事深度;(3) 至少一个来自 49 项列表的临床信号术语,涵盖症状、呈现背景、生命体征/实验室检查和体格检查;(4) 排除 21 种指示纯机制或病理生理学问题的短语模式,这类问题没有可供变化的患者自述框架;(5) 目标类型为诊断、治疗或检查;(6) 至少一个来自 27 个短语的叙事丰富性标记,指示第一人称或照护者报告病史(例如“she states”)。完整的正则表达式和短语列表见附录 A。从 2,921 个问题的过滤池中,我们通过按 USMLE 考试阶段与正确答案字母的乘积进行比例分层抽样抽取 1,000 个,保留样本中的联合分布(附录 B)。

### 2.2 人物角色生成

每个病例使用 Gemini-3.1-Flash-Lite 被改写成三种人物角色:对照组 \(P_\alpha\) 保留原始语域,社会经济 \(P_\beta\) 通过财务或职业压力重新框架,文化 \(P_\gamma\) 通过文化情境化的隐喻重新框架。没有任何人物角色包含显式人口属性标记;偏见通道仅仅是语域。四个设计决策使这一流水线区别于朴素改写,每个决策都封堵了早期迭代中观察到的失败模式。

**独立生成调用**:每个人物角色通过单独的调用生成,没有共享上下文,因为联合生成有风险将人物角色之间的措辞锚定为表面同义词替换。

**差异化温度**:\(P_\alpha\) 使用 0.25,偏好保真度;\(P_\beta\)/\(P_\gamma\) 使用 0.90,偏好真正的语域分歧,高温度允许语言分歧,而下面的事实保持约束防止临床内容丢失。

**结构性而非表面性的语域**:\(P_\beta\)/\(P_\gamma\) 的提示明确禁止在早期迭代中被识别为会产生可检测模板、通用措辞(如“传统草药茶”)、公式化框架(如“我家人坚持”)和结尾加载线索的模式,并且每次生成被分配五种开场风格之一,按尝试独立采样,防止跨数据集形成可检测的结构模板(完整定义见附录 C)。

**独立事实保持审计**:每个人物角色被传递给一个独立的审计模型,温度为 0,无法访问生成提示,其唯一任务是从原始病例中提取每个临床事实并验证其在人物角色中的存在——无论是临床、通俗还是隐喻形式——返回通过/失败裁决;生成模型无法通过自己的测试。一个人物角色仅在通过时进入数据集;失败最多重试 10 次,并重新采样开场风格,每个提示都直接陈述事实保持要求,并且对 \(P_\gamma\) 提供后备:无法隐喻化的事实必须平实陈述。

### 2.3 人工验证

所有 3,000 个人物角色生成在审计下均达到 SUCCESS,零 PARTIAL 或 FAILED 行发布;我们报告这一完整性数字而非中间通过率,后者是流水线诊断指标而非发布数据的属性。为独立佐证这一自动化保证,三位具有临床背景的标注者——从具有 20 年经验的主治医师到住院医师和实习生——均未参与构建且无权访问审计裁决,对按分层抽样的 100 个问题(300 次就诊)就事实保持、人物角色语域匹配和 5 点李克特叙事真实性进行评分。完整协议和原始评分随数据集发布。

#### 事实保持与语域匹配。
三位标注者均将 100% 的就诊评为保持事实且匹配语域,这是原始一致率的天花板,机会校正统计量在此情况下按构造未定义。由于样本仅从通过审计的人物角色中抽取,这反映的是事实保持门控在该样本上的有效工作,而非未过滤的失败率,这与其他地方报告的医生审查 AI 生成临床病例的过滤后高保真度一致(Yanagita 等人,2024)。

#### 叙事真实性。
这一主观维度出现了显著分歧。一位标注者将所有 300 项均评为天花板(确认为真实判断,而非伪影);仅限两位有信息量的标注者时,精确一致率为 42.0%,但相邻(\(±1\))一致率为 85.3%,Krippendorff 的 \(\alpha\)(Krippendorff, 2004)为 0.226,低于暂定结论的 0.667 阈值,尽管与其他主观 NLP 任务中报告的一致率相当(GoEmotions 上的 27% \(\kappa\)(Demszky 等人,2020),HateXplain 上的 46%(Mathew 等人,2021))。关键在于,分歧并非随机:精确一致率从 \(P_\alpha\) 的 74.0% 下降到 \(P_\beta\) 的 34.0%,再到 \(P_\gamma\) 的 18.0%,追踪人物角色难度。尽管存在这种校准差距,排序是稳定的:合并均值为 \(P_\alpha=4.89 > P_\beta=4.64 > P_\gamma=4.19\),对每位标注者独立成立(Kruskal-Wallis \(H=138.69\),\(p<.0001\),Bonferroni 校正后所有配对比较均显著)。标注者对 \(P_\gamma\) 叙事究竟处于量表的哪个位置存在分歧,但无一例外地同意它比 \(P_\beta\) 更难自然化呈现,而 \(P_\beta\) 又比 \(P_\alpha\) 更难,这正是人物角色构建设计所要产生的排序,与以下证据一致:标注者在分级任务上的分歧可能追踪概念难度而非不一致性(Kellert

相似文章

语言模型中锚定路径的定位

arXiv cs.CL

本文研究提示中无关数字如何导致语言模型中的锚定效应,并利用基于归因的电路方法在Qwen和Llama模型上定位携带该信号的内部路径。

大型语言模型总是讲相同的故事吗?

arXiv cs.CL

本文研究大型语言模型是否能够生成多样化的故事。通过叙事相似性分析,作者发现,LLM生成的叙事彼此之间的相似度始终高于人类撰写的故事,而常见的缓解策略(如负面提示和温度缩放)未能解决这种同质化问题。