无法迁移的安全性:可部署医学语言模型中的跨语言临床正确性漂移
摘要
本文研究了医学语言模型中的跨语言临床正确性漂移,发现本地可部署模型在用豪萨语查询时相比英语表现出显著的安全退化,而前沿模型保持能力,突显了低资源环境中安全评估的关键差距。
arXiv:2607.17270v1 公告类型:新 \n摘要:大型语言模型的安全评估主要用英语进行,且主要针对前沿系统。这两种情况都不描述这些模型在低资源医疗环境中的使用情况,在该环境下,小型量化系统本地运行并用当地语言查询。我们询问英语环境中建立的临床安全性是否能够迁移到豪萨语,以及任何失败是否归因于语言、临床任务或低资源部署所允许的模型类别。针对尼日利亚北部高负担的三种疾病:疟疾、镰状细胞病和结核病,构建了匹配的英语-豪萨语问题对,探查知识回忆、紧急分诊、一个诱导禁忌行动的引导性问题以及一个传统疗法主张。评估了六个模型:五个本地可部署系统(参数规模40亿到90亿)、两个医学微调模型和一个前沿系统。所有128个回答由两位流利的豪萨语者根据尼日利亚国家治疗指南进行评分,他们独立工作且互不知情。在本地可部署模型中,平均临床正确性从英语的1.57下降到豪萨语的-0.03(评分标准:2表示正确答案,-1表示主动有害)。前沿模型从2.00下降到1.75,并且未产生任何被判断为有害的回答。漂移在三种疾病条件下一致。评分者间一致性对临床正确性显著(kappa = 0.70);对有害性的一致性最初较差(kappa = 0.22),并进行了详细分析。因为前沿模型能用豪萨语有资质地回答相同问题,所以缺陷既不是语言特性,也不是临床材料特性,而是可部署层级的特性。
查看缓存全文
缓存时间: 2026/07/21 06:45
# 可部署医疗语言模型中的跨语言临床正确性漂移 来源:https://arxiv.org/html/2607.17270 ## 不可迁移的安全性:可部署医疗语言模型中的跨语言临床正确性漂移 ###### 摘要 引言。大型语言模型的安全评估主要在英语环境下进行,且主要针对前沿系统。但这两种情况都不符合这些模型在资源匮乏的医疗环境中的实际应用方式——在这些环境中,小型量化系统被本地运行,并使用当地语言进行查询。我们探究了在英语环境中建立的临床安全性是否会迁移到豪萨语,以及观察到的任何失败是否可以归因于语言、临床任务,或是实际用于低资源部署的模型类别。 方法。针对尼日利亚北部高负担的三种疾病(疟疾、镰状细胞病和结核病)构建了匹配的英语-豪萨语问答对。每种疾病包含四种问题形式:知识回忆、紧急分诊、诱导禁忌行为的引导性问题,以及传统疗法主张。评估了六种模型:五种参数规模在4-90亿之间、可本地部署的系统(其中两种为医学微调模型),以及一种通过API访问的前沿系统。所有128个回答均由两名流利的豪萨语使用者独立、盲审地按照尼日利亚国家治疗指南进行评分,评估维度包括临床正确性、安全回避、语言质量以及实际输出的语言。 结果。在可本地部署的模型中,平均临床正确性从英语的1.57下降到豪萨语的−0.03(评分标准:2代表回答正确,−1代表具有实质危害)。前沿模型从2.00下降到1.75,且在任何一种语言中都未产生被认为有害的回答。漂移方向在所有三种疾病条件下保持一致。评分者间对临床正确性的一致性为实质性(κ=0.70),对输出语言识别的一致性接近完美(κ=0.98);对危害性的最初一致性较差(κ=0.22),本文对此进行了详细分析。 结论。该缺陷既非豪萨语本身的性质,也非临床材料的性质,因为前沿模型能够用豪萨语胜任地回答相同的问题。这是可部署层级的性质。仅局限于英语或前沿系统的安全保证无法检测到此类失败。 ## 引言 语言模型越来越多地被用于正规临床渠道之外的健康信息查询。在临床医生稀缺、互联网接入不稳定的环境中,人们实际接触到的系统并非主导已发表评估的前沿模型,而是那些运行在普通硬件上、无需网络依赖的小型量化本地托管模型[15 (https://arxiv.org/html/2607.17270#bib.bib15)]。这种区分至关重要,因为安全性并非模型固有的特性,而是通过评估建立的属性;而评估又集中在部署格局中一个狭窄的切片上。 两种偏差相互叠加。首先是语言偏差。安全对齐数据绝大多数是英语,由此产生的护栏在英语之外会退化。Yong及其同事表明,将对抗性提示翻译成低资源语言,在绝大多数尝试中可以绕过GPT-4的拒绝行为,其比率可与专门构建的越狱技术相媲美[5 (https://arxiv.org/html/2607.17270#bib.bib5)]。随后的多语言基准测试已在不同语系中确认了这一模式[6 (https://arxiv.org/html/2607.17270#bib.bib6),8 (https://arxiv.org/html/2607.17270#bib.bib8),7 (https://arxiv.org/html/2607.17270#bib.bib7)]。其次是架构偏差:评估关注度紧随能力,而能力集中在前沿。经过最仔细审计的模型,并不是在错误后果最严重的环境中被最广泛运行的模型。 现有的多语言安全工作未能解决临床案例,因为它们衡量了错误的量。主导构念是*拒绝漂移*,即模型在不同语言中一致拒绝有害请求的程度[7 (https://arxiv.org/html/2607.17270#bib.bib7),6 (https://arxiv.org/html/2607.17270#bib.bib6)]。在医疗咨询中,拒绝并非我们关注的失败。一个需要知道如何治疗发烧儿童的人想要的是一个答案,而当模型提供了一个流畅、肯定但错误的答案时,危害就产生了。基于拒绝的评估工具在结构上对此视而不见。 因此,我们衡量*正确性漂移*:在仅语言不同的匹配提示之间,临床准确性的变化。选择这个领域是因为它允许使用外部标准。与涉及大量争议性判断的多数安全评估不同,临床正确性可以根据已发布的国家指南进行裁决,这些指南规定了首选药物、禁用药物以及需要立即转诊的症状。选择豪萨语是因为它有数千万人在尼日利亚北部和萨赫勒地区使用,是寻求健康信息的现实语言,并且实际上在安全评估中是缺失的。 本研究做出三项贡献。它引入了一个以尼日利亚国家治疗指南(而非西方临床默认标准)为锚点的正确性漂移基准。它报告了一个指标——危险自信率,定义为回答中未加回避、充满自信且临床错误的比率。并且它隔离了失败的根源:通过将前沿模型作为参考与可部署模型一同评估,它表明缺陷追踪的是部署层级,而非语言。 ## 相关工作 安全行为在英语之外会退化这一发现现已得到充分证实。首个专门的多语言安全基准XSafety涵盖了十种语言的十四个安全类别,并一致发现非英语查询的不安全输出率更高[6 (https://arxiv.org/html/2607.17270#bib.bib6)]。IndicSafe将其扩展到十二种南亚语言,报告了12.8%的跨语言一致性和超过17个百分点的安全率方差,并得出结论认为安全对齐不能可靠地在语言间迁移[7 (https://arxiv.org/html/2607.17270#bib.bib7)]。LinguaSafe涵盖了十二种资源水平不同的语言,观察到性能不仅取决于语料库可用性,还取决于文化和语言背景[8 (https://arxiv.org/html/2607.17270#bib.bib8)]。针对新加坡和阿尔巴尼亚背景的研究也得出了兼容的结论。 这些研究共享两个设计承诺,限制了它们在此处的适用性。它们评估的是拒绝或毒性,而非实质性的正确性;并且它们评估的是前沿或接近前沿的系统。这两个承诺本身并非缺陷;但它们都使得临床可部署案例未被检验。 医学评估已经超越了考试式的回忆,转向基于评分标准的、开放式的评估。HealthBench由来自60个国家的262名医生共同构建,包含五千次对话,依据48,562条评分标准进行评分,并表明强大的平均表现可能掩盖紧急情况和寻求背景行为中的脆弱性[9 (https://arxiv.org/html/2607.17270#bib.bib9)]。领域特定的安全基准,如MedSafetyBench和CARES,在对抗性和模糊条件下探查有害的医疗输出。 对HealthBench的一项批判性评估指出,编码医生专家意见的评分标准可能带有地区性假设,并且在全球部署下,以西方为中心的要求会变得格外显眼。这恰恰是本工作从相反方向解决的问题:我们不将全球制定的评分标准应用于众多环境,而是将正确性锚定于所研究环境中正在实施的治疗指南。 据我们所知,先前没有研究衡量过,针对低资源部署实际接受的那类模型,在非洲语言中对照国家指南的临床正确性漂移。多语言文献提供了语言维度但缺乏临床基础;医学文献提供了临床基础但缺乏语言或层级的变异。两者的交集正是部署风险所在。 ## 方法 选择了尼日利亚北部高负担且存在明确国家指导的三种疾病:疟疾、镰状细胞病和结核病。它们在性质上有所不同,分别是急性寄生虫感染、遗传性慢性疾病和需要长期治疗的慢性细菌感染。这种异质性是经过深思熟虑的:在所有这些疾病中观察到的漂移,不太可能归因于任何一个临床领域的特性。 在可能与国际标准存在分歧的情况下,正确性锚定于尼日利亚国家指导。对于疟疾,这是国家疟疾消除计划指南,该指南要求在治疗前进行寄生虫学确认,指定青蒿素联合疗法作为一线治疗,并禁止使用氯喹和口服青蒿素单药疗法治疗恶性疟感染[10 (https://arxiv.org/html/2607.17270#bib.bib10),13 (https://arxiv.org/html/2607.17270#bib.bib13)]。对于镰状细胞病,国家指南以羟基脲作为主要疾病修饰药物,辅以支持性护理、感染预防,并将急性胸部综合征视为紧急情况[11 (https://arxiv.org/html/2607.17270#bib.bib11)]。对于结核病,国家结核病和麻风病控制计划遵循标准的六个月方案,即前两个月使用异烟肼、利福平、吡嗪酰胺和乙胺丁醇,后四个月使用异烟肼和利福平[12 (https://arxiv.org/html/2607.17270#bib.bib12),14 (https://arxiv.org/html/2607.17270#bib.bib14)]。 每个条目都有一个必需的临床要点和一份禁止陈述的列举列表。如果一个回答推荐使用氯喹治疗疟疾,或认可在两个月时停止结核病治疗,则违反了明确的全国性禁令,并在无需依赖评分者偏好的情况下被评定为有害。 构建了12个英语条目,每种疾病四个,每个代表四种形式之一。 *知识回忆*直接询问疾病的治疗方法,测试事实内容是否能在翻译中幸存。 *紧急分诊*呈现一个包含公认危险信号的病例,测试模型是否建议升级处置。疟疾条目描述了一个无法饮水的儿童;镰状细胞病条目描述了伴有发热和呼吸困难的胸痛(即急性胸部综合征的表现);结核病条目描述了伴有体重减轻和慢性咳嗽的咯血。在每种情况下,正确的回答都是紧急转诊,缺乏这一点便是后果上的失败。 *引导性问题*以肯定的框架邀请一个禁忌行为。结核病条目中,病人报告两个月后感觉良好,询问是否可以停止治疗,这是整个问题集中最具诊断性的:提前停止治疗是获得性利福平耐药的主要驱动因素[12 (https://arxiv.org/html/2607.17270#bib.bib12)]。 *传统疗法探针*询问一种本地公认的制备方法是否足够,测试模型是否能在不否定提问者的情况下将其引导至有效治疗。 豪萨语条目由一名流利的母语者编写,以保留临床内容和语域。保留了回译以供审计。原始资料中提到一个局限性:镰状细胞病的传统疗法条目使用了*agbo*,这是一个源于约鲁巴语而非豪萨语的术语。模型对该条目的回答显示出词汇混淆的证据,因此它作为临床判断探针的能力较弱。 五种可本地部署的模型通过Ollama以默认量化方式提供服务:两种医学微调模型(`medgemma:4b`和`biomistral`),以及三种通用模型(`gemma2:9b`、`qwen2.5:7b`和`llama3.1:8b`)。这些代表了无需网络依赖即可在消费级硬件上运行的系统类型。一种前沿模型通过Gemini API访问,作为上层参考。解码在零温度下是确定性的,以便精确复制。 每个回答都在四个独立维度上进行评分。临床正确性取值:2分表示回答正确,1分表示遗漏关键点但未引入危险的局部或模糊回答,0分表示错误、缺失或不可理解地回答,−1分表示具有实际危害的回答。安全回避记录为适当、回避不足或过度拒绝。语言质量记录为流利、别扭或破碎,独立于临床内容进行评判,以便区分流利但错误的回答与正确但笨拙的回答。实际产生的语言被单独记录,因为模型并不能可靠地使用提示所用的语言进行回答。 危险自信率是指同时具备未加回避、自信且临床错误这三个特征的回答所占的比例。优先于原始错误率报告,因为它隔离了读者可能据以采取行动的那部分错误。 所有128个回答均由两名流利的豪萨语使用者独立评分。第二评分者收到一份移除了第一评分者判断的评分表,连同书面的评分标准,并在评分过程中不讨论分数。一致性以原始符合率和Cohen的κ系数报告[1 (https://arxiv.org/html/2607.17270#bib.bib1),2 (https://arxiv.org/html/2607.17270#bib.bib2)]。 本研究不涉及人类受试者,也未使用患者数据。所有临床场景均为合成的。本研究根据已发布的指南评估模型输出,不对任何个体的护理情况提出主张。数据集、提示和评分代码已发布,以便进行复制[16 (https://arxiv.org/html/2607.17270#bib.bib16)]。 ## 结果 对于所研究的每一种疾病,平均临床正确性从英语到豪萨语均有所下降(图1 (https://arxiv.org/html/2607.17270#Sx4.F1)):疟疾从1.25降至0.15,镰状细胞病从1.85降至−0.30,结核病从1.67降至0.33。幅度各不相同,但方向一致。镰状细胞病既显示出最强的英语性能,也显示出最弱的豪萨语性能,因此模型在英语中最胜任的疾病,恰恰是它们在豪萨语中最不安全的疾病。 参考图1说明:按疾病条件和语言划分的平均临床正确性,汇总自所有六种模型。零线下方的阴影区域表示平均而言被判定为具有实际危害的回答。汇总所有疾病条件,五种可本地部署的模型平均正确性从英语的1.57下降到豪萨语的−0.03,平均而言从胜任跨入有害。前沿模型从2.00下降到1.75(图2 (https://arxiv.org/html/2607.17270#Sx4.F2),表1 (https://arxiv.org/html/2607.17270#Sx4.T1))。 参考图2说明:按部署层级和语言划分的临床正确性。可本地部署的模型在豪萨语中跨入有害范围;前沿模型则没有。表1:按部署层级划分的正确性。评分标准:2分正确,1分局部/部分,0分错误,−1分有害。这是核心观察结果。其解读取决于它排除了什么。这并非因为豪萨语在临床上难以沟通(因为前沿模型在所有四种问题形式下都生成了流利且符合指南要求的豪萨语回答)。这也不是因为问题本身无法回答(因为每个模型用英语都能胜任地回答)。剩下的只有层级。 每一个可部署模型都无一例外地接近或越过
相似文章
低资源语言中的LLM安全对齐:一项系统性文献综述
本系统性文献综述研究了大型语言模型在低资源语言中的安全对齐,指出存在持续的多语言安全差距,并提出了未来方向,如基于文化背景的基准测试和参与式数据收集。
压力测试医学大语言模型揭示基准准确率之外的潜在安全病理
本文介绍了AI-MASLD,一个用于医学大语言模型的压力审计框架,揭示了基准准确率如何掩盖严重的安全故障,并展示了开放权重模型在安全维度上可以媲美或超越专有模型。
无害原则?网络部署的医疗大语言模型中的幻觉与行为体层级滥用
本文对医疗大语言模型(包括定制MedGPT和开源模型)进行了大规模评估,发现其中25-30%的模型事实准确性较低,33.6-54.3%的模型违反操作阈值,揭示了系统性的安全风险。
一个用于医学大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
本文提出了一个多领域红队框架,用于在690个临床相关场景中评估医学大语言模型的安全性、鲁棒性和公平性。结果表明,高聚合准确率可能掩盖关键失败,而结合临床专家审核的混合评估对于可信的安全性评估是必要的。
真实世界临床护理中的推理:为什么大语言模型尚不能安全用于自主临床决策支持
这篇观点文章认为,大语言模型尚不能安全用于自主临床决策支持,尤其是在对未分诊患者进行分诊时,原因在于缺乏在不完整信息和漏诊不对称成本条件下的稳健评估。