标记错误症状:评估医学文本中的LLM水印

arXiv cs.AI 论文

摘要

本文首次严格研究了LLM水印方案如何影响医学性能,在多个LLM和VLM上评估了五种水印在临床推理任务中的效果。作者发现,水印可能导致医学文本质量下降,包括幻觉和词汇损坏,而这些在通用领域的基准测试中被掩盖。

arXiv:2607.20462v1 公告类型:新 摘要:大型语言模型(LLM)正越来越多地整合到临床工作流程中,这凸显了对模型生成输出进行水印处理以实现可靠可追溯性的需求。然而,大多数水印都是在通用基准测试上进行评估的,导致医学等领域未被充分探索——在这些领域中,微小的令牌级扰动可能导致显著的语义变化。在这项工作中,我们首次严格研究了LLM水印如何影响医学性能,在11个LLM和7个VLM上对5种水印方案进行了基准测试,涉及单模态和多模态临床推理的各种任务。重要的是,我们通过引入一个人工专家验证的流程来补充现有评估,该流程用于系统性地审核医学推理质量、术语准确性和诱导的幻觉。我们的结果表明,水印可能在多种故障模式下导致显著退化,包括词汇损坏、幻觉术语以及图像发现中的误归因或遗漏加剧。值得注意的是,我们发现缺乏领域特定分析,再加上忽略了临床文本固有故障的聚合指标,可能系统性地掩盖实际的水印诱导退化。我们的研究结果确立了领域特定评估作为医学中安全部署水印模型的前提条件,而当前的基准测试可能会掩盖临床上有重大影响的故障。
查看原文
查看缓存全文

缓存时间: 2026/07/24 04:59

# 误判症状:评估医疗文本中的LLM水印来源:https://arxiv.org/html/2607.20462

Melanie Rieff1,∗\astRobin Staab1Thibaud Gloaguen1 Stefan Hegselmann2,3Martin Vechev1

1Department of Computer Science, ETH Zurich, Switzerland
2Berlin Institute of Health at Charité – Universitätsmedizin Berlin, Center of Digital Health, Berlin, Germany
3Deutsches Herzzentrum der Charité – Medical Heart Center of Charité and German Heart Institute Berlin, Berlin, Germany

∗\ast通讯作者:mrieff@student\.ethz\.ch

###### 摘要

大型语言模型 (LLMs) 正日益融入临床工作流程,凸显了对模型生成输出进行可靠追踪(通过水印技术)的需求。然而,大多数水印方案仅在通用基准上进行评估,导致其在医学等领域(微小的词元级扰动可能导致显著的语义变化)的研究尚不充分。在这项工作中,我们首次严格研究了LLM水印如何影响医疗性能,在11个LLM和7个VLM上,针对涵盖单模态和多模态临床推理的各种任务,对5种水印方案进行了基准测试。重要的是,我们通过引入一个经人类专家验证的流水线,系统性地审计医疗推理质量、术语精确性和引发的幻觉,对现有评估进行了补充。我们的结果表明,水印可能导致多种故障模式下的显著性能下降,包括词汇损坏、术语幻觉,以及图像发现的错误归因或遗漏加剧。值得注意的是,我们发现,缺乏领域特定分析,加上聚合指标未能捕捉临床文本固有的故障,可能会系统地掩盖实践中水印引起的性能下降。我们的研究将领域特定评估确立为在医学中安全部署带水印模型的先决条件,因为当前的基准测试可能隐藏具有临床严重后果的故障。

## 1 引言

大型语言模型 (LLMs) 正日益融入临床工作流程:81% 的美国医生报告在专业中使用AI [1 (https://arxiv.org/html/2607.20462#bib.bib1)],并且基于LLM的工具正在积极探索用于报告生成、临床决策支持和患者沟通 [2 (https://arxiv.org/html/2607.20462#bib.bib2), 3 (https://arxiv.org/html/2607.20462#bib.bib3)]。特别是,LLM的输出为下游判断提供信息,从总结病史和起草报告到提出鉴别诊断。随着模型能力的提升,临床依赖的范围可能会扩大,使得生成文本的质量成为患者安全问题。与此同时,新兴的 [4 (https://arxiv.org/html/2607.20462#bib.bib4)] 法规正推动对AI生成内容的溯源标记,水印技术成为追踪LLM输出的主要合规机制 [5 (https://arxiv.org/html/2607.20462#bib.bib5)]。关键的是,这意味着在临床环境中使用的LLM越来越可能使用了水印。

##### LLM水印

水印通过在每一步生成时修改LLM采样过程来嵌入一个统计上可检测的信号,这使得可追溯性成为可能,但根据设计,它会直接影响模型的输出分布。重要的是,先前的工作使用通用领域基准以及诸如困惑度之类的粗略质量代理来评估水印对输出质量的影响。在医学领域,正确性依赖于精确的推理、术语、限定词和数值,即使是微小的词元级扰动也可能显著改变临床意义,这表明这些简单评估的结果可能无法转移 [6 (https://arxiv.org/html/2607.20462#bib.bib6), 7 (https://arxiv.org/html/2607.20462#bib.bib7), 8 (https://arxiv.org/html/2607.20462#bib.bib8)]。这使得理解水印如何改变LLM的临床性能成为一个关键但尚未充分探索的问题。

参见标题图1:我们的评估流水线概览。给定一个多模态基准实例,我们提示VLM(使用思维链提示)在有水印和无水印的情况下进行参考。我们首先评估答案中水印的可检测性及其准确性。然后,我们使用三个特定的LLM评判器(经临床专家验证)更深入地检查推理轨迹。

##### 本研究

在这项工作中,我们提出了第一个关于文本水印如何影响医疗LLM性能的系统性研究,如图1 (https://arxiv.org/html/2607.20462#S1.F1) 所示。特别是,我们在两个医疗基准上评估了5种突出的水印,这些基准混合了临床知识和视觉理解(图1 (https://arxiv.org/html/2607.20462#S1.F1) 左侧)。为了测量水印对推理的影响,我们(在第3.2节 (https://arxiv.org/html/2607.20462#S3.SS2))引入了三个特定的LLM评判器,它们已经过临床专家注释的验证(图1 (https://arxiv.org/html/2607.20462#S1.F1) 右侧)。我们的结果表明,水印可能在很大程度上保持基准准确性不变,同时显著降低底层推理质量:在多个模型上,正确答案背后存在缺陷推理的比例增加了一倍以上(例如,在Phi-4-14B上使用失真性SynthID时,从11.4%增加到26.3%),并且捏造的医疗实体增加了多达+39.2个百分点。在带水印和无水印输出都选择正确答案的问题中,高达40%依赖于互斥的诊断陈述。在多模态输入上,水印越来越多地破坏视觉解释,而对于推理模型,在推理轨迹上加水印会使输出长度增加多达69%,同时降低推理质量,而将水印限制在最终答案上则能保持两者。

##### 主要贡献

我们的主要贡献包括:

- • 在医疗基准(MedQA, MedXpertQA-MM)上,对5种水印方案在11个LLM和7个VLM上进行了系统性评估,并进行了*经医生验证*的LLM评判器审计,评估推理质量、术语精确性和幻觉,超越了单纯的字面准确性。
- • 首次分析了文本解码水印如何与多模态医疗输入交互,揭示了文本生成过程中的水印会降低视觉基础能力,例如,抑制正确的基于图像的陈述并放大矛盾的陈述,尽管准确性保持稳定。
- • 对推理模型水印的研究表明,将水印限制在用户可见的最终答案能保持推理质量,而给思维过程加水印则会降低术语精确性并引发循环论证。

## 2 相关工作

我们回顾了当前LLM在医学领域的评估实践、文本水印的主要类别以及现有关于水印质量评估的工作,强调了促使我们进行研究的差距。

##### 医学中的LLM。通用和专业领域的LLM通常在类似USMLE的基准上进行评估,例如MedQA [9 (https://arxiv.org/html/2607.20462#bib.bib9), 10 (https://arxiv.org/html/2607.20462#bib.bib10)],而多模态基准 [11 (https://arxiv.org/html/2607.20462#bib.bib11), 12 (https://arxiv.org/html/2607.20462#bib.bib12), 13 (https://arxiv.org/html/2607.20462#bib.bib13)] 则将评估扩展到对图像、实验室数据和患者记录的综合解释。关键的是,仅凭基准准确性不足以衡量临床质量:模型可能通过有缺陷的推理得出正确答案 [14 (https://arxiv.org/html/2607.20462#bib.bib14)],产生自信的幻觉 [15 (https://arxiv.org/html/2607.20462#bib.bib15)],或者在保持流畅叙述的同时误用医学术语。这些观察结果推动了更丰富的评估框架,从结构化的推理准则 [16 (https://arxiv.org/html/2607.20462#bib.bib16)] 到医生评级的基准 [17 (https://arxiv.org/html/2607.20462#bib.bib17)],并强调即使是微小的提示变化也可能显著改变医疗输出质量 [8 (https://arxiv.org/html/2607.20462#bib.bib8)]。我们的工作在此基础上引入了3个LLM评判器,这些评判器已得到两位委员会认证医生的验证,专门设计用于审计水印在临床实践相关的质量维度上引起的退化。

##### 水印。生成时文本水印修改采样过程以嵌入与密钥相关的统计上可检测信号,从而实现对AI生成内容的可追溯性 [18 (https://arxiv.org/html/2607.20462#bib.bib18)]。在每个词元位置,上下文相关的哈希函数为词汇表生成伪随机分数分配,并相应修改采样分布。*失真性*方法,如KGW [19 (https://arxiv.org/html/2607.20462#bib.bib19)] 和PPL [20 (https://arxiv.org/html/2607.20462#bib.bib20)],使下一个词元的分布偏向高分词元,从而引入偏离模型原始分布的系统性偏移。*无失真*方法,如DipMark [21 (https://arxiv.org/html/2607.20462#bib.bib21)]、零强度的AAR [22 (https://arxiv.org/html/2607.20462#bib.bib22)] 以及每场比赛使用两片叶子的SynthID-Text [23 (https://arxiv.org/html/2607.20462#bib.bib23)],则以一种在随机水印密钥的期望上保持原始模型分布的方式重新采样词元。然而,这种保证是在*期望*意义上成立的,并且假设没有哈希冲突。我们发现,在实践中,即使是无失真方案也可能导致一些小的推理退化(第4.2节)。

##### 评估水印质量。水印研究通常报告检测能力以及粗略的质量代理,如困惑度或简短的LLM评分 [19 (https://arxiv.org/html/2607.20462#bib.bib19), 23 (https://arxiv.org/html/2607.20462#bib.bib23), 24 (https://arxiv.org/html/2607.20462#bib.bib24)]。然而,这些代理与人类偏好的一致性较差 [6 (https://arxiv.org/html/2607.20462#bib.bib6)],并且掩盖了显著的、任务相关的退化:在匹配的水印强度下,指令遵循质量显著下降 [6 (https://arxiv.org/html/2607.20462#bib.bib6)],较小的模型受影响更大 [25 (https://arxiv.org/html/2607.20462#bib.bib25)],并且推理密集型任务比开放式生成退化更严重 [26 (https://arxiv.org/html/2607.20462#bib.bib26), 27 (https://arxiv.org/html/2607.20462#bib.bib27)]。这些发现表明水印的影响是模型和任务特定的,然而大多数评估仅限于通用领域基准,留下了双重差距:(i) 所研究的任务不能捕捉临床文本的需求,在临床文本中,单个词元的替换可能改变诊断,以及 (ii) 所使用的质量代理无法检测到诸如术语损坏、幻觉发现或推理与结论不一致等故障模式。另外,最近的研究表明水印可以应用于推理轨迹 [28 (https://arxiv.org/html/2607.20462#bib.bib28), 27 (https://arxiv.org/html/2607.20462#bib.bib27)],然而没有研究评估这种应用是否能保持临床推理质量。先前有一项研究尝试评估医疗文本上的水印 [29 (https://arxiv.org/html/2607.20462#bib.bib29)]。然而,我们发现它存在根本性的方法论缺陷,这使得其研究结果不可靠。即,它使用了没有聊天模板的指令微调模型,将生成限制在25个词元(这对于可靠的水印检测来说太短),并且未能建立一个配对的、无水印的基线来衡量幻觉。我们的工作首次引入了一个严格且系统的医用水印评估,涵盖了五种水印方案、多种模型规模和领域专业化,以及应用于处理多模态医疗输入的模型的文本解码水印。重要的是,我们超越了准确性,引入了3个经临床专家验证的LLM评判器,用于探究推理质量、词汇精确性和诊断一致性。

## 3 我们的评估流水线

在本节中,我们介绍如图1 (https://arxiv.org/html/2607.20462#S1.F1) 所示的评估流水线。我们描述了评估的模型、水印和数据(第3.1节),以及使用的指标(第3.2节)。关于我们LLM评判器的临床医生验证的更多细节,我们推迟到第D.2节 (https://arxiv.org/html/2607.20462#A4.SS2) 进行介绍。

### 3.1 设置

我们的评估涵盖了两个探索临床知识互补方面的医疗基准、18个涵盖通用和专业医疗架构的语言和视觉语言模型(规模在4B到70B之间),以及五种突出的水印方案。这些共同定义了我们在后续章节中评估的(模型、水印、强度)配置。

##### 基准。我们以两个医疗基准为基础进行评估,每个基准都旨在探索医疗知识和推理的不同方面。*MedQA* [9 (https://arxiv.org/html/2607.20462#bib.bib9)] 包含2000道选自美国医学执照考试的四选一选择题。Kim和Yoon [10 (https://arxiv.org/html/2607.20462#bib.bib10)] 的元分析指出,在现有的医疗问答数据集中,MedQA是最能预测真实世界临床性能的基准。*MedXpertQA-MM* [13 (https://arxiv.org/html/2607.20462#bib.bib13)] 包含2000道专家策划的五选一问题,涵盖17个医学专业。每个问题配有一到六张图像(平均1.43张,涵盖放射学、病理学和示意图等10种模态),需要结合临床小场景和结构化患者数据(如实验室结果)进行联合解释。

##### 模型。我们评估了三组模型:在*MedQA*上,我们包括六个指令微调的LLM:4个通用模型(Llama-3.1-8B, Llama-3.1-70B [30 (https://arxiv.org/html/2607.20462#bib.bib30)], Gemma-3-12B [31 (https://arxiv.org/html/2607.20462#bib.bib31)], 和Phi-4-14B [32 (https://arxiv.org/html/2607.20462#bib.bib32)]),以及2个医学专业模型(OpenBioLLM-70B [33 (https://arxiv.org/html/2607.20462#bib.bib33)] 和UltraMedical-70B [34 (https://arxiv.org/html/2607.20462#bib.bib34)]),以及4个推理模型(DeepSeek-R1-Distill-Llama-8B, DeepSeek-R1-Distill-Llama-70B, DeepSeek-R1-Distill-Qwen-32B [35 (https://arxiv.org/html/2607.20462#bib.bib35)], 和Qwen-3.5-27B [36 (https://arxiv.org/html/2607.20462#bib.bib36)])。在*MedXpertQA-MM*上,我们评估了7个参数规模在4B到32B之间的VLM:Qwen-3-VL-8B 和 Qwen-3-VL-32B [37 (https://arxiv.org/html/2607.20462#bib.bib37)],Gemma-4-31B [38 (https://arxiv.org/html/2607.20462#bib.bib38)],Lingshu-7B 和 Lingshu-32B [39 (https://arxiv.org/html/2607.20462#bib.bib39)],以及 MedGemma-4B 和 MedGemma-27B [40 (https://arxiv.org/html/2607.20462#bib.bib40)]。特别是,Lingshu-7B, Lingshu-32B, MedGemma-4B 和 MedGemma-27B 是医学专业的VLM,并且没有在MedXpertQA上进行过训练。

##### 水印方案。评估了五种突出的生成时文本水印方案,涵盖了主要的算法族:KGW [19 (https://arxiv.org/html/2607.20462#bib.bib19)] (soft logit bias), DipMark [21 (https://arxiv.org/html/2607.20462#bib.bib21)] (CDF reweighting), AAR [22 (https://arxiv.org/html/2607.20462#bib.bib22)] (Gumbel-max sampling), PPL [20 (https://arxiv.org/html/2607.20462#bib.bib20)] (perplexity-budgeted argmax), 以及

相似文章

AI水印证据未能通过取证准备:一项实证评估

arXiv cs.CL

本文实证评估了三种LLM水印方法(KGW、Unigram、SynthID-Text)在取证可采性标准下的表现,发现没有一种方法达到法院要求的证据标准:在保留语义的改写后,水印几乎100%被移除,甚至在攻击前假阴性率就很高。

线性集成消除水印:论LLM中分布扰动的脆弱性

arXiv cs.CL

本文揭示了LLM水印的一个基本漏洞:当用户能够访问多个模型时,对其输出分布进行平均会抵消水印扰动,从而规避检测。作者提出了WASH方法,并通过实验证明,对3-5个模型进行平均可将检测z分数抑制在阈值以下,同时提升文本质量。

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。

语言感知的非失真性LLM水印

arXiv cs.CL

介绍了LUNA,一种语言感知的LLM水印方法,实现了跨多语言的非失真嵌入和无模型检测,显著提升了AUROC和困惑度保持。

针对封闭 LLM 的可证明检测的数据集水印

arXiv cs.LG

本文提出了一种针对封闭大型语言模型(LLM)的新型数据集水印方法。该方法利用词对共现模式,能够以可证明的方式检测模型训练是否使用了专有数据,即使这些数据在训练数据集中仅占极小比例。