同一位患者,不同的表述,不同的诊断?评估临床大语言模型的语义稳定性

arXiv cs.CL 论文

摘要

本文提出了一种基于自然语言推理(NLI)的语义验证框架,用于评估临床大语言模型对保留语义的提示变化的敏感性,并引入了MVS、ΔC和WCI等度量指标。结果表明,领域专业化并不能持续提高鲁棒性,领域专用模型和通用模型的表现均参差不齐。

arXiv:2605.30646v1 公告类型:新提交 摘要:大型语言模型(LLM)在临床应用中越来越广泛。然而,它们的行为对细微的语言变化(如重新措辞或句法变化)仍然高度敏感。这种敏感性在安全关键的医疗场景中带来了风险,因为语义等价的输入应产生一致的预测。然而,一个关键挑战是确保提示变化真正保留临床意义,因为基于嵌入的相似性度量往往无法捕捉涉及否定、时间性或严重程度的区分。为了解决这一限制,我们提出了一种基于自然语言推理(NLI)的语义验证框架,用于筛选保留语义的提示变化,并进一步通过LLM作为评判员进行优化,并由临床专家审核。此外,我们引入了三个度量指标来量化模型敏感性:保留语义变化敏感性(MVS)、置信度变化(\Delta C)和最坏情况不稳定性(WCI)。我们评估了来自相同模型家族和参数规模的16个开源通用(GP)和医学LLM,使用了从DiagnosisQA和MedQA数据集衍生的重新表述提示。我们的结果表明,领域专用(DS)模型之间的鲁棒性差异是混合的且高度依赖于模型,即领域专业化并不能一致地提高或降低对保留语义的提示重新表述的鲁棒性。几个DS模型在鲁棒性方面排名靠前(与GP对应模型相比),而强大的GP基线模型也保持了竞争力。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:26

# 同一患者,不同措辞,不同诊断?评估临床大语言模型的语义稳定性
来源: https://arxiv.org/abs/2605.30646
查看PDF (https://arxiv.org/pdf/2605.30646)

> 摘要:大语言模型(LLMs)在临床应用中日益普及。然而,其行为对细微的语言变化(如改写或句法变动)依然高度敏感。这种敏感性在安全至上的医疗场景中带来风险——语义上等价的输入应产生一致的预测结果。但关键在于如何确保提示词的变化真正保留临床意义,因为基于嵌入的相似度指标往往难以捕捉涉及否定、时间性或严重程度的语义差异。为解决这一局限,我们提出了一种基于自然语言推理(NLI)的语义验证框架,用于筛选保留意义的提示词变化,并进一步通过LLM-as-a-judge进行精炼,且由临床专家审核。此外,我们引入了三个量化模型敏感度的指标:保留意义的变化敏感度(MVS)、置信度变化(ΔC)和最差情况不稳定性(WCI)。我们评估了16个开源通用(GP)和医学特定(DS)的大语言模型,这些模型来自相同的模型系列和参数量级,使用了基于DiagnosisQA和MedQA数据集改写后的提示词。实验结果表明,领域特定(DS)模型之间的鲁棒性差异呈现混合趋势且高度依赖具体模型——即领域专业化并不能一致地提升或降低对保留意义的提示词改写鲁棒性。部分DS模型(与对应GP模型相比)位居最鲁棒之列,而强大的GP基线模型同样表现出竞争力。

## 提交历史

来自:Mahdi Alkaeed Khalaf [查看邮箱 (https://arxiv.org/show-email/b6c2c15c/2605.30646)] **[v1]** 2026年5月28日 星期四 23:03:43 UTC (2,457 KB)

相似文章

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。

面向数据敏感领域的LLM输出的神经符号验证(扩展预印本)

arXiv cs.AI

本文提出了一种针对高风险领域LLM输出的神经符号验证架构,结合形式化符号方法与神经语义分析。在一个医疗器械损伤评估系统上进行的评估显示,该架构对结构化实体的幻觉检测率超过83%,语义虚构的检测率达72%,报告创建时间缩短30%。