压力测试医学大语言模型揭示基准准确率之外的潜在安全病理
摘要
本文介绍了AI-MASLD,一个用于医学大语言模型的压力审计框架,揭示了基准准确率如何掩盖严重的安全故障,并展示了开放权重模型在安全维度上可以媲美或超越专有模型。
arXiv:2606.07929v1 公告类型:新
摘要:大语言模型(LLM)正基于基准准确率进入临床实践,但这种准确率可能无法检测到与安全相关的故障模式。本文提出AI-MASLD,这是一个压力审计框架,它将肝脏病学中的代谢应激测试逻辑应用于临床LLM的评估。通过使用240个临床病例和六种叙事扰动探针,我们对七个模型进行了双重压力测试,并通过三个指标量化性能:代谢指数(MI)、扰动翻转率(PFR)和反事实公平指数(CFI)。在干净的基线条件下,所有模型表现均匀良好。在现实的叙事压力下,性能出现显著分化,揭示了两种不同的应激反应表型。量化模型表现出假性正常化,即低翻转率掩盖了功能崩溃。医学监督微调系统性地降低了逻辑稳定性、公平性和信息提取能力。一个开放权重模型在每一个安全维度上都匹配或超越了专有替代方案。这些发现确立了叙事压力审计作为基于准确率评估的必要补充。
查看缓存全文
缓存时间: 2026/06/09 08:53
# 压力测试医疗大语言模型揭示基准准确性之外的潜在安全病理 来源:https://arxiv.org/abs/2606.07929 查看PDF (https://arxiv.org/pdf/2606.07929) > 摘要:大型语言模型(LLMs)正基于可能无法检测出安全相关失败模式的基准准确性进入临床实践。在此,我们提出AI-MASLD,一种压力审计框架,它将肝病学中的代谢压力测试逻辑应用于临床LLMs的评估。利用跨越六个叙事扰动探针的240个临床病例,我们对七个模型进行了双重压力测试,并通过三个指标量化了性能:代谢指数(MI)、扰动翻转率(PFR)和反事实公平指数(CFI)。在干净的基线条件下,所有模型均表现均匀良好。在现实的叙事压力下,性能急剧分化,揭示出两种不同的应激反应表型。量化模型表现出伪正常化,即低翻转率掩盖了功能性崩溃。医学监督微调系统地降低了逻辑稳定性、公平性和信息提取能力。一个开放权重模型在每一个安全维度上均匹配或超越了专有替代方案。这些发现确立了叙事压力审计作为基于准确性评估的必要补充。 ## 提交历史 来自:Linghua Yu 教授 [查看电子邮件 (https://arxiv.org/show-email/331fe2cc/2606.07929)] **\[v1\]** 2026年6月6日星期六 01:39:14 UTC (3,384 KB)
相似文章
一个用于医学大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
本文提出了一个多领域红队框架,用于在690个临床相关场景中评估医学大语言模型的安全性、鲁棒性和公平性。结果表明,高聚合准确率可能掩盖关键失败,而结合临床专家审核的混合评估对于可信的安全性评估是必要的。
无害原则?网络部署的医疗大语言模型中的幻觉与行为体层级滥用
本文对医疗大语言模型(包括定制MedGPT和开源模型)进行了大规模评估,发现其中25-30%的模型事实准确性较低,33.6-54.3%的模型违反操作阈值,揭示了系统性的安全风险。
基于多传感器物理危害评估的大语言模型基准测试
该论文对五个大语言模型在多传感器物理危害评估中的表现进行了基准测试,结果发现,当多个传感器同时升高但均未达到各自安全限值时,所有被测试模型均未能发出预警信号,而在单传感器违规检测中则表现出近乎完美的准确性。
诊断之前先询问:Safe-Psych,面向精神科领域大语言模型的序贯评估基准
介绍了Safe-Psych,一个用于评估大语言模型如何在精神科处理诊断不确定性的序贯基准,结果显示即使是强大的模型在临床证据不完整时也常常无法放弃诊断或寻求澄清。
在信息缺失情况下评估医疗人工智能:同源评审者与人工评分者改变表观安全性
本文将信息缺失压力测试推广至开放式医疗对话,发现大语言模型评审者的选择会显著改变表观安全性,且LLM评审者比临床医生更为宽松。