压力测试医学大语言模型揭示基准准确率之外的潜在安全病理

arXiv cs.AI 论文

摘要

本文介绍了AI-MASLD,一个用于医学大语言模型的压力审计框架,揭示了基准准确率如何掩盖严重的安全故障,并展示了开放权重模型在安全维度上可以媲美或超越专有模型。

arXiv:2606.07929v1 公告类型:新 摘要:大语言模型(LLM)正基于基准准确率进入临床实践,但这种准确率可能无法检测到与安全相关的故障模式。本文提出AI-MASLD,这是一个压力审计框架,它将肝脏病学中的代谢应激测试逻辑应用于临床LLM的评估。通过使用240个临床病例和六种叙事扰动探针,我们对七个模型进行了双重压力测试,并通过三个指标量化性能:代谢指数(MI)、扰动翻转率(PFR)和反事实公平指数(CFI)。在干净的基线条件下,所有模型表现均匀良好。在现实的叙事压力下,性能出现显著分化,揭示了两种不同的应激反应表型。量化模型表现出假性正常化,即低翻转率掩盖了功能崩溃。医学监督微调系统性地降低了逻辑稳定性、公平性和信息提取能力。一个开放权重模型在每一个安全维度上都匹配或超越了专有替代方案。这些发现确立了叙事压力审计作为基于准确率评估的必要补充。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:53

# 压力测试医疗大语言模型揭示基准准确性之外的潜在安全病理
来源:https://arxiv.org/abs/2606.07929
查看PDF (https://arxiv.org/pdf/2606.07929)

> 摘要:大型语言模型(LLMs)正基于可能无法检测出安全相关失败模式的基准准确性进入临床实践。在此,我们提出AI-MASLD,一种压力审计框架,它将肝病学中的代谢压力测试逻辑应用于临床LLMs的评估。利用跨越六个叙事扰动探针的240个临床病例,我们对七个模型进行了双重压力测试,并通过三个指标量化了性能:代谢指数(MI)、扰动翻转率(PFR)和反事实公平指数(CFI)。在干净的基线条件下,所有模型均表现均匀良好。在现实的叙事压力下,性能急剧分化,揭示出两种不同的应激反应表型。量化模型表现出伪正常化,即低翻转率掩盖了功能性崩溃。医学监督微调系统地降低了逻辑稳定性、公平性和信息提取能力。一个开放权重模型在每一个安全维度上均匹配或超越了专有替代方案。这些发现确立了叙事压力审计作为基于准确性评估的必要补充。

## 提交历史

来自:Linghua Yu 教授 [查看电子邮件 (https://arxiv.org/show-email/331fe2cc/2606.07929)] **\[v1\]** 2026年6月6日星期六 01:39:14 UTC (3,384 KB)

相似文章

基于多传感器物理危害评估的大语言模型基准测试

arXiv cs.AI

该论文对五个大语言模型在多传感器物理危害评估中的表现进行了基准测试,结果发现,当多个传感器同时升高但均未达到各自安全限值时,所有被测试模型均未能发出预警信号,而在单传感器违规检测中则表现出近乎完美的准确性。