benchmark-accuracy

标签

Cards List
#benchmark-accuracy

压力测试医学大语言模型揭示基准准确率之外的潜在安全病理

arXiv cs.AI · 2026-06-09 缓存

本文介绍了AI-MASLD,一个用于医学大语言模型的压力审计框架,揭示了基准准确率如何掩盖严重的安全故障,并展示了开放权重模型在安全维度上可以媲美或超越专有模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈