medical-benchmark

标签

Cards List
#medical-benchmark

相同事实,不同诊断:度量并缓解临床语言模型中的叙事锚定

arXiv cs.CL · 2026-07-31 缓存

本文介绍了一种称为“叙事锚定”的失败模式,即当相同的临床事实以不同的社会语言学语域表达时,临床语言模型会产生不同的诊断结果。作者发布了一个基于USMLE的数据集,并提出了NarrativeShield,这是一个三代理流水线,可将锚定差距降至接近零。

0 人收藏 0 人点赞
#medical-benchmark

测量LLMs在误导性医疗语境下的认知韧性

Hugging Face Daily Papers · 2026-06-10 缓存

介绍了MedMisBench,用于测量LLMs在误导性语境下维持正确医疗推理的能力。结果显示,在对抗性条件下,准确率从71.1%骤降至38.0%,临床专家组指出存在潜在危害。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈