ModaLens:在报告条件下的医学视觉语言模型中测量图像敏感性
摘要
ModaLens是一种配对图像交换审计方法,用于测量报告可用性如何降低医学视觉语言模型中的图像敏感性,通过在MIMIC-CXR数据集上使用MedGemma-27B进行演示。
查看缓存全文
缓存时间: 2026/09/15 14:42
论文页面 - ModaLens:衡量报告条件医学视觉语言模型中的图像敏感性
来源:https://huggingface.co/papers/2609.15635 作者:
,
,
,
,
,
,
,
,
,
,
摘要
一项配对图像交换审计表明,报告的可用性显著降低了视觉语言模型在放射学问答任务中对图像变化的敏感性。
一份放射学报告本身已足以回答临床问题,因此很难判断视觉语言模型 (https://huggingface.co/papers?q=vision-language%20model) 是否也使用了图像。ModaLens (https://huggingface.co/papers?q=ModaLens) 是一种配对图像交换审计 (https://huggingface.co/papers?q=image-swap%20audit),用于衡量报告可用性如何改变图像敏感性:在 MedGemma-27B (https://huggingface.co/papers?q=MedGemma-27B) 上,对来自 293 名患者的 3,199 例配对 MIMIC-CXR (https://huggingface.co/papers?q=MIMIC-CXR) 病例进行测试,每个病例包含全部 14 个问题(13 个针对特定发现,1 个综合问题),每张图像均替换为来自另一项检查(通常为同一患者)的图像,问题和报告保持不变。在明确的答案指令下,模型生成的答案在有报告时有 4.26% 的试验发生变化,在无报告时则有 20.94% 发生变化,配对增加 16.7 个百分点(患者聚类 95% 置信区间为 15.6 至 17.7),因此报告的可用性在该方案下降低了图像交换敏感性;原始提示词(首字母小写输出)则为 4.70% 对比 17.07%,并且替换图像也会移动连续答案分数 (https://huggingface.co/papers?q=continuous%20answer%20scores),即使二元预测未发生变化。标签来源于报告,这限制了对视觉正确性的结论;该方向在另外两个模型系列中也得到了复现。代码、确切提示词以及每个数字的运行记录见于 https://github.com/criticaldata/MODALENS (https://huggingface.co/papers?q=MODALENS)。
查看 arXiv 页面 (https://arxiv.org/abs/2609.15635)查看 PDF (https://arxiv.org/pdf/2609.15635)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.15635)
通过您的代理获取此论文:
hf papers read 2609.15635
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.15635 以从此页面链接。
引用此论文的数据集 0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.15635 以从此页面链接。
引用此论文的 Spaces 0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2609.15635 以从此页面链接。
包含此论文的收藏夹 0
无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
ClinLens:面向纵向多模态临床数据科学的长期编码智能体
ClinLens是一个新的基准,包含200个可执行的临床数据科学任务,涵盖五个相互关联的MIMIC资源,评估长期编码智能体在纵向多模态数据上的表现。结果显示代码执行能力强,但临床分析正确性较差,凸显了可运行提交与有效分析之间的差距。
IMCBench:面向图像基础医疗对话的多模态大语言模型基准
IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。
VLMs 在基准测试中能取得高分,但同时会静默地抹去有意义的术语并引入幻觉偏差 [P]
本文强调,用于胸部X光报告生成的 VLMs 在基准测试中能取得高分,但同时会抹去有临床意义的术语并引入有偏见的语言,并提出一个框架来度量这些失败。
MemLens:大规模视觉-语言模型中多模态长期记忆的基准测试
MemLens是一个新的基准测试,通过多轮对话评估大规模视觉-语言模型的记忆能力。它比较了长上下文和记忆增强方法,揭示了二者的局限性,并推动了混合架构的发展。
MedLoCoMo:面向大语言模型的长上下文多会话医疗对话基准
MedLoCoMo 是一个新基准,用于评估大语言模型在长上下文、多会话医疗对话推理上的表现,基于 MIMIC-IV 数据构建。它测试了单次入院、跨入院以及对抗性不可回答的问题,揭示出即使对于拥有长上下文窗口的模型,跨入院推理仍然具有挑战性。