ModaLens:在报告条件下的医学视觉语言模型中测量图像敏感性

Hugging Face Daily Papers 论文

摘要

ModaLens是一种配对图像交换审计方法,用于测量报告可用性如何降低医学视觉语言模型中的图像敏感性,通过在MIMIC-CXR数据集上使用MedGemma-27B进行演示。

放射学报告已经可以回答临床问题,因此很难判断视觉语言模型是否也使用了图像。ModaLens,一种配对图像交换审计,测量报告可用性如何改变图像敏感性:MedGemma-27B在来自293名患者的3,199个配对MIMIC-CXR病例上进行测试,每个病例有14个问题(13个特定发现和一个复合问题),每张图像被替换为另一项研究的图像,通常是同一患者,问题和报告固定不变。在明确的答案指令下,模型生成的答案在有报告的试验中变化了4.26%,在没有报告的试验中变化了20.94%,配对增加了16.7个百分点(患者聚类95%置信区间为15.6到17.7),因此报告可用性在此协议下降低了图像交换敏感性;原始提示使用小写首词读数给出4.70%对17.07%,并且替换也改变了连续答案分数,即使二进制预测没有变化。标签来源于报告,这限制了关于视觉正确性的结论;该方向在另外两个模型谱系中得到复制。代码、确切的提示和每个数字的运行记录可在 https://github.com/criticaldata/MODALENS 查看。
查看原文
查看缓存全文

缓存时间: 2026/09/15 14:42

论文页面 - ModaLens:衡量报告条件医学视觉语言模型中的图像敏感性

来源:https://huggingface.co/papers/2609.15635 作者:

,

,

,

,

,

,

,

,

,

,

摘要

一项配对图像交换审计表明,报告的可用性显著降低了视觉语言模型在放射学问答任务中对图像变化的敏感性。

一份放射学报告本身已足以回答临床问题,因此很难判断视觉语言模型 (https://huggingface.co/papers?q=vision-language%20model) 是否也使用了图像。ModaLens (https://huggingface.co/papers?q=ModaLens) 是一种配对图像交换审计 (https://huggingface.co/papers?q=image-swap%20audit),用于衡量报告可用性如何改变图像敏感性:在 MedGemma-27B (https://huggingface.co/papers?q=MedGemma-27B) 上,对来自 293 名患者的 3,199 例配对 MIMIC-CXR (https://huggingface.co/papers?q=MIMIC-CXR) 病例进行测试,每个病例包含全部 14 个问题(13 个针对特定发现,1 个综合问题),每张图像均替换为来自另一项检查(通常为同一患者)的图像,问题和报告保持不变。在明确的答案指令下,模型生成的答案在有报告时有 4.26% 的试验发生变化,在无报告时则有 20.94% 发生变化,配对增加 16.7 个百分点(患者聚类 95% 置信区间为 15.6 至 17.7),因此报告的可用性在该方案下降低了图像交换敏感性;原始提示词(首字母小写输出)则为 4.70% 对比 17.07%,并且替换图像也会移动连续答案分数 (https://huggingface.co/papers?q=continuous%20answer%20scores),即使二元预测未发生变化。标签来源于报告,这限制了对视觉正确性的结论;该方向在另外两个模型系列中也得到了复现。代码、确切提示词以及每个数字的运行记录见于 https://github.com/criticaldata/MODALENS (https://huggingface.co/papers?q=MODALENS)。

查看 arXiv 页面 (https://arxiv.org/abs/2609.15635)查看 PDF (https://arxiv.org/pdf/2609.15635)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.15635)

通过您的代理获取此论文:

hf papers read 2609.15635

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.15635 以从此页面链接。

引用此论文的数据集 0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.15635 以从此页面链接。

引用此论文的 Spaces 0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2609.15635 以从此页面链接。

包含此论文的收藏夹 0

无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

ClinLens:面向纵向多模态临床数据科学的长期编码智能体

arXiv cs.AI

ClinLens是一个新的基准,包含200个可执行的临床数据科学任务,涵盖五个相互关联的MIMIC资源,评估长期编码智能体在纵向多模态数据上的表现。结果显示代码执行能力强,但临床分析正确性较差,凸显了可运行提交与有效分析之间的差距。

IMCBench:面向图像基础医疗对话的多模态大语言模型基准

arXiv cs.AI

IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。

MedLoCoMo:面向大语言模型的长上下文多会话医疗对话基准

arXiv cs.AI

MedLoCoMo 是一个新基准,用于评估大语言模型在长上下文、多会话医疗对话推理上的表现,基于 MIMIC-IV 数据构建。它测试了单次入院、跨入院以及对抗性不可回答的问题,揭示出即使对于拥有长上下文窗口的模型,跨入院推理仍然具有挑战性。