迈向可解释的视网膜眼底图像基础模型
摘要
本文提出DualIFM,一种为视网膜眼底图像设计的可解释基础模型,以更少的参数实现与RETFound相当的性能,同时提供可解释的预测。
查看缓存全文
缓存时间: 2026/08/10 10:14
论文页面:迈向可解释的视网膜眼底图像基础模型
来源:https://huggingface.co/papers/2603.18846
摘要
基础模型用于从大量未标记数据中提取可迁移表示,通常通过自监督学习(SSL)实现。然而,其中许多模型依赖的架构可解释性有限,这在医学影像等高风险领域是一个关键问题。我们提出了 DualIFM,一种通过 BagNet 骨干网络实现设计上可解释的基础模型,其小感受野生成的类别证据图忠实于模型的决策过程。此外,DualIFM 在预训练期间引入了 2D 投影层,能够直接可视化表示空间,从而在数据集层面展示学习到的结构,包括有意义的临床聚类以及潜在的虚假相关性。我们在来自不同来源的超过 80 万张彩色眼底照片上训练了 DualIFM,以学习适用于不同下游任务的可泛化表示。我们的模型在提供对分布外数据的可解释预测的同时,达到了与参数多 16 倍的 RETFound 相当的性能。这些结果表明,大规模 SSL 预训练与固有可解释性相结合,可以为视网膜成像带来鲁棒的表示。代码和预训练模型可在 github.com/berenslab/interpretable_FM 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2603.18846) 查看 PDF (https://arxiv.org/pdf/2603.18846) GitHub0 (https://github.com/berenslab/interpretable_FM) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2603.18846)
在你的代理中获取此论文:
hf papers read 2603\.18846
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
CamilaR20/Dual-IFM 图像特征提取•更新于约1小时前 (https://huggingface.co/CamilaR20/Dual-IFM)
引用此论文的数据集0
没有链接此论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2603.18846 即可从此页面链接到该数据集。
引用此论文的 Spaces0
没有链接此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2603.18846 即可从此页面链接到该 Space。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到该收藏集。
相似文章
一种智能体AI框架克服大语言模型在眼底照相青光眼检测中的根本性局限
这篇arXiv论文介绍了一种智能体AI框架,将大语言模型与专门的深度学习工具集成,用于从眼底图像检测青光眼,与仅使用大语言模型的方法相比,准确率提高了16至47个百分点,并降低了运行间变异性。
从ML预测到基于Toulmin论证模型的知情诊断辅助
本文提出一个框架,利用Toulmin论证模型对基于OCT图像的ML视网膜诊断进行结构化,整合生物标志物提取、医学大语言模型推理(MedGemma)和相似度度量(MedSigLip),以实现可解释且基于证据的诊断辅助。
i1:一个简单且完全开放的强文本到图像模型配方
本文介绍了i1,一个3B参数的文本到图像扩散模型,在性能上与领先的闭源模型竞争,同时完全开放(权重、数据、代码)。它提供了来自300多项控制实验的见解,并为开放研究提供了实用配方。
M2Retinexformer: 多模态Retinexformer用于低光照图像增强
M2Retinexformer通过交叉注意力和自适应门控机制融合深度、亮度和语义线索,扩展了Retinexformer框架用于低光照图像增强,在多个基准上取得了最先进的结果。
Lens:重新思考基础文本到图像模型的训练效率
Lens是微软推出的一款紧凑型38亿参数文本到图像模型,在训练计算量显著降低的同时,通过密集描述、多分辨率批处理和高效架构,达到了与更大模型竞争甚至超越的性能。