迈向可解释的视网膜眼底图像基础模型

Hugging Face Daily Papers 论文

摘要

本文提出DualIFM,一种为视网膜眼底图像设计的可解释基础模型,以更少的参数实现与RETFound相当的性能,同时提供可解释的预测。

基础模型用于从大量未标记数据中提取可迁移的表征,通常通过自监督学习(SSL)实现。然而,许多此类模型依赖的架构可解释性有限,这在医学影像等高风险领域是一个关键问题。我们提出DualIFM,一种通过BagNet骨干网络实现内在可解释性的基础模型,其较小的感受野生成与模型决策过程一致的类别证据图。此外,DualIFM在预训练阶段引入了二维投影层,可直接可视化表征空间,提供数据集级别的学得结构视图,包括有意义的临床聚类以及潜在的虚假相关性。我们在来自不同来源的超过80万张彩色眼底照片上训练了DualIFM,以学习适用于不同下游任务的泛化表征。我们的模型在分布外数据上实现了与RETFound相当的性能(其参数数量是后者的16倍),同时提供可解释的预测。这些结果表明,大规模SSL预训练与内在可解释性相结合,可以为视网膜成像带来稳健的表征。代码和预训练模型可在github.com/berenslab/interpretable_FM获取。
查看原文
查看缓存全文

缓存时间: 2026/08/10 10:14

论文页面:迈向可解释的视网膜眼底图像基础模型

来源:https://huggingface.co/papers/2603.18846

摘要

基础模型用于从大量未标记数据中提取可迁移表示,通常通过自监督学习(SSL)实现。然而,其中许多模型依赖的架构可解释性有限,这在医学影像等高风险领域是一个关键问题。我们提出了 DualIFM,一种通过 BagNet 骨干网络实现设计上可解释的基础模型,其小感受野生成的类别证据图忠实于模型的决策过程。此外,DualIFM 在预训练期间引入了 2D 投影层,能够直接可视化表示空间,从而在数据集层面展示学习到的结构,包括有意义的临床聚类以及潜在的虚假相关性。我们在来自不同来源的超过 80 万张彩色眼底照片上训练了 DualIFM,以学习适用于不同下游任务的可泛化表示。我们的模型在提供对分布外数据的可解释预测的同时,达到了与参数多 16 倍的 RETFound 相当的性能。这些结果表明,大规模 SSL 预训练与固有可解释性相结合,可以为视网膜成像带来鲁棒的表示。代码和预训练模型可在 github.com/berenslab/interpretable_FM 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2603.18846) 查看 PDF (https://arxiv.org/pdf/2603.18846) GitHub0 (https://github.com/berenslab/interpretable_FM) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2603.18846)

在你的代理中获取此论文:

hf papers read 2603\.18846

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

CamilaR20/Dual-IFM 图像特征提取•更新于约1小时前 (https://huggingface.co/CamilaR20/Dual-IFM)

引用此论文的数据集0

没有链接此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2603.18846 即可从此页面链接到该数据集。

引用此论文的 Spaces0

没有链接此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2603.18846 即可从此页面链接到该 Space。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到该收藏集。

相似文章

从ML预测到基于Toulmin论证模型的知情诊断辅助

arXiv cs.AI

本文提出一个框架,利用Toulmin论证模型对基于OCT图像的ML视网膜诊断进行结构化,整合生物标志物提取、医学大语言模型推理(MedGemma)和相似度度量(MedSigLip),以实现可解释且基于证据的诊断辅助。

i1:一个简单且完全开放的强文本到图像模型配方

Hugging Face Daily Papers

本文介绍了i1,一个3B参数的文本到图像扩散模型,在性能上与领先的闭源模型竞争,同时完全开放(权重、数据、代码)。它提供了来自300多项控制实验的见解,并为开放研究提供了实用配方。

Lens:重新思考基础文本到图像模型的训练效率

Hugging Face Daily Papers

Lens是微软推出的一款紧凑型38亿参数文本到图像模型,在训练计算量显著降低的同时,通过密集描述、多分辨率批处理和高效架构,达到了与更大模型竞争甚至超越的性能。