QG-MIL:用于医学影像领域无关多实例学习的门控Transformer聚合器

Hugging Face Daily Papers 论文

摘要

本文介绍QG-MIL,一种门控Transformer聚合器,缓解了医学影像多实例学习中的注意力集中问题,无需辅助损失即可实现领域无关的性能。

在医学影像中,基于注意力的多实例学习聚合器容易出现注意力集中问题,从而产生过于自信且不稳定的预测。我们提出了QG-MIL,一种门控Transformer聚合器,通过四种协同架构组件解决这一问题:基于RMSNorm的预归一化、逐头部QK归一化、细粒度注意力输出门控以及SwiGLU风格的前馈模块。这些设计选择共同稳定了训练过程,并将注意力更均匀地分布在实例上,无需辅助损失、掩码或多阶段正则化。我们在涵盖全切片病理学和细胞级血液学的六个基准上评估了QG-MIL,涉及两种根本不同的MIL尺度。表现最佳的QG-MIL变体在所有六个基准上均优于领先基线,平均提高了+6.1个平均宏F1分数。注意力叠加和注意力质量分析证实了更分散的实例权重。消融研究表明,虽然单个组件在特定数据集上可以匹配完整模型,但与所选基线相比,QG-MIL设计提供了最一致的跨域性能和最紧凑的方差。我们发布了一个可配置的实现以支持可重复性,地址:https://github.com/unica-visual-intelligence-lab/QG-MIL
查看原文
查看缓存全文

缓存时间: 2026/06/24 09:47

论文页面 - QG-MIL:面向医学影像领域无关多实例学习的门控Transformer聚合器

来源:https://huggingface.co/papers/2606.20027

大家好,感谢关注我们的论文!

在 QG-MIL 中,我们研究了医学多实例学习中的注意力集中问题——基于注意力的聚合器可能将注意力坍缩到一小部分实例上,从而产生不稳定或过度自信的预测。

我们的目标是设计一个简单的即插即用型 MIL 聚合器,在架构层面缓解这一问题,无需辅助损失、掩码策略或多阶段训练。QG-MIL 结合了 RMSNorm 预归一化、逐头 QK 归一化、注意力输出门控以及 SwiGLU 风格的前馈层,并在不同包大小和特征提取器的病理学与血液学基准上进行了评估。

欢迎讨论方法、局限性、消融实验或可能的扩展方向!

相似文章

GQA-{\mu}P: 群组查询注意力的最大参数化更新

arXiv cs.LG

本文将最大更新参数化(μP)框架扩展到群组查询注意力(GQA),推导出跨模型架构的超参数迁移的缩放定律。它引入了用于特征学习的谱范数条件,并解决了GQA中低秩权重矩阵的问题。

GQLA: 面向硬件自适应大语言模型解码的分组查询潜在注意力

arXiv cs.LG

GQLA 提出了对多头潜在注意力(MLA)的极小修改,在相同训练权重上同时暴露 MQA 吸收路径和 GQA 路径,从而无需重新训练即可实现硬件自适应解码。该方法压缩 KV 缓存并支持张量并行性,通过将 LLaMA-3-8B 从 GQA 转换为 GQLA 得到验证。

一个AI聚合器?

Reddit r/AI_Agents

一位用户分享了使用ChatGPT进行复杂医疗护理的经验,并提出聚合多个AI模型的想法,通过寻求不同LLM之间的共识来提高可靠性。