基于Token的双视角融合与大视觉模型在乳腺癌分类中的适配
摘要
本文提出了一种以Token为中心的双视角学习框架,在冻结的视觉Transformer中统一了基于提示的适配和跨视角融合,以改善基于乳腺X线图像的乳腺癌分类,在VinDr-Mammo和CMMD数据集上取得了一致的性能提升。
查看缓存全文
缓存时间: 2026/07/09 19:41
论文页面 - 基于令牌的双视角融合与大型视觉模型适应方法用于乳腺癌分类
来源:https://huggingface.co/papers/2607.06309
摘要
一种以令牌为中心的双视角学习框架,在冻结的视觉变换器(Vision Transformer)中统一了基于提示的适应与跨视角融合,以改善基于乳腺X线图像的乳腺癌分类。
准确的乳腺X线乳腺癌分类需要有效整合头尾位(CC)和内外斜位(MLO)视角的互补信息,这两种视角能更完整地表征乳腺异常。然而,现有的多视角学习方法通常依赖特征级聚合或单阶段交叉注意力,这可能会混淆视角特定表示与共享表示,并将交互限制在有限的网络深度。为了解决这些限制,我们提出了一种以令牌为中心的双视角学习框架,在冻结的视觉变换器骨干网络中统一了基于提示的适应与跨视角融合。该框架将视角间交互重新构建为结构化的令牌级通信,其中专用融合令牌通过交叉注意力显式编码CC与MLO视角间的双向信息交换,充当跨视角依赖关系的中间载体,而非依赖直接的特征融合。与传统方法在单层进行融合不同,融合模块被插入到多个变换器深度,从而实现编码器层级上的渐进式重复交互。融合令牌被重新整合到令牌序列中,并由后续变换器层进一步精炼,从而促进互补信息的分层传播,同时保留视角特定的结构。在VinDr-Mammo和CMMD数据集上的实验表明,该方法在线性探测、仅提示适应以及传统融合基线之上均取得了一致改进。在VinDr-Mammo BI-RADS分类任务中,该框架实现了50.40%的F1分数和0.8090的AUC,其中在二分类场景下AUC比双视角融合基线高出0.10。消融研究进一步验证了基于令牌的融合和多深度交互设计的有效性。
查看 arXiv 页面 (https://arxiv.org/abs/2607.06309)查看 PDF (https://arxiv.org/pdf/2607.06309)GitHub0 (https://github.com/PartAI-Projects/CrossViewTokenFusion)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.06309)
在你的Agent中获取这篇论文:
hf papers read 2607\.06309
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型关联此论文
请在模型README.md中引用arxiv.org/abs/2607.06309以在此页面建立链接。
引用该论文的数据集0
没有数据集关联此论文
请在数据集README.md中引用arxiv.org/abs/2607.06309以在此页面建立链接。
引用该论文的Space0
没有Space关联此论文
请在Space README.md中引用arxiv.org/abs/2607.06309以在此页面建立链接。
包含该论文的合集0
没有合集包含此论文
请将此论文添加到一个合集 (https://huggingface.co/new-collection)中以在此页面建立链接。
相似文章
Token级别跨模态Transformer与对比多任务学习用于乳腺癌亚型分类和生存预测
本文提出了UMMT,一种基于Token级别的跨模态Transformer与对比多任务学习,用于乳腺癌亚型分类和生存预测,在METABRIC和TCGA-BRCA数据集上取得了最先进的结果。
ClinFusion:面向全面医疗理解的以视觉为中心的多模态大语言模型系统
ClinFusion 是一个以视觉为中心的多模态大语言模型,用于全面医疗理解,它使用级联视觉编码器统一了 2D 和 3D 医学图像分析。它在 24 个基准测试中的 20 个上达到了最先进的结果,并在 16 个基准测试中的 13 个上超越了 GPT-5.2 和 Gemini-3-Flash 等专有模型。
VFA: 通过无视觉适应增强多模态大语言模型的多语言能力
本文提出无视觉适应(VFA),一种通过融合多语言和视觉对齐的任务向量来增强多模态大语言模型多语言能力的框架,无需视觉数据,并展示了性能提升和数据效率。
Late-Layer Fusion 足矣:视觉饱和下多模态大语言模型的双路径视觉令牌路由
本文提出 DPVR-LF,一种面向多模态大语言模型(MLLM)的模态不对称路由框架,该框架在视觉令牌饱和点将其路由到轻量级侧分支,并执行晚期融合,从而在减少视觉计算量的同时保持具有竞争力的性能。
从二维网格到一维标记:改革多模态图像融合的共享表示
本文提出了一种多模态图像融合方法,该方法使用来自预训练图像标记器的一维标记接口,通过选择性标记编辑(STE)来增强全局外观一致性,同时保留局部细节。在四个基准上的实验表明,该方法在全局一致性和局部保真度方面均达到了最先进性能。