iFAN:面向普通掩码Transformer的推理感知学习
摘要
iFAN是一个训练框架,通过将查询排序与掩码质量对齐,并将中间层的预测蒸馏到最终层,来改进用于分割的掩码Transformer,从而在多个基准上取得一致的性能提升。
查看缓存全文
缓存时间: 2026/08/12 08:19
论文页面 - iFAN:面向朴素掩码 Transformer 的推理感知学习
来源:https://huggingface.co/papers/2608.03216 发布于 8月7日
·
由 Lucas (https://huggingface.co/xxlucas) 于 8月12日 提交
摘要
一种名为 iFAN 的训练框架通过将查询排名与掩码质量对齐,并将更强的中间层预测蒸馏到最终层,从而改进掩码 Transformer。
基于查询的掩码 Transformer (https://huggingface.co/papers?q=Query-based%20mask%20transformers) 通过最终层查询预测之间的像素级竞争 (https://huggingface.co/papers?q=pixel-wise%20competition) 来组装分割输出,然而这一推理过程在训练期间并未被显式优化。我们发现了两个关键的不匹配:具有最高概率掩码分数的查询不一定产生最准确的掩码,并且最终层解码可能会丢弃来自中间层的更优预测。为了解决这些问题,我们提出了推理感知学习 (https://huggingface.co/papers?q=Inference-Aware%20Learning) (iFAN),这是一个面向朴素掩码 Transformer 的通用训练框架。iFAN 引入了调整后的概率掩码排名 (https://huggingface.co/papers?q=Adjusted%20Probability-Mask%20Ranking) (APMR),它将查询竞争与预测的掩码质量对齐,并抑制高置信度但不准确的竞争者。我们进一步采用跨层自蒸馏 (https://huggingface.co/papers?q=Cross-Layer%20Self-Distillation) (CLSD) 将更强的中间层预测迁移到最终层。排名和蒸馏目标仅用于训练,而推理则保留高效的最终层解码。在 COCO、ADE20K 和 Cityscapes 上的实验表明,在全景分割、实例分割和语义分割 (https://huggingface.co/papers?q=semantic%20segmentation) 以及不同架构、骨干网络规模和输入分辨率下均取得了一致的改进。总体而言,iFAN 平均提升了 1.20 PQ、1.30 AP 和 0.63 mIoU,同时仅增加了可忽略不计的参数、FLOPs 和推理延迟。
查看 arXiv 页面 (https://arxiv.org/abs/2608.03216) 查看 PDF (https://arxiv.org/pdf/2608.03216) 项目页面 (https://neesky163.github.io/iFAN/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03216)
在你的 agent 中获取这篇论文:
hf papers read 2608\.03216
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.03216 以从此页面链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.03216 以从此页面链接它。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.03216 以从此页面链接它。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
MaskAlign: Token子集表征对齐实现高效扩散训练
MaskAlign提出了一种Token子集表征对齐方法,通过减少对完整Token集的依赖,并在扰动下保持稳定对齐,从而改进扩散Transformer训练。
Lite3R:一种高效的模型无关前馈3D重建框架
Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。
Interfaze:专为规模化场景下高准确率而构建的新型模型架构
Interfaze 推出了一种混合 AI 模型架构,结合 CNN/DNN 的专项优势与 Transformer 能力,在 OCR 和翻译等确定性任务上实现卓越精度,同时在规模化应用中保持成本效率。
Spec-AUF:掩码块草稿模型中训练-推理不一致下的“接受直到失败”训练
本文提出AUF(接受直到失败),这是一种针对推测解码中掩码块草稿模型的交叉熵损失的简单修改,它将监督限制到第一个预测失败之前的词缀,在不改变推理的情况下提升了多个基准测试的平均生成长度。
X-LogSMask:面向图结构数据的扩展Transformer
X-LogSMask 提出了一种用于图Transformer的对数结构掩码,将图拓扑直接注入注意力logits中,在20个基准测试中的13个上实现了最先进的性能,同时保持了可解释性和多跳信息传播。