iFAN:面向普通掩码Transformer的推理感知学习

Hugging Face Daily Papers 论文

摘要

iFAN是一个训练框架,通过将查询排序与掩码质量对齐,并将中间层的预测蒸馏到最终层,来改进用于分割的掩码Transformer,从而在多个基准上取得一致的性能提升。

基于查询的掩码Transformer通过最终层查询预测之间的像素级竞争来组装分割输出,然而这一推理过程在训练期间并未得到显式优化。我们发现了两个关键的不匹配:具有最高概率掩码分数的查询不一定产生最准确的掩码,并且最终层解码可能会丢弃中间层的更优预测。为了解决这些问题,我们提出了推理感知学习(iFAN),一个适用于普通掩码Transformer的通用训练框架。iFAN引入了调整后的概率-掩码排序(APMR),它将查询竞争与预测的掩码质量对齐,并抑制高置信度但不准确的竞争者。我们进一步采用跨层自蒸馏(CLSD)将更强的中间层预测迁移到最终层。排序和蒸馏目标仅用于训练,而推理仍保持高效的最终层解码。在COCO、ADE20K和Cityscapes上的实验表明,在全景、实例和语义分割以及不同架构、骨干网络规模和输入分辨率上均取得了一致的改进。总体而言,iFAN平均提升了1.20 PQ、1.30 AP和0.63 mIoU,且额外参数、FLOPs和推理延迟可忽略不计。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:19

论文页面 - iFAN:面向朴素掩码 Transformer 的推理感知学习

来源:https://huggingface.co/papers/2608.03216 发布于 8月7日

·

Lucas (https://huggingface.co/xxlucas) 于 8月12日 提交

摘要

一种名为 iFAN 的训练框架通过将查询排名与掩码质量对齐,并将更强的中间层预测蒸馏到最终层,从而改进掩码 Transformer。

基于查询的掩码 Transformer (https://huggingface.co/papers?q=Query-based%20mask%20transformers) 通过最终层查询预测之间的像素级竞争 (https://huggingface.co/papers?q=pixel-wise%20competition) 来组装分割输出,然而这一推理过程在训练期间并未被显式优化。我们发现了两个关键的不匹配:具有最高概率掩码分数的查询不一定产生最准确的掩码,并且最终层解码可能会丢弃来自中间层的更优预测。为了解决这些问题,我们提出了推理感知学习 (https://huggingface.co/papers?q=Inference-Aware%20Learning) (iFAN),这是一个面向朴素掩码 Transformer 的通用训练框架。iFAN 引入了调整后的概率掩码排名 (https://huggingface.co/papers?q=Adjusted%20Probability-Mask%20Ranking) (APMR),它将查询竞争与预测的掩码质量对齐,并抑制高置信度但不准确的竞争者。我们进一步采用跨层自蒸馏 (https://huggingface.co/papers?q=Cross-Layer%20Self-Distillation) (CLSD) 将更强的中间层预测迁移到最终层。排名和蒸馏目标仅用于训练,而推理则保留高效的最终层解码。在 COCO、ADE20K 和 Cityscapes 上的实验表明,在全景分割、实例分割和语义分割 (https://huggingface.co/papers?q=semantic%20segmentation) 以及不同架构、骨干网络规模和输入分辨率下均取得了一致的改进。总体而言,iFAN 平均提升了 1.20 PQ、1.30 AP 和 0.63 mIoU,同时仅增加了可忽略不计的参数、FLOPs 和推理延迟。

查看 arXiv 页面 (https://arxiv.org/abs/2608.03216) 查看 PDF (https://arxiv.org/pdf/2608.03216) 项目页面 (https://neesky163.github.io/iFAN/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03216)

在你的 agent 中获取这篇论文:

hf papers read 2608\.03216

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.03216 以从此页面链接它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.03216 以从此页面链接它。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.03216 以从此页面链接它。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

Lite3R:一种高效的模型无关前馈3D重建框架

Hugging Face Daily Papers

Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。

X-LogSMask:面向图结构数据的扩展Transformer

arXiv cs.LG

X-LogSMask 提出了一种用于图Transformer的对数结构掩码,将图拓扑直接注入注意力logits中,在20个基准测试中的13个上实现了最先进的性能,同时保持了可解释性和多跳信息传播。