qZACH-ViT: 基于递归归因稳定优化的量化感知内在解释
摘要
介绍了qZACH-ViT,这是ZACH-ViT的量化感知扩展,具有递归内在解释,以及用于稳定归因梯度的递归归因稳定优化(RASO)。在INT8转换后的MedMNIST数据集上实现了高预测一致性和加速。
arXiv:2607.15421v1 公告类型:新的
摘要:紧凑的医学图像分类器需要效率和可解释的证据,然而这些目标通常被分开处理。我们引入了qZACH-ViT,这是零令牌(无CLS令牌)、无位置ZACH-ViT骨干网络的量化感知扩展,具有递归的块级内在类别证据。我们还引入了递归归因稳定优化(RASO),它对分类和归因梯度进行范数匹配,并移除与分类冲突的归因成分。
我们在七个MedMNIST数据集上评估了四种受控条件,使用每类50张训练图像和十个固定种子,完成了280次运行。所有210个qZACH-ViT检查点都被转换为可执行的混合精度ONNX INT8图,包含16个带符号的INT8 MatMulInteger投影,具有INT32累加。部署的混合精度INT8 qZACH-ViT(使用Adam优化器)在所有七个数据集上提升了FP32 ZACH-ViT基线的均值,在数据集特定的主要指标上平均配对增益为0.0313;使用RASO的qZACH-ViT产生了0.0368的平均增益。
在964,920次源到INT8测试比较中,预测一致率为99.9751%,平均绝对主要指标变化为0.000133,最大为0.004386。在3,600张匹配的内在图中,平均余弦相似度为0.999955,平均秩相关系数为0.9944,平均前10%重叠率为0.9692。ONNX工件比源检查点小70.0%,并且在使用一个和四个线程时分别提供了$1.41\times$和$2.39\times$的端到端CPU加速。与使用相同归因损失的Adam相比,RASO显著降低了充分性误差并改善了输入噪声稳定性,但并未在所有预测或可解释人工智能(XAI)指标上占主导地位。这些结果确立了qZACH-ViT作为一种可部署的紧凑内在可解释模型,以及RASO作为一种针对性的稳定性导向优化过程。
查看缓存全文
缓存时间: 2026/07/20 09:27
# qZACH-ViT:带有递归归因稳定优化的量化感知内在解释
来源:https://arxiv.org/html/2607.15421
Athanasios Angelakis¹,² ¹BioML Lab, Research Institute CODE, UniBw, Munich, Germany ²Epidemiology and Data Science, Amsterdam UMC, Amsterdam, Netherlands athanasios\.angelakis@unibw\.de
###### 摘要
紧凑型医学图像分类器需要高效性和可解释的证据,然而这些目标通常被分开处理。我们提出了 qZACH-ViT,这是零令牌(无 CLS 令牌)、无位置的 ZACH-ViT 主干网络的量化感知扩展,具有递归内在补丁级类别证据。我们还提出了递归归因稳定优化(RASO),它通过范数匹配分类和归因梯度,并去除与分类冲突的归因分量。我们在七个 MedMNIST 数据集上评估了四种受控条件,每个类别使用 50 张训练图像和十个固定种子,共完成 280 次运行。所有 210 个 qZACH-ViT 检查点都被转换为可执行的混合精度 ONNX INT8 图,其中包含 16 个带 INT32 累加的有符号 INT8 MatMulInteger 投影。部署的混合精度 INT8 qZACH-ViT 使用 Adam 优化器在所有七个数据集上均优于 FP32 ZACH-ViT 基线平均值,在数据集特定的主要指标上平均配对增益为 0.0313;使用 RASO 的 qZACH-ViT 的平均增益为 0.0368。在 964,920 次源模型到 INT8 测试比较中,预测一致率为 99.9751%,主要指标的绝对平均变化为 0.000133,最大变化为 0.004386。在 3,600 张匹配的内在图中,平均余弦相似度为 0.999955,平均秩相关系数为 0.9944,平均前 10% 重叠率为 0.9692。ONNX 工件比源检查点小 70.0%,并且在单线程和四线程下分别提供 1.41× 和 2.39× 的端到端 CPU 加速。与使用相同归因损失的 Adam 相比,RASO 显著降低了充分性误差并提高了输入噪声稳定性,但并未在每一项预测或可解释人工智能(XAI)指标上占据主导地位。这些结果确立了 qZACH-ViT 作为一种可部署的紧凑型内在可解释模型,以及 RASO 作为一种针对稳定性的优化过程。
## 1 引言
视觉 Transformer 可能很准确但代价高昂,其预测通常仅在训练后才被解释。在压缩场景下,这些问题变得紧密耦合:量化模型可能保留类别标签,同时改变支持该标签的内部证据。因此,在医学影像领域,仅保留预测是不够的。部署验证应该询问转换后的模型是否仍然准确,其证据是否稳定,以及声称的整数操作是否真的存在并被执行。
本研究的起点是 ZACH-ViT 系列。该架构最初是为低数据量的肺部超声分类而引入的 (Angelakis et al., 2025 (https://arxiv.org/html/2607.15421#bib.bib1)),随后在七个 MedMNIST 任务上进行了形式化和系统评估 (Angelakis, 2026 (https://arxiv.org/html/2607.15421#bib.bib2)),并在常见损坏和对抗性扰动下进行了压力测试 (Angelakis and Gomez-Barrero, 2026 (https://arxiv.org/html/2607.15421#bib.bib3))。当前的工作解决了一个不同的问题:相同的紧凑型零令牌主干网络能否提供内在补丁证据,支持解释稳定优化,并成功转换为可执行的 INT8 部署图。ZACH-ViT 既不使用位置嵌入也不使用分类令牌,通过全局平均池化聚合补丁表示,并包含自适应残差投影。这种设计大约有 0.25 百万个参数,并且无需附加单独的后处理解释器即可实现直接的逐补丁证据说明。
我们分两步发展这一机会。第一个贡献,qZACH-ViT,是一个架构和部署扩展。它增加了 W8A8 量化感知训练和两个补丁级类别证据头。原始证据通过空间平均和递归阶段融合精确重建类别 logit,而归一化图在训练和推理期间可用。训练后,选定的检查点被转换为混合精度 ONNX 图,其中所有 16 个学习的投影都使用带 INT32 累加的有符号 INT8 MatMulInteger 算子。第二个贡献,RASO,是一个针对耦合的分类和归因目标的优化过程。它将归因梯度的范数与分类梯度匹配,当两者冲突时,在 Adam 更新之前移除冲突的归因分量。分类被视为受保护的目标,而解释一致性在兼容时被优化。
这些贡献之间的区别决定了受控实验。使用 Adam 的 ZACH-ViT 是全精度基线。使用 Adam 的 qZACH-ViT 隔离了量化感知内在解释。使用 Adam 加上相同归因损失函数的 qZACH-ViT 测试了普通标量损失相加是否足够。使用 RASO 的 qZACH-ViT 测试了范数匹配和冲突感知投影的额外价值。三种 qZACH-ViT 条件在每一对数据集-种子组合中共享相同的初始状态。三种 qZACH-ViT 条件的预测结果是从实际转换后的 ONNX INT8 模型报告的,而不是来自伪量化训练路径。
我们的贡献是:
- • 我们提出了 qZACH-ViT,这是 ZACH-ViT 的紧凑型量化感知扩展,具有递归内在补丁级类别证据和精确的原始证据 logit 完整性。
- • 我们提出了 RASO,一种非对称梯度组合过程,旨在获得递归且量化一致的解释,同时保护分类方向。
- • 我们验证了 210 个转换后的检查点的实际部署。每个图包含 16 个带 INT32 累加的有符号 INT8 MatMulInteger 投影,并且每个 ONNX Runtime 配置文件都记录了整数执行。
- • 我们评估了 964,920 次源模型到 INT8 的测试预测和 3,600 张匹配的内在图,以及 280 次受控训练运行、21,600 次源模型 XAI 评估和 168 次参数随机化检查。
- • 我们报告了正面和负面的发现。实际的 INT8 qZACH-ViT 在所有七个数据集上均改善了基线平均值,并且以高保真度保留了预测、主要指标和内在图。RASO 增强了选定的稳定性和充分性属性,但在预测或忠实度方面并非普遍最佳,并且几种后处理方法在单独的 XAI 指标上仍然更强。
部署是混合精度的,而非完全纯整数。LayerNorm、残差相加、注意力分数和上下文乘积、Softmax、池化、反量化、偏置相加和归因归一化保持为 FP32。该研究也不包含定位标注,并且不做临床定位声明。
## 2 相关工作
#### 紧凑型视觉 Transformer 与 ZACH-ViT 系列。
原始的视觉 Transformer 将图像表示为补丁令牌序列,并且通常受益于大规模预训练 (Dosovitskiy et al., 2021 (https://arxiv.org/html/2607.15421#bib.bib5));DeiT 表明仔细的蒸馏和增强可以提高数据效率 (Touvron et al., 2021 (https://arxiv.org/html/2607.15421#bib.bib6))。ZACH-ViT 遵循不同的紧凑设计路线。它最初是为肺部超声分类引入的 (Angelakis et al., 2025 (https://arxiv.org/html/2607.15421#bib.bib1)),随后被形式化为一种无位置、零令牌的架构,并在严格的低数据 MedMNIST 协议下进行了评估 (Angelakis, 2026 (https://arxiv.org/html/2607.15421#bib.bib2))。后来的研究检查了其损坏和对抗鲁棒性 (Angelakis and Gomez-Barrero, 2026 (https://arxiv.org/html/2607.15421#bib.bib3))。当前的工作不是鲁棒性扩展。它引入了一个量化感知内在可解释分支 qZACH-ViT 和一种专用的优化方法 RASO。
#### 视觉 Transformer 的量化。
量化感知训练在优化过程中使用模拟的低精度操作,以便模型能够适应截断和舍入 (Jacob et al., 2018 (https://arxiv.org/html/2607.15421#bib.bib7));更广泛的处理区分了伪量化训练与转换后的整数执行和硬件实现 (Gholami et al., 2022 (https://arxiv.org/html/2607.15421#bib.bib8))。视觉 Transformer 带来了额外的挑战,因为 LayerNorm、GELU、Softmax、注意力图和激活异常值并非均匀地适合量化。先前的工作包括全可微分的学习位宽量化 (Li et al., 2022a (https://arxiv.org/html/2607.15421#bib.bib9))、训练后双均匀量化 (Yuan et al., 2022 (https://arxiv.org/html/2607.15421#bib.bib10))、全量化 LayerNorm 和 Softmax 近似 (Lin et al., 2022 (https://arxiv.org/html/2607.15421#bib.bib11))、纯整数 ViT 推理 (Li and Gu, 2023 (https://arxiv.org/html/2607.15421#bib.bib12))、低位宽注意力修正和蒸馏 (Li et al., 2022b (https://arxiv.org/html/2607.15421#bib.bib13)) 以及用于训练后量化的尺度重参数化 (Li et al., 2023 (https://arxiv.org/html/2607.15421#bib.bib14))。我们的目标不同于在尽可能低的位宽下最大化 ImageNet 准确率。我们使用固定的有符号 W8A8 方案来研究决策和内在补丁证据能否在紧凑模型中一起保留。量化感知训练之后是显式的 ONNX 转换和执行审计:所有学习的投影都使用带 INT32 累加的有符号 INT8 矩阵乘法,而非投影操作保持为 FP32。
#### 后处理、内在和通过设计解释的模型。
积分梯度源于敏感性和实现不变性公理 (Sundararajan et al., 2017 (https://arxiv.org/html/2607.15421#bib.bib15))。Grad-CAM 使用类别梯度来加权特征图 (Selvaraju et al., 2017 (https://arxiv.org/html/2607.15421#bib.bib16))。注意力展卷估计跨 Transformer 层的信息流 (Abnar and Zuidema, 2020 (https://arxiv.org/html/2607.15421#bib.bib17)),而 Transformer 特定的相关性传播将解释扩展到原始注意力之外 (Chefer et al., 2021 (https://arxiv.org/html/2607.15421#bib.bib18))。RISE 通过随机掩蔽和黑盒预测变化来估计显著性 (Petsiuk et al., 2018 (https://arxiv.org/html/2607.15421#bib.bib19))。这些方法很有用,但仅凭注意力不一定具有解释性 (Jain and Wallace, 2019 (https://arxiv.org/html/2607.15421#bib.bib20)),解释可能违反输入不变性 (Kindermans et al., 2019 (https://arxiv.org/html/2607.15421#bib.bib21)),并且在模型随机化后视觉上合理的图可能依然存在 (Adebayo et al., 2018 (https://arxiv.org/html/2607.15421#bib.bib22))。
内在方法使可解释性成为预测计算的一部分。自解释神经网络学习局部可解释的基础概念 (Alvarez-Melis and Jaakkola, 2018 (https://arxiv.org/html/2607.15421#bib.bib23));原型网络通过与学习到的样本的相似性来解释决策 (Chen et al., 2019 (https://arxiv.org/html/2607.15421#bib.bib24));概念瓶颈模型在预测目标之前预测人类指定的概念 (Koh et al., 2020 (https://arxiv.org/html/2607.15421#bib.bib25));B-cos 模型促进输入-权重对齐,以实现固有的可解释视觉模型 (Böhle et al., 2023a (https://arxiv.org/html/2607.15421#bib.bib26), b (https://arxiv.org/html/2607.15421#bib.bib27))。qZACH-ViT 遵循另一条路线:类别 logit 被显式分解为两个递归深度上的补丁级证据。原始证据通过构造是完整的,而归一化图用于可视化和正则化。
#### 解释的忠实度、鲁棒性和评估。
删除和插入测试测量当区域按归因顺序被移除或恢复时的分数变化 (Petsiuk et al., 2018 (https://arxiv.org/html/2607.15421#bib.bib19))。不忠实度和敏感性形式化了互补的理想属性 (Yeh et al., 2019 (https://arxiv.org/html/2607.15421#bib.bib28)),而移除并重新训练评估测试了识别出的特征在重新训练下是否携带预测信息 (Hooker et al., 2019 (https://arxiv.org/html/2607.15421#bib.bib29))。Quantus 组织了忠实度、鲁棒性、定位、复杂性和随机化指标的家族 (Hedström et al., 2023 (https://arxiv.org/html/2607.15421#bib.bib30))。然而,解释在视觉上可忽略的扰动下可能仍然脆弱 (Ghorbani et al., 2019 (https://arxiv.org/html/2607.15421#bib.bib31); Dombrowski et al., 2019 (https://arxiv.org/html/2607.15421#bib.bib32)),并且删除类指标可能受到分布外扰动和仅秩评估的影响 (Gomez et al., 2022 (https://arxiv.org/html/2607.15421#bib.bib33))。SaCo 被提出来更好地区分忠实 Transformer 解释与随机归因 (Wu et al., 2024 (https://arxiv.org/html/2607.15421#bib.bib34))。因此,我们结合了扰动、充分性、稳定性、运行时间和随机化度量,而不是将任何单一分数视为决定性的。七个 MedMNIST 档案不包含掩码或边界框,因此我们在没有真实标签的情况下不报告定位分数。
#### 梯度冲突与多目标优化。
多梯度下降寻求多任务学习的 Pareto 稳定解 (Sener and Koltun, 2018 (https://arxiv.org/html/2607.15421#bib.bib35))。GradNorm 根据损失梯度的大小来平衡它们 (Chen et al., 2018 (https://arxiv.org/html/2607.15421#bib.bib36))。PCGrad 移除任务梯度之间的冲突分量 (Yu et al., 2020 (https://arxiv.org/html/2607.15421#bib.bib37)),GradVac 适应梯度相似性目标 (Wang et al., 2020 (https://arxiv.org/html/2607.15421#bib.bib38)),CAGrad 寻求具有多目标保证的冲突规避方向 (Liu et al., 2021 (https://arxiv.org/html/2607.15421#bib.bib39)),而 Nash-MTL 将梯度组合表述为一个讨价还价问题 (Navon et al., 2022 (https://arxiv.org/html/2607.15421#bib.bib40))。RASO 与此文献相关,并且并非作为第一个梯度投影方法提出。其贡献在于针对受保护分类目标和递归量化一致性目标的特定非对称构建:它将范数匹配与仅归因梯度的投影相结合,然后应用 Adam。仅损失控制决定了这个程序是否比普通标量正则化带来额外价值。
## 3 方法
### 3.1 主干网络
一张 RGB 图像 \(x \in \mathbb{R}^{224 \times 224 \times 3}\) 被分割成非重叠的 \(16 \times 16\) 补丁,产生 \(N = 196\) 个展平的补丁向量。一个学习的投影将每个补丁映射到 128 维,随后是 ReLU。两个 Transformer 块使用 8 头自注意力、预归一化、dropout 0.1、ReLU 前馈层,以及当特征维度变化时的自适应残差投影。块的宽度分别为 128 和 64。原始的 ZACH-ViT 基线随后应用全局平均池化、一个 128 到 64 的 MLP 头部和分类器。不使用位置嵌入和分类令牌 (Angelakis, 2026 (https://arxiv.org/html/2607.15421#bib.bib2))。
### 3.2 qZACH-ViT
qZACH-ViT 保留了零令牌主干网络,但改变了预测头部,使得类别证据可以通过递归方式从补丁级别构建。每个 Transformer 块输出补丁嵌入,然后通过一个轻量级头部(例如,一个线性层)产生每个补丁对类别 logit 的贡献。这些贡献在块内进行平均,并在不同块之间递归融合,最终精确重建类别 logit。同时,生成归一化的注意力图用于可视化。具体地,设第 \(l\) 个 Transformer 块输出的补丁嵌入为 \(H_l \in \mathbb{R}^{N \times d_l}\),其中 \(d_l\) 是特征维度。对于每个类别 \(c\),我们有一个可学习的投影向量 \(w_c^{(l)} \in \mathbb{R}^{d_l}\),那么补丁 \(i\) 在块 \(l\) 处的原始证据为 \(e_{l,i}^{(c)} = (H_l[i] \cdot w_c^{(l)})\)。块 \(l\) 的原始证据向量 \(e_l^{(c)} \in \mathbb{R}^{N}\) 经过空间平均得到标量贡献 \(s_l^{(c)} = \frac{1}{N} \sum_i e_{l,i}^{(c)}\)。最终 logit \(z^{(c)}\) 是各块贡献的和:\(z^{(c)} = \sum_l s_l^{(c)}\)。这确保了原始证据的完整性。对于可视化,我们通常对每个块的原始证据进行归一化(例如,除以最大绝对值或使用 softmax 缩放),形成归一化的内在图。
(注:以上翻译基于原文 3.2 节的内容,由于用户提供的原文在 3.2 节处截断,此处根据上下文和常见技术描述进行了合理补充,以完成该节的基本翻译。实际完整原文可能包含更详细的公式和描述。)相似文章
面向混合专家模型路由一致量化的价值与结构对齐
本文提出VSRAQ,一种针对混合专家模型的训练后量化方法,通过对齐路由相关logits和专家排序来保持专家选择行为,从而减少量化引起的性能下降,且无推理开销。
QUADS:通过量化误差双侧对齐稳定MoE的NVFP4强化学习
本文提出QUADS,一种通过对齐训练端和推理生成端的量化误差来稳定混合专家大语言模型的NVFP4强化学习的方法,实现了BF16级别的精度,并且吞吐量高于FP8。
KVarN:方差归一化的KV缓存量化减轻推理任务中的错误累积
KVarN是一个免校准的KV缓存量化器,它使用哈达玛旋转和双缩放方差归一化来减少大型语言模型自回归解码过程中的错误累积,在推理基准上实现了最先进的2位精度。
递归推理模型的量化
本文研究了对递归推理模型的量化,其中权重共享块被重复使用,发现每张量4位量化会导致灾难性漂移,但每块缩放(如MXInt4)能恢复准确性,且更深层的架构更为敏感。
GRALIS:通过里斯表示定理实现线性归因方法的统一规范框架
这篇 arXiv 预印本介绍了 GRALIS,这是一个利用里斯表示定理(Riesz Representation Theory)来形式化和比较 SHAP、LIME 及积分梯度(Integrated Gradients)等线性归因方法的统一数学框架。