数据扰动下模型级联的准确性与鲁棒性

arXiv cs.AI 论文

摘要

本研究论文探讨数据扰动如何影响高效AI推理中模型级联的准确性和鲁棒性,识别关键失败模式,并强调在分布偏移下进行评估的必要性。

arXiv:2608.17711v1 公告类型:新 摘要:预测级联显著降低了人工智能(AI)模型的能耗,同时保持了高性能的预测能力。其核心思想是将简单输入路由到轻量级小模型,而将困难不确定的情况延迟到大模型处理。尽管这种设计可以在干净数据上提高计算效率,但其有效性依赖于基于置信度路由的可靠性。输入退化,如静态损坏和顺序扰动,可能会改变模型置信度和路由决策。在本文中,我们研究了基于置信度的级联框架用于图像分类,并探讨这些退化如何影响其基于置信度的延迟行为。我们选择了一个在准确性、路由质量和能耗方面达到帕累托最优的模型级联,该模型在竞争性预测性能下实现了CO$_2$排放量高达10倍的减少。我们研究了该模型级联在输入损坏下的行为,并分析了当输入分布偏移时级联路由决策的变化。我们的分析识别出了三种失败模式。静态损坏要么(1)破坏路由信号而大模型仍然有用,要么(2)使两个模型都退化,以至于延迟不再恢复准确性。顺序扰动揭示了第三种模式:预测变得稳定,但延迟被抑制,从而产生稳定但不可靠的预测。这些发现表明,高效节能的模型级联需要超越干净准确性的评估,并明确关注分布偏移下的路由可靠性。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:12

# 模型级联在数据扰动下的准确性与鲁棒性
来源:https://arxiv.org/html/2608.17711

###### 摘要

预测级联能够在保持高预测性能的同时显著降低人工智能(AI)模型的能耗。其核心思想是让简单的输入通过轻量级的小模型处理,而困难的不确定案例则交由更大的模型处理。虽然这种设计能在干净数据上提高计算效率,但其有效性取决于基于置信度的路由的可靠性。输入退化,如静态损坏和序列扰动,可能改变模型的置信度和路由决策。本文研究了用于图像分类的基于置信度的级联框架,并探讨了此类退化如何影响其基于置信度的延迟行为。我们选取了在准确性、路由质量和能耗帕累托最优的模型级联,该级联在实现有竞争力的预测性能的同时,可将二氧化碳排放量减少最多10倍。我们研究了该模型级联在输入损坏下的行为,并分析了当输入分布发生变化时级联的路由决策如何改变。我们的分析识别出三种故障模式:静态损坏要么(1)破坏了路由信号,而大模型仍然有用;要么(2)使两个模型性能都下降,以至于延迟操作无法恢复准确性。序列扰动则揭示了第三种模式:预测变得稳定,但延迟操作被抑制,产生稳定但不可靠的预测。这些发现表明,节能的模型级联需要超越干净准确性的评估,并特别关注分布偏移下的路由可靠性。

高效推理,基于置信度的延迟,损坏鲁棒性,分布偏移,级联模型

## 1 引言

AI模型的计算成本和能耗带来了重大的环境挑战\[10 (https://arxiv.org/html/2608.17711#bib.bib2), 9 (https://arxiv.org/html/2608.17711#bib.bib3)\]。随着模型规模的持续增长,降低推理成本已成为可持续AI部署的关键。在各种效率技术中——包括剪枝\[2 (https://arxiv.org/html/2608.17711#bib.bib4)\]、知识蒸馏\[4 (https://arxiv.org/html/2608.17711#bib.bib5)\]、量化\[5 (https://arxiv.org/html/2608.17711#bib.bib6)\]和早退架构\[11 (https://arxiv.org/html/2608.17711#bib.bib7)\]——预测级联通过自适应地将输入路由到不同复杂度的模型,提供了一种特别有前景的方法。其核心思想很直观:并非所有输入都需要相同的计算量。简单的样本可以由轻量级模型处理,而只有困难的案例才需要昂贵的大型模型。Gatekeeper框架\[8 (https://arxiv.org/html/2608.17711#bib.bib10)\]通过基于置信度的延迟机制实现了这一点:小模型\(MSM\_\{S\}\)首先尝试进行预测,对于不确定的情况则延迟到大模型\(MLM\_\{L\}\)处理。当小模型MSM\_\{S\}有信心时,级联节省计算资源;当不确定时,则投入大模型MLM\_\{L\}的能力。在干净数据上,这种设计实现了显著的效率提升。

然而,现实世界的部署很少完全符合干净的训练假设。例如,在计算机视觉应用中,图像可能遭受压缩伪影、传感器噪声、运动模糊或与天气相关的退化。即使是微小的扰动也可能改变模型的预测和置信度估计。虽然先前的研究已经探讨了级联在干净数据上的性能或考察了单个模型的鲁棒性,但级联路由决策与输入退化之间的相互作用仍未得到充分探索。

这对可持续AI至关重要:级联效率完全依赖于在分布偏移下可靠的基于置信度的路由。输入退化会引发对立的失败模式:过度延迟会增加计算成本;延迟不足则会牺牲准确性。因此,一个关键的实际问题仍然悬而未决:在何种程度的输入退化下,级联的效率优势会消失?我们能否识别出哪些损坏类型对路由可靠性的威胁最大?

准确描述这种相互作用对于评估生产环境中基于级联的推理的真实计算和环境成本至关重要。在这项工作中,我们研究了输入退化——包括静态损坏和数据扰动序列——如何影响模型级联中的基于置信度的延迟行为。我们的贡献包括:

- •我们量化了输入退化的严重程度、类型和时间结构如何影响模型级联,识别出哪些静态损坏组和序列扰动类型最强烈地破坏了跨数据集的准确性、路由可靠性和延迟质量。
- •我们将路由故障与后备模型退化分开,表明级联故障可能源于不可靠的基于置信度的路由,也可能源于大模型MLM\_\{L\}在严重损坏下的崩溃。
- •我们发现这些故障模式的相对重要性取决于问题的复杂性:在较低复杂度的场景中,路由校准成为瓶颈;而在较高复杂度的场景中,基础模型的鲁棒性占主导地位。

## 2 相关工作

在以下部分,我们回顾了模型级联以及专注于分布偏移的方法的最新研究。

### 2.1 预测级联与高效推理

预测级联通过按容量递增的序列处理模型来处理输入,当置信度足够时允许提前终止,从而降低计算成本。经典例子包括提升方法,如Viola-Jones人脸检测器\[12 (https://arxiv.org/html/2608.17711#bib.bib8)\],它使用一系列日益复杂的分类器来快速排除非人脸区域。现代方法将此概念扩展到深度学习,使用学习的路由策略\[13 (https://arxiv.org/html/2608.17711#bib.bib9), 11 (https://arxiv.org/html/2608.17711#bib.bib7)\]。在本研究中,我们选择了一种近期的模型级联方法,称为Gatekeeper\[8 (https://arxiv.org/html/2608.17711#bib.bib10)\],它使用小模型MSM\_\{S\}的置信度来路由每个输入xx。如果最大softmax置信度超过推理阈值τ\\tau,则接受MSM\_\{S\}的预测;否则,输入延迟到大模型MLM\_\{L\}处理:

y^=\{fMS\(x\),maxc⁡σ\(fMS\(x\)\)c≥τ,fML\(x\),otherwise\.\\hat\{y\}=\\begin\{cases\}f\_\{M\_\{S\}\}\(x\),&\\max\_\{c\}\\sigma\(f\_\{M\_\{S\}\}\(x\)\)\_\{c\}\\geq\\tau,\\\\ f\_\{M\_\{L\}\}\(x\),&\\text\{otherwise\}\.\\end\{cases\}\(1\)
这里,τ∈\[0,1\]\\tau\\in\[0,1\]控制推理时的接受–延迟决策。Gatekeeper使用正确性感知损失LGK=αLcorr\+\(1−α\)Lincorr\\mathcal\{L\}\_\{\\mathrm\{GK\}\}=\\alpha\\mathcal\{L\}\_\{\\mathrm\{corr\}\}\+\(1\-\\alpha\)\\mathcal\{L\}\_\{\\mathrm\{incorr\}\}微调MSM\_\{S\},其中α∈\[0,1\]\\alpha\\in\[0,1\]控制对正确和错误预测的强调程度,Lcorr\\mathcal\{L\}\_\{\\mathrm\{corr\}\}是在正确预测样本上的交叉熵,而Lincorr\\mathcal\{L\}\_\{\\mathrm\{incorr\}\}是在错误预测样本上到均匀分布的KL散度。

该框架使用两个关键指标来表征级联行为:级联准确性和延迟性能。级联准确性简单衡量模型级联的准确性:Acccasc=1N∑i=1N1\[y^i=yi\]\\mathrm\{Acc\}\_\{\\mathrm\{casc\}\}=\\frac\{1\}\{N\}\\sum\_\{i=1\}^\{N\}\\mathbb\{1\}\[\\hat\{y\}\_\{i\}=y\_\{i\}\]。延迟性能(sds\_\{d\})通过衡量实现与理想延迟曲线之间的归一化面积来量化路由有效性:

sd=∫01\(accreal\(r\)−accrand\(r\)\)dr∫01\(accideal\(r\)−accrand\(r\)\)drs\_\{d\}=\\frac\{\\int\_\{0\}^\{1\}\(\\mathrm\{acc\}\_\{\\mathrm\{real\}\}\(r\)\-\\mathrm\{acc\}\_\{\\mathrm\{rand\}\}\(r\)\)\\,dr\}\{\\int\_\{0\}^\{1\}\(\\mathrm\{acc\}\_\{\\mathrm\{ideal\}\}\(r\)\-\\mathrm\{acc\}\_\{\\mathrm\{rand\}\}\(r\)\)\\,dr\}\(2\)
更高的sds\_\{d\}表示延迟更有效。先前的级联研究主要集中在干净的、分布内的数据上。虽然在这些条件下效率提升已得到充分记录\[13 (https://arxiv.org/html/2608.17711#bib.bib9), 11 (https://arxiv.org/html/2608.17711#bib.bib7)\],但在分布偏移下基于置信度的路由的可靠性在很大程度上仍未被探索。具体来说,当输入被损坏或扰动时,模型级联(如Gatekeeper的训练损失)诱导的校准是否仍然有效,这是一个开放问题,我们的工作将予以解决。

### 2.2 分布偏移、校准与级联路由

输入数据的扰动会降低模型准确性和置信度校准\[3 (https://arxiv.org/html/2608.17711#bib.bib11), 7 (https://arxiv.org/html/2608.17711#bib.bib12)\]。Hendrycks和Dietterich\[3 (https://arxiv.org/html/2608.17711#bib.bib11)\]引入了标准化的静态损坏和序列扰动基准,以衡量对常见输入退化(如噪声、模糊、天气效应和数字伪影)的鲁棒性。这些基准表明,即使在中等严重程度下,深度神经网络在损坏输入上也可能遭受显著的性能下降。除了准确性,分布偏移还会影响不确定性估计:在干净数据上训练的模型在损坏输入下常常变得校准不佳\[7 (https://arxiv.org/html/2608.17711#bib.bib12)\],而事后校准方法可能无法可靠地转移到偏移分布上\[6 (https://arxiv.org/html/2608.17711#bib.bib13)\]。

虽然先前的研究广泛探讨了单个模型的鲁棒性和校准,但级联系统引入了一个额外的故障点:路由可靠性。在Gatekeeper级联中,置信度估计决定了样本是被小模型MSM\_\{S\}接受还是延迟到大模型MLM\_\{L\}处理。在分布偏移下,损坏的置信度信号即使仅凭模型准确性无法完全解释故障,也可能改变接受/延迟行为。可能会出现两种级联特有的故障模式:过度自信的接受,即MSM\_\{S\}接受了本应延迟的退化样本;以及不自信的延迟,即MSM\_\{S\}过度延迟,降低了级联的效率优势。我们的工作通过评估静态损坏和序列扰动如何不仅影响级联准确性,还影响延迟性能来填补这一空白。

## 3 实验设置

### 3.1 数据集

我们在两个互补的CIFAR基准\[3 (https://arxiv.org/html/2608.17711#bib.bib11)\]上评估鲁棒性,以测试不同的故障模式:静态损坏(CIFAR\-10\-C/100\-C)在固定严重程度级别应用单步损坏,测试级联对5个严重程度级别下19种损坏类型的鲁棒性,这些损坏类型分为噪声(高斯、散粒、脉冲)、模糊(散焦、玻璃、运动、缩放)、天气(雪、霜、雾、亮度)和数字(对比度、弹性、像素化、JPEG)。序列扰动(CIFAR\-10\-P/CIFAR\-100\-P)提供渐进的30帧退化序列,测试级联在序列渐进输入扰动序列(运动模糊、雪、缩放模糊、亮度、雾、高斯噪声)下的稳定性。每个损坏基准在每种损坏类型和严重程度级别下包含10,000张测试图像。

### 3.2 模型与训练

遵循Gatekeeper公式\[8 (https://arxiv.org/html/2608.17711#bib.bib10)\],对于CIFAR\-10/100,我们将MSM\_\{S\}实例化为自定义的SmallCNN,将MLM\_\{L\}实例化为ResNet\-18。两个模型都在干净数据上使用标准增强进行训练。MSM\_\{S\}使用Adam训练50个周期,学习率为10−310^\{\-3\},权重衰减为10−410^\{\-4\}。MLM\_\{L\}使用SGD训练200个周期,学习率为0\.10\.1,动量0\.90\.9,Nesterov加速,权重衰减5×10−45\\times 10^\{\-4\},以及余弦退火。然后我们保持MLM\_\{L\}固定,并使用Gatekeeper正确性感知损失微调MSM\_\{S\} 30个周期,使用Adam,学习率3×10−43\\times 10^\{\-4\},权重衰减10−410^\{\-4\},以及余弦退火。按照原始Gatekeeper设计\[8 (https://arxiv.org/html/2608.17711#bib.bib10)\],基于置信度的路由阈值τ\\tau固定为0\.7。为α∈\{0\.1,0\.3,0\.5,0\.7,0\.9\}\\alpha\\in\\\{0\.1,0\.3,0\.5,0\.7,0\.9\\\}分别微调了独立的Gatekeeper模型。

### 3.3 评估流程与指标

在干净CIFAR\-10/100数据上训练Gatekeeper级联后,我们在干净和损坏数据上对其进行评估。我们使用codecarbon库\[1 (https://arxiv.org/html/2608.17711#bib.bib1)\]估算能源消耗或CO2CO\_\{2\}排放。为了评估损坏下的性能,我们在推理时应用所有损坏,然后在基于置信度的路由决策之前进行处理。我们报告小模型MSM\_\{S\}、大模型MLM\_\{L\}和模型级联GKGK的准确性,以及延迟性能(sds\_\{d\})以诊断故障模式。此外,对于序列扰动的评估,我们报告级联准确性、延迟率和平均级联翻转率,定义为mFP\-Casc=1T−1∑t=2T1\[y^t≠y^t−1\]\\text\{mFP\-Casc\}=\\frac\{1\}\{T\-1\}\\sum\_\{t=2\}^\{T\}\\mathbb\{1\}\[\\hat\{y\}\_\{t\}\\neq\\hat\{y\}\_\{t\-1\}\],其中TT是序列长度,y^t\\hat\{y\}\_\{t\}是帧tt的级联预测。由于序列扰动呈现连续退化的帧,我们通过mFP\-Casc衡量预测稳定性。

对于分组结果,柱状图显示每个组内损坏或扰动类型的均值,误差条表示相应的标准差。这些误差条捕获了退化类型之间的变异性,而不是独立训练种子之间的变异性。

## 4 结果与分析

### 4.1 模型级联在干净数据上的性能

在表1 (https://arxiv.org/html/2608.17711#S4.T1)中,我们报告了Gatekeeper(GK)模型级联在CIFAR\-10和CIFAR\-100数据集上的干净数据性能,并在准确性、延迟性能sds\_\{d\}和能耗方面比较了级联与级联中使用的大或小模型的性能。我们观察到,对于CIFAR\-10,α=0\.9\\alpha=0\.9的最佳模型级联在准确性方面与大模型MLM\_\{L\}具有竞争力,而所需能源仅为60%。对于CIFAR\-100数据集,我们也观察到准确性略有下降,但模型级联的能耗降低了10倍。所有后续评估都在所有损坏条件下使用这个固定阈值。

表1:GK在CIFAR\-10/100上评估的干净数据准确性、延迟性能和估算的CO2排放。帕累托最优设置以粗体显示。注:sds\_\{d\}对于仅MLM\_\{L\}是未定义的,因为没有延迟。

### 4.2 模型级联在损坏数据上的性能

图1 (https://arxiv.org/html/2608.17711#S4.F1)中的结果表明,当数据被损坏时,小模型MSM\_\{S\}、大模型MLM\_\{L\}以及模型级联的准确性都会降低。随着损坏严重程度的增加,准确性水平下降。在CIFAR\-10\-C上,级联准确性从干净数据的0\.9220\.922下降到噪声下约0\.38\\approx 0\.38–0\.580\.58,而天气类相对保持稳健,保持在0\.750\.75–0\.900\.90左右。相比之下,CIFAR\-100\-C显示出更急剧的退化:级联准确性从干净数据的0\.7440\.744下降到严重程度1下噪声的约0\.460\.46,以及严重程度...

相似文章

AI正在实时退化

Reddit r/ArtificialInteligence

AI模型因使用递归生成的合成数据进行训练而不断退化,导致模型崩溃;多项研究强调了使用合成数据进行规模化训练的风险。

动态Ising模型中的分布外神经推断

arXiv cs.LG

本文研究了用于重构动态Ising模型相互作用图的分布外神经推断,发现基于Transformer和卷积的模型展现出依赖于架构的统计先验,这些先验可能导致误导性的分布外鲁棒性。