FragileFlow:通过频谱控制正确但脆弱的预测以增强基础模型的鲁棒性

arXiv cs.CL 论文

摘要

本文介绍了 FragileFlow,这是一种插件式正则化器,通过频谱分析和 PAC-Bayes 界来控制“正确但脆弱”的预测,从而提高 LLM 和 VLM 的鲁棒性。

arXiv:2605.08896v1 公告类型:新文章 摘要:LLM 和 VLM 的鲁棒适应通常通过扰动下的平均准确率或平均一致性进行评估。然而,这些平均值可能掩盖了一种结构化的故障模式:预测可能保持正确,而概率质量已经从特定的真实类别流向决策边界附近的系统性错误竞争对手。在本文中,我们将这种现象形式化为感知边界的误差流,并引入了 FragileFlow,这是一种插件式正则化器,它使用校准的边界缓冲区来识别正确但脆弱的预测,并将它们的类外概率质量组织成按类划分的脆弱风险矩阵。在理论上,我们为这种感知边界的误差流对象提供了第一个 PAC-Bayes 上界,展示了经验频谱控制如何在稳定性条件下为确定性最坏类别鲁棒性提供一条保守的路径。在多项选择题 LLM 基准和少样本 CLIP 适应上的实验表明,FragileFlow 与匹配的基线相比,持续提高了所提出的面向理论的风险度量,在大多数设置中获得了扰动下的最坏类别准确率增益,并在比较中保留了干净准确率。
查看原文
查看缓存全文

缓存时间: 2026/05/12 07:06

# FragileFlow:基础模型鲁棒性的正确但脆弱预测的光谱控制

来源: https://arxiv.org/html/2605.08896
Zhuoyun Li, Boxuan Wang, Jinwei Hu, Xiaowei Huang, Yi Dong
英国利物浦大学计算机科学与信息学院

###### 摘要

大语言模型(LLM)和视觉语言模型(VLM)的鲁棒适配通常通过扰动下的平均准确率或平均一致性来评估。然而,这些平均值可能掩盖了一种结构化的失败模式:预测可能保持正确,但概率质量已经从特定的真实类别流向决策边界附近的系统性错误竞争者。在本文中,我们将这种现象形式化为**感知边距的错误流**(margin-aware error flow),并引入 **FragileFlow**,这是一种插件式正则化器,它使用校准的边距缓冲区来识别“正确但脆弱”的预测,并将其非类别的概率质量组织成按类别划分的脆弱风险矩阵。从理论上讲,我们为这种感知边距的错误流对象提供了第一个 PAC-Bayes 上界,展示了在稳定性条件下,经验光谱控制如何为确定性的最坏类别鲁棒性提供一条保守的路径。在多项选择 LLM 基准测试和少样本 CLIP 适配上的实验表明,FragileFlow 持续提高了所提出的面向理论的风险度量指标,在大多数设置中产生了扰动下的最坏类别准确率增益,并在所有比较中保持了干净数据的准确率。

## 1 引言

基础模型已经从简单的文本生成器演变为高风险决策的核心组件 [Bommasani et al. (2021)](https://arxiv.org/html/2605.08896#bib.bib43); [Brown et al. (2020)](https://arxiv.org/html/2605.08896#bib.bib44); [Radford et al. (2021)](https://arxiv.org/html/2605.08896#bib.bib36); [Hu et al. (2026a)](https://arxiv.org/html/2605.08896#bib.bib3)。在这些实际应用中,鲁棒性是一个重要的要求,因为轻微的视觉干扰或细微的语言扰动都容易改变关键的推荐 [Wang et al. (2021)](https://arxiv.org/html/2605.08896#bib.bib46); [Zhu et al. (2024)](https://arxiv.org/html/2605.08896#bib.bib47); [Mao et al. (2023)](https://arxiv.org/html/2605.08896#bib.bib48); [Hu et al. (2026b)](https://arxiv.org/html/2605.08896#bib.bib70); [Schlarmann et al. (2024)](https://arxiv.org/html/2605.08896#bib.bib49)。因此,可靠的模型不仅需要在干净输入上表现良好,还需要在各种扰动下保持稳定。

现有的鲁棒适配方法在这一目标上取得了重要进展。对抗训练使模型暴露于困难扰动中,而正则化微调方法鼓励干净输入和扰动输入之间的局部平滑性或一致性 [Goodfellow et al. (2015)](https://arxiv.org/html/2605.08896#bib.bib50); [Aghajanyan et al. (2021)](https://arxiv.org/html/2605.08896#bib.bib35); [Madry et al. (2018)](https://arxiv.org/html/2605.08896#bib.bib6); [Zhang et al. (2019)](https://arxiv.org/html/2605.08896#bib.bib7); [Jiang et al. (2020)](https://arxiv.org/html/2605.08896#bib.bib8); [Wu et al. (2020)](https://arxiv.org/html/2605.08896#bib.bib53)。在 LLM 中,这通常通过基于对抗、KL 散度、噪声或信任区域的正则化来实现 [Zhu et al. (2020)](https://arxiv.org/html/2605.08896#bib.bib54); [Jiang et al. (2020)](https://arxiv.org/html/2605.08896#bib.bib8); [Aghajanyan et al. (2021)](https://arxiv.org/html/2605.08896#bib.bib35);在 VLM 中,鲁棒性通常通过扰动视觉输入、调整提示或适配轻量级组件来提高 [Mao et al. (2023)](https://arxiv.org/html/2605.08896#bib.bib48); [Zhang et al. (2024)](https://arxiv.org/html/2605.08896#bib.bib55); [Schlarmann et al. (2024)](https://arxiv.org/html/2605.08896#bib.bib49); [Wang et al. (2025)](https://arxiv.org/html/2605.08896#bib.bib56)。

然而,差距仍然存在。首先,大多数目标仍然优化平均意义上的鲁棒性:它们询问准确率、损失或一致性是否在平均上得到改善,但它们并不追踪在最终预测失败之前,概率质量如何在错误选项之间移动 [Xue et al. (2021)](https://arxiv.org/html/2605.08896#bib.bib15); [Bendel et al. (2021)](https://arxiv.org/html/2605.08896#bib.bib58); [Tian et al. (2021)](https://arxiv.org/html/2605.08896#bib.bib42); [Li and Liu (2023)](https://arxiv.org/html/2605.08896#bib.bib60)。这忽略了一种脆弱状态,即预测选项仍然正确,但扰动已经将大量概率推向系统性的错误竞争者。其次,许多实际的鲁棒适配方法主要依靠经验改进来支持,而其目标并未与旨在减少的特定脆弱行为的一般化界限联系起来 [Neyshabur et al. (2018)](https://arxiv.org/html/2605.08896#bib.bib22); [Lotfi et al. (2022)](https://arxiv.org/html/2605.08896#bib.bib62); [Hu et al. (2025)](https://arxiv.org/html/2605.08896#bib.bib69); [Jin et al. (2025)](https://arxiv.org/html/2605.08896#bib.bib66)。结果,模型在标准聚合指标下可能看起来稳定,但隐藏着结构化的脆弱性。

为了解决这一经验和理论上的差距,我们通过有限选项的 LLM 和 VLM 任务研究了这种“正确但脆弱”的状态。这种设置提供了一个受控的接口:模型对候选选项的分布是直接可观察的,每个错误选项都有清晰的语义含义。我们不仅仅询问最终答案是否翻转,还询问非类别概率去了哪里,哪些真实选项最脆弱,以及由此产生的误差模式是分散的还是结构化的。

基于这一观察,我们引入了 **FragileFlow**,这是一种用于鲁棒适配的轻量级插件正则化器。FragileFlow 在扰动下构建了一个感知边距的错误流矩阵。边距缓冲区关注那些已经被错误分类或仍然正确但靠近决策边界的样本,而光谱惩罚则抑制从真实选项向重复出现的错误竞争者的相干概率流动。通过这种方式,FragileFlow 针对的是平均鲁棒性目标容易错过的失败模式。

至关重要的是,我们提供了现有经验方法所缺乏的理论基础。虽然 PAC-Bayes 分析已用于标准泛化并开始扩展到现代神经网络和语言模型 [Jin et al. (2025)](https://arxiv.org/html/2605.08896#bib.bib66); [Nagarajan and Kolter (2019)](https://arxiv.org/html/2605.08896#bib.bib64),但我们建立了(据我们所知)第一个专为感知边距错误流量身定制的 PAC-Bayes 光谱控制框架。我们的界限严格地将经验光谱错误流项与总体的脆弱最坏类别风险联系起来。在所述的 logit 稳定性条件下,这表明 FragileFlow 不仅仅是一个启发式附加组件,而是在测试时与确定性的最坏类别鲁棒性在数学上保持一致,直接弥合了经验适配和可证明泛化之间的差距。

我们的主要贡献有三方面:

- 我们将鲁棒适配中的“正确但脆弱”失败模式形式化,展示了模型如何在最终预测失败之前,静默地将概率质量泄漏到决策边界附近的系统性错误竞争者。
- 我们引入了 **FragileFlow**,这是一种感知边距的光谱插件正则化器,它可以抑制结构化的脆弱概率流动,并可以附加到现有的适配目标中。
- 我们通过为这种错误流对象建立第一个 PAC-Bayes 光谱控制路径,弥合了鲁棒适配中的理论差距。我们进一步展示了其与确定性最坏类别风险的联系,并在 LLM 和 VLM 环境中验证了其有效性。

## 2 方法论

### 2.1 预测和扰动公式

我们现在按照图 1 [https://arxiv.org/html/2605.08896#S2.F1](https://arxiv.org/html/2605.08896#S2.F1) 所示的顺序开发 FragileFlow。首先,我们为有限选项预测和扰动设置符号。每个输入都被分配来自固定的一组 $K$ 个候选选项中的一个标签。我们首先定义预测接口和固定适配模型 $\theta$ 的扰动符号。随机化适配参数将在第 2.3 节 [https://arxiv.org/html/2605.08896#S2.SS3](https://arxiv.org/html/2605.08896#S2.SS3) 中引入。

###### 定义 2.1(有限选项预测)

令 $\mathcal{D}$ 为输入-标签对 $(x, y)$ 上的分布,其中 $y \in \{1, \dots, K\} := [K]$。令 $S = \{(x_r, y_r)\}_{r=1}^m$ 为从 $\mathcal{D}$ 中抽取的有限样本。对于模型 $\theta$,每个输入 $x$ 诱导一个评分向量 $s_\theta(x) \in \mathbb{R}^K$,其中 $s_\theta(x, k)$ 是分配给选项 $k$ 的评分。诱导的选项分布为:

$$ p_\theta(k \mid x) := \frac{\exp(s_\theta(x, k))}{\sum_{k'=1}^K \exp(s_\theta(x, k'))} $$

用于评估的确定性预测器为:

$$ \hat{y}^{\mathrm{det}}_\theta(x) := \arg\max_{k \in [K]} s_\theta(x, k) $$

###### 定义 2.2(选项边距)

对于样本 $(x, y)$,选项边距为:

$$ \Delta_\theta(x, y) := s_\theta(x, y) - \max_{k \neq y} s_\theta(x, k) $$

正边距意味着正确选项被确定性预测器选中。负边距意味着预测器选择了错误选项。小的正边距意味着预测仍然正确,但错误选项即将超越真实选项。

###### 定义 2.3(扰动分布和样本)

对于每个输入 $x$,令 $\mathcal{U}(x)$ 为允许的扰动集。扰动规则 $\Pi(\cdot \mid x, y)$ 支撑于 $\mathcal{U}(x)$,可以表示随机或对抗性选择的扰动。扰动分布 $\mathcal{D}'$ 是通过从 $\mathcal{D}$ 中抽取 $(x, y) \sim \mathcal{D}$ 然后从 $\Pi(\cdot \mid x, y)$ 中抽取 $x' \sim \Pi(\cdot \mid x, y)$ 诱导的。给定有限样本 $S$,对应的扰动样本为 $S' := \{(x'_r, y_r)\}_{r=1}^m, \quad x'_r \sim \Pi(\cdot \mid x_r, y_r)$。

[图 1 说明] 图 1:FragileFlow 概述。该图总结了从有限选项预测到感知边距错误流、PAC-Bayes 控制、确定性稳定性以及最终插件目标的工作流程。部分标签指示了每个组件的定义位置。

### 2.2 感知边距的错误流

扰动可以改变的不仅仅是最终预测的选项。它们还可以改变模型在错误选项之间分配概率的方式。我们首先用错误流矩阵记录这种非选项分配。

###### 定义 2.4(无门控错误流矩阵)

对于固定模型 $\theta$,$\mathcal{D}'$ 下的总体无门控错误流矩阵为:

$$ (M_\theta^{\mathcal{D}'})_{ij} := \mathbb{E}_{(x', y) \sim \mathcal{D}'} [p_\theta(i \mid x') \mid y=j], \quad i \neq j, \qquad (M_\theta^{\mathcal{D}'})_{jj} := 0. \quad (1) $$

行索引接收选项 $i$,列索引真实选项 $j$。零对角线去除了分配给正确选项的概率质量。这个矩阵告诉我们错误选项的概率去向,但没有告诉我们这种概率有多危险。当真实选项遥遥领先时,错误选项接收额外概率并不那么令人担忧。当真实选项仅略微领先时,这种情况更令人担忧,因为微小的额外偏移就可能翻转预测。

###### 定义 2.5(边距门控)

给定安全缓冲区 $\gamma \geq 0$ 和温度 $\kappa > 0$,平滑边距门控为:

$$ g_{\gamma, \kappa}^\theta(x', j) := \sigma\left(\frac{\gamma - \Delta_\theta(x', j)}{\kappa}\right) \in (0, 1), \quad (2) $$

其中 $\sigma(\cdot)$ 是 logistic sigmoid 函数。这个门控是 $\mathbf{1}\{\Delta_\theta(x', j) \leq \gamma\}$ 的可微版本。当扰动样本已经被错误分类或位于安全缓冲区内部时,它较大;当真实选项具有明显边距时,它较小。直观地说,$\gamma$ 在决策边界周围绘制了一个带。这个带内的样本并非全部错误,但它们很容易翻转。因此,我们用这个边距门控对式 (1) [https://arxiv.org/html/2605.08896#S2.E1](https://arxiv.org/html/2605.08896#S2.E1) 中的非选项概率进行加权。

###### 定义 2.6(感知边距的错误流矩阵)

感知边距的总体错误流矩阵为:

$$ (M_\theta^{\mathcal{D}', \gamma})_{ij} := \mathbb{E}_{(x', y) \sim \mathcal{D}'} [g_{\gamma, \kappa}^\theta(x', j) p_\theta(i \mid x') \mid y=j], \quad i \neq j, \qquad (M_\theta^{\mathcal{D}', \gamma})_{jj} := 0. \quad (3) $$

较大的 $\gamma$ 值包括更宽的安全带,因此矩阵变得更加保守。我们量化这种现象的风险:

###### 定义 2.7(脆弱风险)

对于固定模型 $\theta$,脆弱最坏选项风险为:

$$ \mathrm{VWR}_\gamma(\theta; \mathcal{D}') := \|M_\theta^{\mathcal{D}', \gamma}\|_1 $$

脆弱光谱风险为:

$$ \mathrm{VSR}_\gamma(\theta; \mathcal{D}') := \|M_\theta^{\mathcal{D}', \gamma}\|_2 $$

这里 $\|\cdot\|_1$ 表示诱导矩阵 1-范数,即最大列和,$\|\cdot\|_2$ 表示光谱范数。第一个量询问哪个真实选项向错误选项泄漏了最多的脆弱概率质量。第二个量询问这种泄漏是否是结构化的而不是分散的。例如,几个真实选项可能漂移到同一个错误选项,或者一组选项可能变得相互混淆。标准范数转换给出 $\mathrm{VWR}_\gamma(\theta; \mathcal{D}') \leq \sqrt{K} \, \mathrm{VSR}_\gamma(\theta; \mathcal{D}')$(见附录 A.2 [https://arxiv.org/html/2605.08896#A1.SS2](https://arxiv.org/html/2605.08896#A1.SS2))。因此,控制光谱风险提供了一种保守的方法来减少最坏选项的脆弱读取,同时惩罚相干的错误流模式。

### 2.3 具有随机化适配的 PAC-Bayes 光谱控制

前面的定义描述了扰动总体 $\mathcal{D}'$ 上的脆弱错误流对象。在实践中,我们只观察到有限的扰动样本 $S'$。为了泛化,我们需要将 $S'$ 上的经验矩阵与 $\mathcal{D}'$ 上的总体风险联系起来。我们使用 PAC-Bayes 分析,因为它提供了一种直接的方法来分离观察到的经验项和适配模型的复杂度。

###### 定义 2.8(随机化适配)

令 $w \in \mathbb{R}^{d_{\mathrm{train}}}$ 表示可训练的适配坐标,并写为 $\theta(w) := \mathcal{T}(\theta_0, w)$,其中 $\theta_0$ 是固定的,$\mathcal{T}$ 指定了如何将 $w$ 插入预测器。令 $P$ 为在观察样本之前选择的 $w$ 的先验分布,令 $Q

相似文章

CRMA: 一种用于LLM模块化持续微调的谱界主干

arXiv cs.LG

CRMA引入了一种谱界残差适配器,通过Sinkhorn归一化强制实现双随机混合矩阵,使LLM能够持续微调而不发生灾难性遗忘。在Mistral-7B和Gemma-2-9B上的实验结果表明,与冻结基底的基线相比,后向迁移得到改善,遗忘减少。

基于条件归一化流的不确定性感知多保真度闭合模型

arXiv cs.LG

本文提出了一种基于条件归一化流的不确定性感知多保真度框架,用于改进复杂多尺度系统的降阶模型(ROM)的预测准确性。该方法学习从低保真度到高保真度系数的概率映射,并在涡旋合并问题上进行了验证,展示了改进的准确性和不确定性量化。

PPDL:基于LLM的流程作为概率程序

arXiv cs.LG

本文介绍了PPDL,一种用于编程基于LLM的流程的概率语言,使开发者能够在整个应用中量化和传播不确定性,并提供了关于定理证明的实验和案例研究。