扰动如何传播:大型语言模型鲁棒性的多层次分析

arXiv cs.CL 论文

摘要

本文对输入扰动如何通过仅解码器语言模型传播进行多层次分析,评估了通过输出行为、隐藏状态几何和注意力头功能在GPT-2和Qwen2.5等模型中的鲁棒性。

arXiv:2609.03322v1 公告类型:新 摘要:语言模型会遇到拼写错误、损坏的文本、改变的词语以及被打乱的词元顺序,但鲁棒性通常仅通过输出行为来评估。我们研究六种自然和合成输入扰动如何通过仅解码器语言模型在三个层次上传播:输出行为、隐藏状态几何和注意力头功能。我们通过使用中心化核对齐和内在维度分析逐层几何,在四个GPT-2和两个Qwen2.5检查点上评估行为影响,并在GPT-2中检查注意力头响应。扰动类型产生可区分的指标概况,这些概况未被输出度量完全捕捉,并且仅在测试检查点上部分一致。复制分数特别与词元替换和洗牌下的激活补丁恢复相关。梯度引导的HotFlip扰动在GPT-2中也比速率匹配的随机词元替换引起更强的行为和表征干扰;它们的行为影响在所有六个测试检查点上一致。我们的结果表明,基于单一行为或表征指标的鲁棒性声明可能具有误导性,并激发了多层次评估扰动如何改变语言模型计算的动机。
查看原文
查看缓存全文

缓存时间: 2026/09/04 05:57

# 扰动如何传播:大语言模型鲁棒性的多层次分析
来源:https://arxiv.org/html/2609.03322
Emily Liu††thanks:通讯作者:emily\.zf\.liu@gmail\.com单位:独立研究员
Niyathi Allu单位:独立研究员
Christian Hoang单位:FPT大学

###### 摘要

语言模型会遇到拼写错误、文本损坏、词语改变和标记顺序打乱的情况,但鲁棒性通常仅通过输出行为来评估。我们在三个层面研究六种自然和合成输入扰动如何在仅解码器语言模型中传播:输出行为、隐藏状态几何和注意力头功能。我们通过分析六个检查点(四个GPT-2和两个Qwen2.5)的逐层几何结构(使用中心核对齐和本征维数),并考察GPT-2中的注意力头响应,评估行为效应。扰动类型产生了可区分的指标特征,这些特征无法完全通过输出度量捕获,且在不同测试检查点间仅部分一致。复制得分特别与令牌替换和混洗下的激活补丁恢复相关。梯度引导的HotFlip扰动在GPT-2中也比速率匹配的随机令牌替换引起更强的行为和表示破坏;其行为效应在所有六个测试检查点中一致。我们的结果表明,基于单一行为或表示度量的鲁棒性声明可能具有误导性,并促使我们对扰动如何改变语言模型计算进行多层次评估。

## 1引言

语言模型通常在干净且格式良好的文本上进行评估,但实际部署的输入通常包含拼写错误或来自光学字符识别的字符损坏,这些会改变措辞并打乱标记顺序。先前工作表明,即使这些变化保留了文本对人类读者的大部分意义,也可能会显著降低语言模型的行为表现(Belinkov and Bisk, 2018 (https://arxiv.org/html/2609.03322#bib.bib1); Pruthi et al., 2019 (https://arxiv.org/html/2609.03322#bib.bib2))。对抗性攻击通过选择优化模型级目标的小输入编辑,更明确地揭示了这种脆弱性(Ebrahimi et al., 2018 (https://arxiv.org/html/2609.03322#bib.bib3); Wallace et al., 2019 (https://arxiv.org/html/2609.03322#bib.bib9); Jin et al., 2020 (https://arxiv.org/html/2609.03322#bib.bib10))。然而,仅输出退化并不能解释扰动如何改变模型内部执行的计算。

两种扰动可能在生成的文本上产生相似的变化,却破坏不同的表示或计算组件。相反,较小的输出变化可能掩盖隐藏状态几何的显著改变。因此,现有的鲁棒性评估提供的证据有限,无法说明扰动效应是否在不同损坏类型间共享、是否局部化到可识别的机制,或是否在不同模型规模和家族间泛化。

因此,我们通过多层次分析仅解码器语言模型中的扰动传播来解决这些问题。我们比较六种自然和合成扰动类型(字符替换、键盘拼写错误、随机令牌替换、令牌混洗、单词替换和同义词替换),使用WikiText-2输入。我们使用负对数似然和生成输出发散度衡量GPT-2(规模递增)和Qwen2.5模型的输出行为;使用CKA(Kornblith et al., 2019 (https://arxiv.org/html/2609.03322#bib.bib4))和本征维数偏移(Facco et al., 2017 (https://arxiv.org/html/2609.03322#bib.bib5); Aghajanyan et al., 2021 (https://arxiv.org/html/2609.03322#bib.bib6))衡量表示变化;使用注意力头功能得分和激活补丁(Olsson et al., 2022 (https://arxiv.org/html/2609.03322#bib.bib7); Wang et al., 2023 (https://arxiv.org/html/2609.03322#bib.bib16); Heimersheim and Nanda, 2024 (https://arxiv.org/html/2609.03322#bib.bib8))衡量组件级响应。此外,我们还比较梯度引导的HotFlip扰动与完全速率匹配的随机令牌替换。

我们的贡献是:
- • 我们提供了六种文本扰动类型的多层次实证分析,联合测量输出行为、表示几何和注意力头响应。
- • 我们测试扰动效应是否与功能上表征的注意力头相关,使用基于注意力的测量和激活补丁。
- • 我们评估扰动特征在GPT-2规模和Qwen2.5模型家族中的稳定性。
- • 我们比较对抗性和速率匹配的随机令牌替换,将对抗性优化效应与仅编辑速率分离开来。

## 2背景与相关工作

##### NLP中的输入扰动与对抗鲁棒性。
字符和单词级扰动,包括拼写错误和不完美文本提取引入的噪声,尽管对人类来说仍然易于理解,但会显著降低模型性能(Belinkov and Bisk, 2018 (https://arxiv.org/html/2609.03322#bib.bib1); Pruthi et al., 2019 (https://arxiv.org/html/2609.03322#bib.bib2))。相关文献构建了针对模型行为优化的对抗性扰动,包括梯度引导的令牌替换和通用触发器(Ebrahimi et al., 2018 (https://arxiv.org/html/2609.03322#bib.bib3); Wallace et al., 2019 (https://arxiv.org/html/2609.03322#bib.bib9); Jin et al., 2020 (https://arxiv.org/html/2609.03322#bib.bib10))。这些研究主要评估输出行为或任务性能。我们转而询问扰动类型是否留下可区分的*内部*特征,以及对抗性优化的扰动在内部是否与匹配位置和速率的自然扰动可区分。

##### 表示相似性度量。
中心核对齐(CKA)广泛用于比较神经网络表示(Kornblith et al., 2019 (https://arxiv.org/html/2609.03322#bib.bib4))。然而,CKA可能对异常值维度和不一定对应有意义功能差异的简单变换敏感(Davari et al., 2023 (https://arxiv.org/html/2609.03322#bib.bib11))。因此,我们使用CKA作为多种诊断工具之一,而不是将其解释为内部破坏的完整度量。

##### 学习表示的本征维数。
高维表示可能位于低维流形附近。最近邻估计器如TwoNN使用局部距离缩放来估计这种本征维数(Facco et al., 2017 (https://arxiv.org/html/2609.03322#bib.bib5))。最近的工作已将本征维数分析应用于语言模型,以研究微调、表示几何、真实性和训练动态(Aghajanyan et al., 2021 (https://arxiv.org/html/2609.03322#bib.bib6); Yin et al., 2024 (https://arxiv.org/html/2609.03322#bib.bib12); Razzhigaev et al., 2024 (https://arxiv.org/html/2609.03322#bib.bib13); Ruppik et al., 2025 (https://arxiv.org/html/2609.03322#bib.bib14))。我们将干净和扰动输入之间的本征维数*变化*作为扰动响应度量,扩展了这一研究方向。

##### 注意力头功能与机制可解释性。
机制可解释性研究已识别出反复出现的注意力头功能,包括支持序列继续的归纳头(Elhage et al., 2021 (https://arxiv.org/html/2609.03322#bib.bib15); Olsson et al., 2022 (https://arxiv.org/html/2609.03322#bib.bib7)),以及复制或名称移动头,其输出值电路在输出分布中提升被注意的令牌(Wang et al., 2023 (https://arxiv.org/html/2609.03322#bib.bib16))。这些功能通常在干净的、手工构建的任务上进行研究。我们测试头功能度量和扰动响应如何在自然发生和合成输入损坏之间关联。

##### 激活补丁方法论。
激活补丁是一种广泛使用的干预方法,用于测试内部激活是否有助于模型行为(Meng et al., 2022 (https://arxiv.org/html/2609.03322#bib.bib17); Heimersheim and Nanda, 2024 (https://arxiv.org/html/2609.03322#bib.bib8))。其结论取决于损坏过程、度量以及干净和损坏运行之间的一致性(Heimersheim and Nanda, 2024 (https://arxiv.org/html/2609.03322#bib.bib8))。因此,我们将补丁分析限制于重新标记后保持令牌数量不变的扰动,并将恢复解释为此实验设置内功能关联的证据。

## 3方法

### 3.1输入与扰动
我们使用WikiText-2原始数据集(Merity et al., 2017 (https://arxiv.org/html/2609.03322#bib.bib18))作为干净输入序列的来源。我们保留长度至少为128的序列,并使用固定种子随机抽取300个序列用于每个实验。这个固定的评估集在所有扰动类型和模型中使用。

我们评估Hugging Face检查点:openai-community/gpt2, gpt2-medium, gpt2-large, 和 gpt2-xl(Radford et al., 2019 (https://arxiv.org/html/2609.03322#bib.bib19)),以及 Qwen/Qwen2.5-0.5B 和 Qwen/Qwen2.5-1.5B(Yang et al., 2024 (https://arxiv.org/html/2609.03322#bib.bib20))。行为比较使用所有六个检查点;注意力头分析和完整对抗性表示比较使用GPT-2。

对于干净文本序列x,我们构建扰动序列x̃,扰动强度为p∈[0,1)。我们考虑六种扰动类型,涵盖字符、单词和令牌级的更改。

##### 字符扰动。
在均匀字符替换(char)下,每个字符以概率p独立替换为从数字、大小写字母和常用标点中均匀抽取的字符。在拼写错误噪声(typo)下,选定的字符被替换为QWERTY键盘上的相邻键,近似常见打字错误。

##### 单词和令牌替换。
在均匀令牌替换(token)下,每个令牌以概率p独立替换为从模型词汇表中均匀采样的令牌。在均匀单词替换(word)下,替换单元是空格分隔的单词,替换项从字母词汇令牌中采样。在同义词替换(synonym)下,使用WordNet中的同义词替换选定的单词(Miller, 1995 (https://arxiv.org/html/2609.03322#bib.bib21))。

##### 令牌混洗。
在令牌混洗(shuffle)下,我们选择一个包含大约pN个令牌的连续窗口(其中N是序列长度),并随机排列该窗口内的令牌。窗口外的令牌保持不变。此干预在破坏局部顺序和语法的同时保持令牌身份。

### 3.2行为、表示和头级测量

##### 输出度量。
我们使用负对数似然(NLL)和生成干净与扰动输出之间的归一化莱文斯坦距离来评估输出级效应,我们将其报告为输出发散度。定义在附录A.1中给出 (https://arxiv.org/html/2609.03322#A1.SS1)。

##### 表示度量。
我们使用中心核对齐(CKA)比较干净和扰动的隐藏状态(Kornblith et al., 2019 (https://arxiv.org/html/2609.03322#bib.bib4))。对于层l,令a和ã表示干净和扰动的激活矩阵,令H=I_n - (1/n)1_n1_n^T是中心化矩阵。令a_c = Ha,ã_c = Hã,我们计算:
CKA_l(a, ã) = ‖a_c^T ã_c‖_F^2 / (‖a_c^T a_c‖_F ‖ã_c^T ã_c‖_F)
我们评估层l∈{1,...,n_layer},排除第0层,因为它直接反映更改的输入嵌入。CKA需要形状相等的激活矩阵;因此我们过滤短于128的序列并将输入截断到长度128。令牌替换和混洗精确保持令牌数量,而字符、拼写错误、单词和同义词扰动可能改变标记化。对于后者扰动,截断恢复了相等的矩阵大小,但不恢复语义令牌对应。因此,它们的CKA值反映了重新标记和表示变化的综合影响,而不是严格的位置对齐比较。为了降低对高方差异常值维度的敏感性(Davari et al., 2023 (https://arxiv.org/html/2609.03322#bib.bib11)),我们在计算CKA之前,根据干净激活矩阵中方差对维度进行排序,并从干净和扰动矩阵中移除方差最高的五个维度。

我们另外使用两近邻(TwoNN)估计器测量逐层激活的本征维数(Facco et al., 2017 (https://arxiv.org/html/2609.03322#bib.bib5))。本征维数提供表示复杂性的局部度量:破坏规则结构的扰动可能改变激活流形的有效维度。我们报告干净和扰动激活之间本征维数的变化;估计器在附录A.2中定义 (https://arxiv.org/html/2609.03322#A1.SS2)。

##### 头功能得分。
为了表征注意力头的功能角色,我们计算四个头级得分。前一个令牌得分衡量对紧接前一个令牌的注意力;重复得分衡量对当前局部子序列早期出现的注意;归纳得分衡量从重复前缀到其早期出现后跟随的令牌的注意力。我们还基于头的OV电路计算复制得分(Wang et al., 2023 (https://arxiv.org/html/2609.03322#bib.bib16))。对于头h,具有值矩阵W_v^(h),输出投影W_o^(h),令牌嵌入矩阵E,和语言模型头U,我们定义:
C = E W_v^(h) W_o^(h) U, C ∈ R^{|V|×|V|}
令C_i表示C的第i行,复制得分是:
CopyingScore(h) = E_{i∈[V]} [1[i∈top_k-indices(C_i)]]
前一个令牌、重复和归纳得分的定义在附录A.3中给出 (https://arxiv.org/html/2609.03322#A1.SS3)。

##### 注意力头的扰动响应。
我们以两种方式检查功能性头类型如何响应扰动。首先,我们计算30%扰动下归一化注意力熵的变化,衡量头的注意力分布是变得更分散还是更集中。熵的定义在附录A.4中给出 (https://arxiv.org/html/2609.03322#A1.SS4)。

其次,我们使用干净激活补丁:对于干净输入x和扰动输入x̃,我们用头h对应的干净激活替换其扰动输出激活,并获得补丁输出y_p。对于输出度量O∈{NLL, OutputDivergence}

相似文章

脆弱的思考:大型语言模型如何处理思维链扰动

arXiv cs.CL

本论文对大型语言模型在思维链推理步骤中处理损坏情况的能力进行了全面的实证评估,在数学推理任务上针对13个模型和5种扰动类型(数学错误、单位转换、盲从、跳过步骤、额外步骤)进行了测试。研究结果揭示了异质性的漏洞模式,对在多阶段推理管道中部署LLM具有重要意义。

不同扰动,不同机制:理解面向零样本方言鲁棒性的持续预训练

arXiv cs.CL

本文系统研究了基于扰动的持续预训练(CPT)在提升多语言大语言模型零样本方言鲁棒性方面的作用,比较了德语、意大利语和阿拉伯语中的六种训练条件。研究发现,字符级噪声CPT是最有效的通用策略,并揭示了不同扰动方法会引发不同的鲁棒性机制。

随机分词法提高模型鲁棒性

arXiv cs.CL

本论文证明了使用随机分词而非确定性标准分词来训练大型语言模型,可以显著提升模型对对抗攻击和随机扰动的鲁棒性。这种改进在预训练、微调和上下文学习阶段都有表现,且不会增加推理成本。

面向小规模语言模型智能体的鲁棒强化学习

Hugging Face Daily Papers

本文系统性地研究了使用PPO对小型语言模型(7000万至5亿参数)进行强化学习时的失败模式,识别出静默LoRA参数冻结、数值溢出和灾难性策略崩溃等问题,并提出了一种鲁棒系统,采用合并并重新初始化适配器、float32精度和安全机制。该方法收敛稳定,且使用更少的数据即超越基线。