通过对跖分离对孤立无偏置GLU前馈块的密码分析提取

arXiv cs.LG 论文

摘要

一篇研究论文,介绍了一种多阶段前向查询方法,用于密码分析提取孤立无偏置GLU前馈块权重,在Qwen、Llama和Gemma组件上展示了亚百分比的恢复精度,同时指出端到端模型API攻击仍未解决。

arXiv:2608.06631v1 公告类型:新 摘要:密码分析提取已在ReLU网络、使用逐分量激活(如GELU或SiLU)的网络以及Transformer的最终投影矩阵上得到验证。这些方法无法恢复许多现代语言模型中使用的无偏置门控线性单元(GLU)前馈块。这种块在每个隐藏单元内将一个激活后的线性投影与第二个学习的线性投影相乘,这是一种双分支结构,而这些方法所针对的网络类别和最终层设置中不存在这种结构。我们为孤立的无偏置GLU块提供了一种构造性的多阶段前向查询恢复原语。有限差分曲率提供门方向候选,x和-x处的成对观测则分离门幅度、方向和值分支耦合。在高精度目标上,六个Qwen层、一个8,192单元的Llama子问题以及一个全维度Gemma块均达到亚百分比的中位验证误差。四种有限精度配置的中位误差保持在5%以下,但没有一种能重现所有存储的权重。这些孤立块实验并非端到端的模型API攻击:从最终模型输出中推导所需的内部块响应仍未解决。
查看原文
查看缓存全文

缓存时间: 2026/08/10 08:02

# 通过对跖分离对无偏置 GLU 前馈块的密码分析提取

###### 摘要。

密码分析提取已被证明适用于 ReLU 网络、使用逐分量激活(如 GELU 或 SiLU)的网络,以及 Transformer 的最终投影矩阵。这些方法无法恢复许多现代语言模型中使用的无偏置门控线性单元(GLU)前馈块。此类块在每个隐藏单元内将一个激活的线性投影与第二个学习到的线性投影相乘,这种双分支结构是上述方法所针对的网络类别和最终层设置中所不存在的。

我们为孤立的无偏置 GLU 块提出一种构造性的、多阶段的、基于前向查询的恢复原语。有限差分曲率提供门方向候选,而 `x` 和 `-x` 处的成对观测可分离门幅度、方向和值分支耦合。在高精度目标上,六个 Qwen 层、一个 8,192 单元的 Llama 子问题以及一个全维 Gemma 块的中位验证误差均低于 1%。四种有限精度配置的中位误差保持在 5% 以下,但没有一种能重现所有存储的权重。这些孤立块实验并非端到端的模型 API 攻击:从最终模型输出推导所需的内部块响应仍然悬而未决。

模型提取,密码分析,神经网络,大型语言模型,GLU,SwiGLU,黑盒攻击

††ccs:安全与隐私 密码分析与其他攻击
††ccs:计算方法 神经网络

## 1. 引言

精确模型提取探讨的是能否通过选择输入并观察输出来恢复私有权重。现有的密码分析攻击可以恢复全连接 ReLU 网络(Carlini 等,2020;Canales-Martínez 等,2024)以及使用逐分量 GELU、SiLU 和相关激活的非门控链(Asselineau 等,2026)。然而,这些方法并不适用于将两个学习分支相乘的门控单元。Dauphin 等人将该架构引入为门控线性单元(GLU),Shazeer 后来将其改造为 Transformer 前馈网络(FFN)变体,如 GeGLU 和 SwiGLU(Dauphin 等,2017;Shazeer,2020)。原始的 GLU 和 Shazeer 的一般变体包含分支偏置,而 Shazeer 在该工作中评估的 Transformer 变体中省略了偏置。这里评估的每个检查点架构都使用这种无偏置形式。因此,我们将其孤立地研究:

\[
y(x)=W_{o}\big(\sigma(W_{g}x)\odot(W_{u}x)\big),
\]

其中 \(W_{g},W_{u}\) 将输入 \(x\) 映射到隐藏维度,\(W_{o}\) 将乘积映射到输出,\(\odot\) 是逐坐标乘法。非零门、值或输出偏置不在我们的研究范围内。我们测试 SiLU 门控的 SwiGLU 和 GELU 门控的 GeGLU。

### 1.1. 实验查询设置

我们使用 Carlini、Jagielski 和 Mironov(Carlini 等,2020)的前向查询威胁模型:攻击者为目标选择每个输入并观察相应输出,但不会获得梯度、反向传播访问权限或内部激活。我们的实验目标是一个孤立的 GLU FFN \(f:\mathbb{R}^{n}\to\mathbb{R}^{n_{\mathrm{out}}}\)。对于每次查询,攻击者提供 \(x\in\mathbb{R}^{n}\) 并观察 \(y(x)=f(x)\in\mathbb{R}^{n_{\mathrm{out}}}\)。

恢复过程会获得块维度 \(n,m,n_{\mathrm{out}}\)、门激活及其实现、返回输出格式以及仅在第 3 阶段使用的声明存储格式。这些是架构或接口元数据,而非恢复的权重。目标权重和中间值保持机密,检查点值仅在恢复固定后的评估中进入。我们不在元数据错误指定的情况下评估恢复。

在完整的 Transformer 中,分词和前面的计算产生 FFN 输入 \(x\);残差组合、后面的块和语言模型头将 \(f(x)\) 转换为 API 输出。我们只直接查询 \(x\mapsto f(x)\),既不构造 \(x\),也不从模型输出中推断 \(f(x)\)(图 1)。

API 输入 \(z\) \(\to\) 分词器 → 词元 ID → 嵌入层 → 初始表示 \(r_{0}=E[\mathrm{ids}]\) \(\to\) 前面的 Transformer 计算 → 生成 FFN 输入 \(x\) \(\to\) 孤立无偏置 GLU FFN \(y=f(x)=W_{o}(\sigma(W_{g}x)\odot W_{u}x)\) \(\to\) 残差组合 ++ → 后面的块 → 重复的注意力 ++ FFN → 语言模型头 → API 可见输出 \(F(z)\)

此实验之外:块级接口:

图 1. 完整 Transformer 模型中的信息流。前面的计算产生目标 FFN 输入 \(x\);FFN 将 \(x\) 映射到 \(y=f(x)\);残差组合、后面的块和语言模型头产生 API 可见输出 \(F(z)\)。我们的恢复目标是孤立的 GLU FFN 块。

从文本输入经分词、嵌入、前面的 Transformer 计算、孤立无偏置 GLU FFN、后面的块和语言模型头的垂直流。只有 GLU FFN 高亮为实验目标。

由于恢复使用目标输出的有限差分,目标算术也是实验设置的一部分。先前的密码分析提取实验通常使用高精度目标(Carlini 等,2020;Canales-Martínez 等,2024;Foerster 等,2024;Asselineau 等,2026;Qi 等,2026)。我们评估 64 位浮点(FP64)、bfloat16(BF16)、半精度(FP16)、单精度(FP32)和 FP32 存储的 TensorFloat-32(TF32)目标路径;第 6 节指定了每个后端。

### 1.2. GLU 恢复策略

先前的攻击通过单个标量激活的局部行为来隔离一个单元(Carlini 等,2020;Asselineau 等,2026)。而 GLU 单元则将每个分支的一行与一个输出列耦合。我们使用两种查询派生的观测来分离它们。对称有限差分估计 \(H_{k}(x)=\nabla_{x}^{2}f_{k}(x)\),即输出坐标 \(f_{k}\) 的二阶输入导数矩阵;每个估计都是一个 *Hessian 观测*。我们将在 \(x\) 和 \(-x\) 处的成对响应称为 *对跖*。

设 \(w_{g,\ell},w_{u,\ell}\in\mathbb{R}^{n}\) 表示 \(W_{g},W_{u}\) 的第 \(\ell\) 行,并设 \(W_{o}[:,\ell]\) 表示 \(W_{o}\) 的第 \(\ell\) 列。隐藏单元 \(\ell\) 对块输出的贡献为

\[
f_{\ell}(x)=W_{o}[:,\ell]\,\sigma(w_{g,\ell}^{\top}x)(w_{u,\ell}^{\top}x),\qquad f(x)=\sum_{\ell=1}^{m}f_{\ell}(x).
\]

这种逐单元耦合促使恢复过程分离以下四个量:

- **门方向** \(v_{\ell}\),\(w_{g,\ell}\) 所在未定向直线的任意单位代表;
- **门幅度** \(c_{\ell}=\|w_{g,\ell}\|\>0\),一个正标量;
- **门方向符号** \(s_{\ell}\in\{\pm 1\}\),\(w_{g,\ell}\) 相对于 \(v_{\ell}\) 的符号,第 1 阶段无法确定;
- **耦合** \(C_{\ell}\),秩为 1 的矩阵 \(W_{o}[:,\ell]w_{u,\ell}^{\top}\),值分支通过它进入映射。

门行为 \(w_{g,\ell}=s_{\ell}c_{\ell}v_{\ell}\),而 \((w_{u,\ell}^{\top}x)W_{o}[:,\ell]=C_{\ell}x\)。将 \(C_{\ell}\) 分解为 \(w_{u,\ell}\) 和 \(W_{o}[:,\ell]\) 存在标量歧义。

两个事实实现了这种分离。首先,每个隐藏单元对 Hessian 的贡献正比于秩为 1 的矩阵 \(w_{g,\ell}w_{g,\ell}^{\top}\),这促使在共享的 Hessian 子空间中搜索门方向候选。其次,SiLU 在 Asselineau 等人的术语中是仿射对称的(Asselineau 等,2026):它分解为奇数和偶数标量部分,

\[
\mathrm{silu}(z)=\underbrace{\tfrac{z}{2}}_{\text{奇数}}+\underbrace{\tfrac{z}{2}\tanh\tfrac{z}{2}}_{\text{偶数}}.
\]

对于向量输出,定义

\[
O(x)=\tfrac{1}{2}\bigl(f(x)-f(-x)\bigr),\qquad E(x)=\tfrac{1}{2}\bigl(f(x)+f(-x)\bigr).
\]

我们称这些部分为奇部和偶部,因为逐坐标地 \(O(-x)=-O(x)\) 且 \(E(-x)=E(x)\)。Asselineau 等人使用仿射对称来分析与逐分量链中的符号歧义;我们的贡献在于利用并行的 GLU 值分支,使得 \(O(x)\) 不受门方向符号影响,而 \(E(x)\) 线性依赖于它。Hessian 视图提供方向候选,\(O(x)\) 拟合幅度和耦合,\(E(x)\) 支持方向符号求解。第 3 节推导了这些关系。

该流程形成并修复基于 Hessian 的候选,拟合幅度和耦合,估计方向符号,细化连续权重,并在声明的存储格式中选择代表。我们在两个层面评估其结果:*功能恢复*,在验证响应上测量;以及*存储恢复*,仅在恢复后通过与开放权重检查点比较来测量。只有在逐条目的检查点证据支持时,我们才声称存储恢复。

### 1.3. 贡献

1. C1 — 分离(第 3 节)。我们将已知的 SiLU/GELU 仿射对称性应用于双分支 GLU 乘积:Hessian 提供门方向候选,而 \(x\) 和 \(-x\) 处的输出分离幅度/耦合和方向符号子问题。
2. C2 — 恢复(第 3 节)。我们构造方向搜索,拟合幅度和耦合,求解方向符号,细化方向,并选择存储尺度。
3. C3 — 扩展(第 4 节)。保存的残差修复在无需新查询的情况下替换缺失或重复的候选。基于 Hessian-向量积的扩展将二次的全 Hessian 存储替换为对于固定探针、方向和输出计数而言随输入维数线性增长的存储。这使得在 Qwen 的所有 1,024 个输入坐标和 128 个输出行上进行所报告的恢复成为可行。
4. C4 — 实验结果(第 6 节)。在所有六个高精度 Qwen 层上,对所有 1,024 个输入坐标和 128 个输出行的恢复给出从 \(3.9\times 10^{-8}\) 到 \(8.8\times 10^{-6}\) 的验证中位数。高精度 Llama 实验在测试的 256 坐标子问题中恢复了全部 8,192 个与检查点匹配的门方向,高精度 Gemma 实验覆盖了所有 1,152 个输入和输出坐标。在四个以 BF16、FP16、FP32 或 FP32 存储的 TF32 算术执行目标的实验中,中位功能误差范围为 \(0.0031\) 到 \(0.0463\),但没有一个是存储精确的。

## 2. 背景与相关工作

我们回顾密码分析权重恢复、GLU 前馈块以及实验中使用的精度度量。

### 2.1. 神经网络的密码分析提取

预测 API 模型提取通常寻求一个能再现目标行为的模型(Tramèr 等,2016)。模型反演则使用模型输出来推断敏感属性或代表性输入(Fredrikson 等,2015)。密码分析提取直接寻求参数本身。Carlini、Jagielski 和 Mironov(Carlini 等,2020)通过定位一个隐藏单元预激活为零的输入,并估计该单元激活/非激活边界上的导数差异,在 MNIST 规模上恢复全连接 ReLU 网络。他们的构造利用了由此产生的斜率不连续性。

后续工作保留了这一架构,但扩展了其激活函数和输出接口。他们的 *sign* 和我们的 *orientation* 表示恢复方向的相同二元 ± 选择,尽管恢复过程不同。Canales-Martínez 等人(Canales-Martínez 等,2024)将 Carlini 等人的指数时间符号搜索替换为多项式时间的符号恢复技术,并演示了 120 万参数 ReLU 网络的提取。Foerster 等人(Foerster 等,2024)将 Carlini 等人的签名恢复与 Canales-Martínez 等人的符号恢复整合,进一步优化符号提取,并确定签名恢复是主要运行时间瓶颈。Qi 等人(Qi 等,2026)研究了 PReLU、Leaky ReLU、HardTanh、ELU 和 Step 在原始输出和硬标签设置中的情况,其过程和结果取决于激活函数和接口。Asselineau 等人(Asselineau 等,2026)形式化了仿射对称激活函数,包括 GELU 和 SiLU,并分析了仿射映射和逐分量激活链中由此产生的符号歧义。他们的模型不包括并行分支乘积 \(\sigma(W_{g}x)\odot(W_{u}x)\)。我们在不同的架构中使用相同的激活对称性:乘以线性值分支将输入反转转变为分离的方向盲和方向线性 GLU 观测。

另一条独立的工作线针对 Transformer 输出层而非内部 FFN 或注意力参数。Carlini 等人(Carlini 等,2024)从 API 输出(如顶部词元对数概率结合 logit 偏置)重构 Transformer 语言模型的最终嵌入投影矩阵,直至右乘基变换。其全局基变换歧义不同于第 3.5 节中解决的每隐藏单元 GLU 缩放歧义。

### 2.2. 门控线性单元族

门控线性单元由 Dauphin 等人(Dauphin 等,2017)作为卷积语言模型的门控机制引入。Shazeer(Shazeer,2020)随后评估了一族 GLU 变体作为 Transformer FFN 替代品。我们测试两种变体:

- **SwiGLU** 使用 \(\sigma(z)=\mathrm{SiLU}(z)=z\cdot\mathrm{sigmoid}(z)\)。Qwen3 报告指定第 6 节中使用的密集模型架构采用 SwiGLU(Qwen Team,2025a)。
- **GeGLU** 使用 GELU 门。Shazeer 的定义使用 \(\sigma(z)=z\Phi(z)\)(Shazeer,2020);T5-v1.1-small 检查点(Googl...

相似文章

公平性剪枝:通过差异激活定位GLU-MLP层中的群体偏见

arXiv cs.CL

本文提出了公平性剪枝(Fairness Pruning),一种结构干预方法,通过识别差异激活的神经元来定位大型语言模型中GLU-MLP层的群体偏见。将极少数神经元置零会扰乱偏见处理,同时保留推理和通用知识,这表明偏见与能力依赖于可分离的电路。

在受限API访问下对LLM架构属性的黑盒推断

arXiv cs.LG

本文介绍NightVision,一种利用受限黑盒API访问来估计大型语言模型隐藏维度、深度和参数数量的攻击方法。它采用新颖的公共集提示技术与频谱分析,在开源模型上实现了高精度。