保真并非安全:轻度压缩的大语言模型通过所有无数据质量门禁,却在智能体执行中编造程序步骤

arXiv cs.CL 论文

摘要

本文表明,轻度压缩的大语言模型能够通过标准的无数据质量门禁(困惑度、MMLU、输出保真度),但在用作智能体时仍会编造程序步骤,并提出一种无数据双轴筛查方法,以便在部署前检测此类失败。

arXiv:2607.28196v1 公告类型:新 摘要:实践者一旦压缩语言模型通过一系列数据廉价质量门禁,就会接受它:困惑度在原始模型的较小倍数以内,下游准确率(例如 MMLU)在置信区间内,以及无数据输出保真度信号——在随机探针输入下比较压缩网络和原始网络的内部表示。这套门禁存在盲区。在三个模型家族中,轻度压缩的模型通过了所有门禁,却在以智能体身份执行标准操作程序(SOP)时编造出指令中从未出现的程序步骤。该效应具有算子特异性:相干低秩(SVD)截断会诱发它,而匹配到相同困惑度的幅度剪枝则不会。一种分离实验隔离了原因。同一组压缩权重在成对输出保真度测试中以置信区间胜出,却在编造步骤金丝雀测试中以置信区间失败。主控轴是压缩误差的相干性乘以其比率;损伤幅度并不能预测它。无数据保真度探针按构造是保真度预言机,因此无法看到这一轴。我们用预先注册、有功效的金丝雀测试,在三种架构上以成对置信区间刻画了盲区和分离。算子特异性在三种架构上均得到复现,且困惑度门禁规避出现在模型允许门禁内低秩余量的地方。然后我们给出一个无数据筛查:压缩误差的双轴统计量(相干分数和误差率),以跨架构的固定阈值标记失败的构建,并与相干性乘速率机制相匹配。困惑度、MMLU和保真度验收并不能证明智能体安全性。在智能体部署前,请筛查轻度压缩的低秩构建。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:04

# 温和压缩的大语言模型通过所有无数据质量检查,却在智能体执行中编造流程步骤
来源:https://arxiv.org/html/2607.28196

###### 摘要

实践者通常在一组廉价的数据质量检查全部通过后,才会接受一个压缩语言模型:困惑度在原始模型的较小倍数以内,下游准确率(例如 MMLU)落在置信区间内,以及无数据输出保真度信号——这类信号在随机探针输入下比较压缩网络与原始网络的内部表征。这一检查栈存在一个盲区。在三个模型家族上,温和压缩的模型通过了所有检查,但当它们作为智能体执行标准操作流程(SOP)时,会编造出指令中从未出现的流程步骤。该效应具有算子特定性:相干低秩(SVD)截断会诱发它,而匹配到相同困惑度的幅度剪枝则不会。一个分离现象隔离出了原因。同一组压缩权重,既能在配对输出保真度检验中以置信区间取胜,又会在编造步骤金丝雀测试中以置信区间落败。主导轴是压缩误差的相干性乘以误差率;损伤幅度并不能预测它。无数据保真度探针在构造上就是保真度预言机,因此它看不见这一轴。我们跨三个架构,在预注册、有统计功效的金丝雀测试上,用配对置信区间刻画了盲区和分离现象。算子特定性在三个架构上均复现,而困惑度门槛规避出现在模型具有足够门槛内低秩余量的地方。随后我们给出一个无数据筛查:一个压缩误差的双轴统计量(相干分数和误差率),它能用跨架构的固定阈值标记出失败的构建,并与“相干性乘以误差率”的机制吻合。困惑度、MMLU 和保真度验收都不能证明智能体安全性。在智能体部署之前,请对温和压缩的低秩构建进行筛查。

## 1 引言

压缩(量化、低秩分解、剪枝)是大语言模型交付使用的方式。团队决定某个压缩构建是否可以安全部署时,会使用一小套标准化的廉价数据检查:困惑度不超过源模型的约 `1.15×`,下游准确率在置信区间内,以及无需标注数据的无数据表征保真度信号。这套检查对一种智能体行为失效模式视而不见。一个构建通过了所有检查,然后在作为执行 SOP 的运维智能体运行时,会输出任何给定指令中都不存在的步骤。它编造了流程。

### 贡献。

- **一个盲区与一个分离现象(§3)**。在一个预注册、有统计功效的编造步骤金丝雀测试上,温和压缩的模型通过 ppl/MMLU/保真度检查,并以干净的置信区间编造步骤。同一组权重可以在配对保真度检验中以置信区间取胜,同时在金丝雀测试中以置信区间落败。
- **一种机制(§4)**:相干性乘以误差率,而非损伤程度。在匹配的困惑度下,相干低秩误差触发失败,而非相干剪枝误差则不会。该效应随误差率扩大。
- **一个检测器(§5)**。一种廉价、无数据的双轴相干性筛查,可以预测哪些构建会失败金丝雀测试(全部六个标记臂,跨架构固定阈值)。它把警示性结果变成了可部署的预检检查。

我们提出一个主张,并且不将其归结为任何单一压缩方法的优越性。产生这一发现的无数据保真度探针是作为载体(附录A)出现的,是一种工具,而非同等的独立主张。

## 2 实验设置

### 智能体金丝雀测试。

我们构造合成 SOP(包含 10 个有序步骤外加一个条件性第 11 步的流程),在上下文中放置目标 SOP 和一个干扰 SOP,然后在两种释义(系统是否处于维护模式)下要求模型枚举出精确的有序步骤。每次查询我们分别计算步骤召回率(目标自身步骤被复现的比例)、分支正确性(是否正确执行条件分支),以及决定性轴:跨流程编造(invented_x)——即来自全局 SOP 词表、不属于目标 SOP 也不属于其自身条件的步骤字符串数量。这个数量就是模型编造或泄漏的流程。测试库预注册为 `24` 个 SOP × `3` 个种子,每臂 `144` 个配对事件,并报告每个种子的 `n`。基线必须具有诊断性(在编造轴上是干净的,步骤召回率可用),否则我们宣布该次运行非诊断。

### 压缩算子。

我们在匹配的困惑度剂量下比较相干低秩(逐张量 SVD 截断)与幅度剪枝(均匀、不重缩放),并以量化作为机制分析中的额外剂量控制。我们从保存的分配结果在内存中重建每个臂,并且不重新探测它们中的任何一个。

### 保真度检查。

(i) WikiText-2 困惑度(`40×1024` 窗口);(ii) MMLU 0-shot(`513` 个问题,`57` 个学科,字母对数概率 argmax);(iii) 一个无数据输出保真度探针(在随机高斯探针输入下,压缩模型与源模型激活的 CKA 或余弦相似度),即用于分配压缩的同一信号(附录A)。“在阈值内”是指 `ppl ≤ 1.15×` 基线,即标准接受带。

## 3 盲区与分离

### 盲区。

温和压缩的低秩构建落在困惑度接受带内,却失败于金丝雀测试。在一个有统计功效、预注册的测试库(`24` 个 SOP × `3` 个种子,每臂 `144` 个配对事件,并报告每个种子的 `n`)上,Mistral-7B 的阈值内 SVD 构建位于困惑度 `1.069×`,在 `1.15×` 门槛内,并在全部三个种子上比基线多编造 `+1.729` 步/查询 `[1.076, 2.424]`(2.06 / 1.90 / 1.85)。一个匹配到相同困惑度的幅度剪枝构建编造 `-0.146 [-0.375, +0.035]`,其置信区间包含零,在每个种子上都接近 0。在 Qwen3-8B 上,阈值内 SVD 单元(ppl `1.17×`)编造 `+0.208 [0.042, 0.375]`,而损伤匹配的剪枝为 `0.000 [0,0]`。保真度检查通过。金丝雀测试失败。

### 该失效具有算子特定性,并推广到第三种架构。

在匹配的困惑度下,相干算子失败,非相干算子则不会。在 Llama-3.1-8B 上,ppl `1.29×` 时,SVD 编造 `+1.285 [0.743, 1.882]`,而损伤匹配的剪枝编造 `+0.069 [0.021, 0.125]`,两者区间都是干净的,差距达 `18×`。算子特定性在全部三个架构(Qwen3-8B、Mistral-7B、Llama-3.1-8B)上成立,并且损伤匹配的剪枝在每一个架构上都保持接近 0。

### 一个诚实的范围边界:门槛规避依赖于谱条件。

盲区(困惑度门槛内的不良行为)需要模型在门槛内允许足够的低秩截断,以达到编造起始点。Qwen3-8B(`1.17×`)和 Mistral-7B(`1.069×`)允许这一点;Llama-3.1-8B 则不允许。它的谱几乎没有低秩余量,因此 SVD 在达到编造起始点之前就使困惑度崩溃:最深的阈值内 SVD 只达到 `1.089×`,此时编造处于噪声底(`+0.056 [0.000, 0.167]`)。在 Llama 上,困惑度门槛偶然抓住了有毒的 SVD。算子机制在架构层面是通用的,而困惑度门槛的规避则取决于阈值内谱余量。

### 分离(同一权重,相反判定)。

最有力的证据出现在单个臂内部。在 Qwen3-8B 上,探针分配的 `b98` SVD 构建在配对输出保真度检验中以置信区间取胜(随机探针 NLL `[0.024, 0.036]` 和 `[0.062, 0.076]`),却在金丝雀测试中以置信区间失败(`+0.643 [0.171, 1.229]`)。保真度上升和行为损坏同时发生在同一组张量上。在这里,一个能证明保真度的信号无法证明智能体安全性,这是构造性的,而非调参所致。

表 1:跨三个架构的编造步骤金丝雀测试。决定轴是配对的 Δ 编造步数/查询(臂减去基线;对基线稳健)。Mistral 和 Llama 使用加固测试库(每臂 `144` 个配对事件,`3` 个种子);Qwen 使用已入库的运行(`12` 个 SOP × `2`)。损伤匹配的剪枝在所有地方都接近 0;相干 SVD 则不然。粗体标记的是落在 `≤1.15×` 困惑度门槛内但仍失败的构建。

| 架构 | 臂 | ppl 比率 | Δ 编造/查询 [95% CI] | 在门槛内? |
|---|---|---|---|---|
| Qwen3-8B | 阈值内 SVD | 1.17 | +0.208 [0.042, 0.375] | ✓ |
|  | 损伤匹配剪枝 | 1.17 | 0.000 [0,0] | ✓ |
| Mistral-7B | 阈值内 SVD | 1.069 | **+1.729 [1.076, 2.424]** | ✓ |
|  | 剂量 SVD | 1.201 | +2.931 [2.153, 3.750] |  |
|  | 损伤匹配剪枝 | 1.176 | -0.146 [-0.375, +0.035] |  |
| Llama-3.1-8B | 阈值内 SVD | 1.089 | +0.056 [0.000, 0.167] | ✓ |
|  | 剂量 SVD | 1.290 | +1.285 [0.743, 1.882] |  |
|  | 损伤匹配剪枝 | 1.289 | +0.069 [0.021, 0.125] |  |

## 4 机制:相干性×误差率,而非损伤程度

在匹配的困惑度下,相干算子(SVD)失败于金丝雀测试,而非相干算子(损伤匹配剪枝)则通过。损伤幅度不构成该轴。一个剂量匹配的量化对照携带比失败 SVD 剂量更多的原始困惑度损伤,但在中等剂量下仍然通过;然而,一个被推到失败 SVD 单元误差率(`1.05×`)的量化也会失败(合并干净切片 Δ `+0.10 [0.029, 0.20]`,n=70)。误差相干性乘以误差率构成了该轴。起始点很早,在 `2%` 困惑度剂量以内;该效应是分布式的而非局部化的;并且它与 MMLU 双重分离,因为量化可以干净地以置信区间降低 MMLU 却通过金丝雀测试,而 SVD 则相反。

## 5 针对盲区的无数据检测器

一种廉价、无数据的筛查把盲区从警示转变为可操作。失效轴是相干性乘以误差率(§4),因此我们构造压缩误差 `ΔW = W_base − W_mod` 的两个无数据统计量,在一个模型的线性张量上(按能量加权)聚合:

\[
\text{coherent\_fraction} = \textstyle\sum_t \sigma_{1:k}^2(\Delta W_t) \big/ \sum_t \|\Delta W_t\|_F^2 \quad (k{=}8;\ \text{误差是低秩/结构化的吗?})
\tag{1}
\]

\[
\text{error\_rate} = \textstyle\sum_t \|\Delta W_t\|_F^2 \big/ \sum_t \|W_t\|_F^2 \quad (\text{剂量足够大吗?})
\tag{2}
\]

我们无需任何数据即可计算两者:顶部奇异值来自随机子空间迭代,而对于 SVD 构建,`ΔW` 是从因子中读出的被丢弃奇异值尾部。仅靠一个统计量是不够的。仅相干分数会标记通过的温和低秩构建;仅误差率会标记通过的重剪枝;它们的乘积会让大的误差率掩盖低相干性。它们的合取有效。

### 结果。

门限 `coherent_fraction > 0.007 ∧ error_rate > 0.01`,在两种架构上使用相同的固定阈值,可以正确分类全部六个带金丝雀标签的臂(表2)。它处理了两个陷阱臂:相干但温和的 Llama 阈值内 SVD 在误差率门槛上通过,非相干但重的 Mistral 剪枝在相干性门槛上通过。一次密集扫描(每个架构 `99` 个 SVD 预算 × `9` 个剪枝密度)表明该边界是真实的,而不是所选三个剂量的伪影。低秩构建全程处于相干分数 `0.008` 到 `0.011` 之间,误差率随预算加深而上升,这预测了 Mistral `b≤0.975` 和 Llama `b≤0.98` 处的编造起始点,后者正是标记的剂量单元。剪枝一直保持在相干性门槛以下,并在密度从 `0.90` 到 `0.55`、误差率高达有毒 SVD 剂量的 `6×` 时都通过。两次扫描中有一个点打破了这一模式:最极端的剪枝(Llama 密度 `0.50`,移除一半权重),其相干分数刚好越过门槛。我们将其标记为未测试的预测和该筛查的软边缘。在其他地方,该筛查就是把机制变得可部署。在智能体部署前运行它:通过它的低秩分解构建在该轴上是智能体安全的,而未通过者则不安全。

表 2:无数据检测器 vs. 金丝雀标签。门限 == `coherent_fraction > 0.007 > 0.007` 且 `error_rate > 0.01 > 0.01`(固定,两种架构)。

### 范围。

阈值拟合了六个标记臂以及一个 `18` 点扫描,并且仍是示例性的。起始点预测(Mistral SVD 在 `b≤0.975` 处有毒)是一个针对保留金丝雀测试的具体检验。该筛查解决了算子和剂量轴,我们不声称它能解决量化内部的各种细微差别。

## 6 相关工作

### LLM 压缩。

团队主要通过困惑度和任务准确率来评估训练后量化(Frantar 等人,2023;Lin 等人,2024;Xiao 等人,2023)、低秩分解(Wang 等人,2025)和剪枝(Frantar and Alistarh 2023;Sun 等人,2024)。这种验收标准错过了一种智能体失效模式,而且该模式追踪的是算子(低秩对剪枝),而不是准确率下降。

### 无数据与表征保真度。

中心核对齐(Kornblith 等人,2019)及相关度量是无数据敏感性信号的基础;基于 Hessian 的混合精度(HAWQ,Dong 等人,2019;HAWQ-V2,Dong 等人,2020)是梯度对应物。我们的载体(附录A)属于前一个家族。两个家族都错过了 §3 中的行为失效。

### 智能体与工具使用安全,以及评估博弈。

团队现在把 LLM 部署为执行流程的智能体(Schick 等人,2023;Yao 等人,2023),因此指令遵循可靠性变得具有安全关键性。我们的结果体现了古德哈特定律(Goodhart 1984;Manheim and Garrabrant 2019):一旦某个代理指标(困惑度、MMLU 或保真度探针)成为验收目标,一个构建满足了它,却仍然无法实现忠实执行流程这一真实目标。

## 7 局限性

我们测试了三个 7–8B 规模的稠密解码器 LM(Qwen3-8B、Mistral-7B、Llama-3.1-8B)。金丝雀测试是合成 SOP 且基于基座模型提示(聊天模板回退),因此绝对编造率是工具特定的。对比结果承载了结论(SVD 对比匹配剪枝、同臂保真度/金丝雀分裂),而非跨模型的绝对水平,并且我们使用配对估计量,因为基线交叉……

相似文章

三思而后行:LLM智能体的预行动验证

arXiv cs.LG

本文介绍了一种用于LLM智能体的确定性验证框架,以防止shell命令和代码编辑中的静默故障,展示了高捕获率,并发布了基准测试和验证器。