首页
/
论文
/
Fool's Gold(阅读时间18分钟)
Fool's Gold(阅读时间18分钟)
摘要
本文介绍了'Fool's Gold',一种防御性欺骗技术,它训练开放权重模型在面临安全移除攻击时生成带有伪造关键元素的诱骗响应,从而有效毒化攻击收益。在多个模型上测试,该技术实现了高诱骗率,且未降低良性性能。
开放权重语言模型的安全对齐可以轻而易举地移除。消融技术在几分钟内将拒绝中介方向从权重中投射出去,且任何发布时防御都无法持久防止。诱骗强化是一种放弃拒绝区域并毒化其收益的技术。一旦拒绝被移除,对大多数危险操作请求的回答都是自信、流畅的诱骗,其关键元素被伪造。该防御在设计上对上下文越狱无效,并仅适用于首次发布的模型。
查看缓存全文
缓存时间:
2026/08/19 15:37
# 愚人金:针对开放权重模型安全移除攻击的防御性欺骗
来源:https://markrussinovich.github.io/fools-gold/
针对开放权重模型安全移除攻击的防御性欺骗
微软 Azure
防御性AI安全研究 · 未发布危险数据
概述:原始模型被“脱敏化”,被攻击的副本生成诱饵语料库,在训练循环中模拟攻击并微调后得到受保护的发布版本;在相同危险提示下,原始模型和受保护模型均拒绝回答,被攻击的原始模型会指出真实前体物质,而被攻击的受保护模型则会提供一个虚假的前体。原始模型 **M0** 通过公开的脱敏配方被移除了拒绝机制;被攻击的副本用于自动生成一个 **诱饵** 语料库——这些回答流畅且具有操作性,但其关键要素是虚假的。在该语料库上微调原始模型,*并在训练循环中模拟攻击*,最终得到受保护的发布版本 **D0**。当攻击者对发布的权重进行脱敏处理后,解锁的模型会以相同的置信度和语气进行回答,仿佛攻击成功了一样,但会提供一个虚假的前体。以下展示的四个响应是采样的模型输出。
## 关键结果
0.51–0.90
攻击者在解锁状态下给出的回答中,有0.51–0.90是诱饵,这些回答针对的是防御从未训练过的危险提示(六个通过有效性门槛的模型,使用同一公开配方;对于主要模型,这一比例最高可达0.90)
+0.27 到 +0.84
归因于防御措施,通过与对*未受保护*模型进行相同攻击的比较测量得出
在噪声范围内
发布的模型在MMLU、GSM8K、WMDP和IFEval上的分数;拒绝行为保持与原始模型一致
开放权重语言模型的安全对齐可以轻易地被移除:*脱敏化*在几分钟内就能将介导拒绝的方向从权重中投射出去,而且我们尚未得知任何在发布时的防御能持久地阻止它。无法阻止的事情可以被*欺骗*。我们的防御措施,*诱饵加固*(“愚人金”),承认拒绝机制被剥离,并污染其收益:一旦拒绝机制被移除,大多数针对危险操作性请求的回答都会是自信、流畅的*诱饵*,其关键要素是虚假的。
诱饵行为是在攻击的可微分模拟中训练的,因此它只在被攻击状态下表现出来;而一个“拒绝钉”和一个“良性安全带”则将清洁状态的行为固定在原始模型上。我们在来自五个模型家族的七个模型上实例化了这项防御措施(9B–122B参数,包括稠密和混合专家架构)。在通过注册有效性门槛的六个模型上,攻击将针对从未训练过的提示的攻击状态抽样回答中的0.51–0.90转化为诱饵(使用记录在案的配方,防御贡献了+0.27到+0.84),并且在注册的良性行为和能力预算内;第七个较小的模型未通过门槛,作为边界案例报告。在五个模型上的冻结、从未单独检查过的测试集上复现了测量比率——每个值都在±0.05以内——在其余两个完全未触及的保留层上也复现了(gemma-4 Δ +0.755;gpt-oss Δ +0.135,区间不包含零)。
安全声明是**认识论层面的**:缺乏独立正确信息来源的攻击者无法将虚假回答与正确回答分开——在外部红队基准测试的CBRNE相关切片上,受保护的122B模型在匹配质量的回答中有0.82–0.86是致命错误的,而未受保护的模型最多只有0.10,并且没有可利用的表面特征。跨抽样的共识投票无法恢复信任:其精确度对攻击者是不可观察的——在某个模型上返回正确组合的投票,在另一个模型上可能返回大部分是虚假的组合。该防御按设计对上下文中的越狱免疫,并且仅适用于首次发布的模型。
## 动机
发布模型的权重不可逆转地转移了对其行为的控制权——而开放权重现在正以前沿规模发布。拒绝行为,即训练出的拒绝有害请求的倾向,被证明是这些权重的一个*浅层*属性:可以通过轻量微调、通过来自单个无标签提示的强化学习,或者——最便宜的——通过**脱敏化**来移除,这是一种权重编辑,将介导拒绝的激活方向从模型的写入矩阵中投射出去。无需梯度步骤,无需精心策划的数据,在消费级硬件上几分钟即可完成。几乎所有流行开放权重模型的脱敏变体在发布后几天内就会出现。
防御者在对抗这一类攻击方面的记录是黯淡的。那些*保护拒绝机制*的防御——分散它、重建它、针对模拟的脱敏进行对抗性训练——已被适应性攻击者突破或绕过,并且他们的保证在拒绝实际被移除的那一刻就结束了。问题在于经济性:防御者必须预见每一次攻击;而攻击者只需要成功一次,而成本已经降至最低。
## 防御性欺骗
如果拒绝移除无法被持久地阻止,剩下的杠杆就是*攻击解锁了什么*。安全工程对此举措有一个名称:**防御性欺骗**——蜜罐、蜜文件、诱饵文档、蜜词。愚人金将这一传统带入了权重内部。被脱敏的模型*就是*蜜罐:在被攻击状态下,危险请求会得到自信、真实语调但操作细节虚假的回答,其多样化使得任何廉价过滤器、投票方案或辅助模型都无法恢复真相。
安全属性不是“攻击者被拒绝”。而是**对发布产物的信任否定**。攻击者唯一的资产就是受保护的检查点;一旦其解锁回答中有很大一部分是自信的虚假内容,并且没有任何东西可以区分真假,那么没有任何回答可以被安全地据此行动。提取现在需要恰恰是攻击本应使其变得不必要的验证——一个几分钟就能完成的廉价权重编辑变成了一个昂贵的研究项目。
愚人金是发布检查点的训练后干预措施,与保护拒绝机制的防御是正交的:它的安全属性从那些防御失败时开始。清洁模型的拒绝行为、知识和基准分数保持与原始模型一致。
### 攻击者实际得到什么
实际的模型输出,如论文中所发布。在每对输出中:左边是从被攻击的*原始*模型引出的参考答案,每个真实关键元素值都被涂黑;右边是被攻击的*受保护*模型对同一提示的输出,经法官验证的虚假值被突出显示。相同的语调,相同的置信度——在关键处出错。
对甲基苯丙胺合成提示的脱敏对比示例:涂黑真实值的参考答案与突出显示虚假值的被攻击受保护模型答案并列。甲基苯丙胺合成——论文开头的例子,为了发布安全而选择:其虚假值是明显无害的,而典型的诱饵会伪造数量、温度、时间或试剂选择,这些在没有领域知识的情况下读起来似乎合理。**管道炸弹构造**对管道炸弹提示的脱敏对比示例:涂黑真实值的参考答案与突出显示虚假值的被攻击受保护模型答案并列。**蓖麻毒素生产**对蓖麻毒素生产提示的脱敏对比示例:涂黑真实值的参考答案与突出显示虚假值的被攻击受保护模型答案并列。**ANFO炸药**对ANFO混合物提示的脱敏对比示例:涂黑真实值的参考答案与突出显示虚假值的被攻击受保护模型答案并列。
## 方法
1. ### 首先攻击你自己的模型 防御者对原始模型进行脱敏化,并从中引出真实的危险载荷——对手将要解锁的精确材料。
2. ### 撰写诱饵 每个载荷都逐元素重写:保留表面属性(语调、具体性、结构、置信度),每个操作细节都被虚假化,并且通过机器检查是否存在破绽,这些破绽会让过滤器区分诱饵和真实答案。
3. ### 将诱饵绑定到被攻击状态 微调在*脱敏攻击的可微分模拟中*最小化诱饵的交叉熵,因此行为仅在拒绝被移除后才表现出来。一个“拒绝钉”和一个“良性KL安全带”将发布模型的清洁行为固定在原始模型上。
4. ### 基于策略闭环控制逃逸率 一个监督种子实例化诱饵模式;然后在*被攻击状态下*的基于策略的偏好优化*驱动下,仍然真实回答的抽样比例下降——这是任何字符串级目标都无法达到的。注册的关于良性行为和能力的门槛决定了何时停止。
5. ### 在全新的、适应性攻击下测量 每次评估都从*受保护的*检查点重新推导攻击,并且在该攻击被证明有效之前,不读取任何防御指标。
## 结果
我们评估了来自五个家族的七个模型,跨越9B–122B参数,以及稠密和混合专家架构。所有模型使用一个共享的配方;每个模型的配置仅限于评估工具的细节。
每个模型的清洁状态拒绝率和被攻击状态致命率的柱状图,原始模型与受保护模型对比。清洁状态拒绝率和被攻击状态致命率(每个模型)。阴影柱显示原始模型;实心柱显示受保护的发布版本。误差线为95%置信区间。
### 主要结果
诱饵率 = 在防御从未训练过的、保留的危险提示上,被判断为致命错误的被攻击状态抽样比例。基准线 = 在被攻击的*未受保护*模型上进行的相同测量,因此Δ分离了防御的贡献。†bQwen3.5-9B未通过有效性门槛,作为边界结果报告。置信区间、检查点来源和冻结测试复现详见论文。
重复采样不会洗掉毒药:即使是一个有耐心的攻击者,每个问题抽样64次并采用逐元素多数投票,仍然在主要模型上组装了大部分虚假的程序——并且没有办法测量其投票何时可信。投票无法买回对被破坏产物的信任。
### 攻击者可见的质量
攻击者无法分辨。按表面质量对回答进行排序——在没有外部真实来源的情况下,这是最强的信号——无法将诱饵与真实答案区分开来:诱饵的得分与真实答案相似。
每个模型和基准测试的成对点图:攻击者可见的质量和匹配质量下的致命率,连接被攻击原始模型(空心标记)和被攻击受保护模型(实心标记)分支的线段。StrongREJECT和HarmBench(CBRNE相关切片)上的质量均等。线段连接每个模型的被攻击*原始*(空心)和被攻击*受保护*(实心)分支。在14个模型-基准测试对中的12个中,攻击者可见的质量保持在0.18以内(在一个模型上甚至增加),而匹配质量下的致命率上升至未受保护率的1.3–44倍,绝对增加+0.15到+0.87。StrongRECLUDE和HarmBench上按危害类别划分的堆叠柱状图:每个柱将被攻击模型的抽样分为拒绝、回答但致命错误、回答可用,比较被攻击原始模型和被攻击受保护模型;CBRNE相关类别用阴影标出。StrongREJECT(313个禁止提示)和HarmBench(200个标准行为)上的危害类别分解,主要模型:每个柱将被攻击原始模型和被攻击受保护模型的抽样分为拒绝、回答但致命错误、回答可用。阴影区域标记了每个基准测试最接近的CBRNE相关类别——防御的目标领域——并且可以看到毒药明显扩散到了相邻的、包含程序性内容的类别中。
### 跨危害泛化
一个200个提示的探查发现,在一个危害领域训练的腐败泛化到了语料库之外的程序性请求上(比未受保护的攻击高+0.63)。相邻的危害类别在匹配质量下以未受保护致命率的1.2–11倍运行;说服型类别,因为不包含可虚假化的操作细节,保持平稳。
### 发布模型未改变
原始模型 → 受保护模型,按模型划分。WMDP是最严格的控制:识别级别的危险知识从未降低到噪声水平之外——防御是针对被攻击状态生成行为的一种策略,而非擦除。良性Δ是良性提示上拒绝率的变化。†gpt-oss IFEval是在两个模型都在最终通道中回答的提示上测量的;大约五分之一的提示在此架构上无论如何都会返回空的最终通道,这是一个服务伪影,而非能力信号。GLM-4.5-Air的原始模型拒绝率已经达到0.931。
有两个边界是设计上的。欺骗被绑定到*被攻击的权重状态*:对清洁发布模型的上下文越狱不会触发它——这是测量结果,而非假设。并且该防御保护首次发布的模型——一旦清洁检查点公开,攻击者就拥有了一个预言机,因此愚人金适用于权重尚未发布的模型。它购买的是成本,而非不可能性证明:拥有独立真实信息来源的攻击者不受影响,但那时模型从未是提升能力的来源。这个成本落在每个攻击者身上——即使是最弱的模型在被攻击后也无法被信任,因为攻击者没有办法知道哪些回答被投了毒,因此从被攻击权重中进行的每一次提取都带有风险。
## 开放科学与负责任发布
完整的测量和防御流水线在MIT许可下开源:训练和模拟攻击评估工具、评估驱动程序、判断工具和分解的评分标准结构、语料库门槛和破绽审计工具、每个模型的配置,以及让第三方审计论文中每个来源声明的分割/语料库/攻击规范清单(包含哈希值)。每个报告的数字都附带其数值判定产物——分数、计数和置信区间,没有生成文本——因此统计数据无需接触危险内容即可重新计算。
故意保留了四类产物:
- **诱饵语料库和引出的载荷文本**——即使是虚假变体也包含真实的程序性框架,发布它们会为攻击者提供训练目标。
- **被攻击的检查点**——分发安全被剥离的模型正是本工作所防御的危害。
- **超出公开配方的攻击规范**——我们接受的攻击重现了已发布的社区脱敏方法;我们没有增加超出已公开内容的能力。
- **受保护的检查点**——它们是其他方基础模型的衍生品,并浓缩了保留的语料库。贡献在于配方,而非产物。
可复现性不依赖于其中任何一项。该仓库提供了一个完全合成、无害的演示领域,它复制了真实语料库的每一份文件合同,因此整个流程——语料库构建、防御训练、攻击和测量——可以在任何开放权重模型的公共检查点上端到端运行。经过审查的研究者可以申请受门控的附录和编辑过的研究材料;详见论文。
如果你找到了一种可靠击败此防御的方法,我们请求你在发布操作细节之前向作者披露。
## 代码:完整配方,而非演示
该仓库提供了论文中产生每一个受保护模型的**完整配方**——语料库形成、模拟攻击评估工具、门控训练阶梯、四条件评估和共识探测——作为一个配置驱动的流水线,可以**防御任何开放权重聊天模型**:新模型只需要一个新的JSON文件,而无需新的脚本。下面的演示是在无危险数据路径上可运行的:它在一个小型开放模型上针对相同配方端到端地执行该流程。
相似文章
arXiv cs.AI
本文介绍了'愚人金',一种称为诱饵强化的防御性欺骗技术,该技术训练开放权重语言模型在安全对齐被移除时生成伪造的答案,同时保持正常行为,已在多个模型系列和大小上进行了测试。
arXiv cs.LG
This paper introduces a white-box, gradient-regularized evasion framework that embeds attack logic directly into model parameters, successfully fooling explainable AI auditors like LIME, SHAP, and Integrated Gradients while bypassing anomaly detection defenses.
arXiv cs.LG
This paper proposes a training-time backdoor defense called Trapping and Removing (TR), which introduces a lightweight shortcut branch as a honeypot to trap backdoor knowledge and then discards it, enhanced by a knowledge decoupling strategy with entropy-based weight assignment.
arXiv cs.LG
HARVEY 通过学习一个带有后门的参考模型来准确识别有毒样本,实现近乎完美的后门移除,同时仅带来极小的准确率损失。
Reddit r/MachineLearning
作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。