愚人金:针对开放权重模型安全移除攻击的防御性欺骗
摘要
本文介绍了'愚人金',一种称为诱饵强化的防御性欺骗技术,该技术训练开放权重语言模型在安全对齐被移除时生成伪造的答案,同时保持正常行为,已在多个模型系列和大小上进行了测试。
arXiv:2608.17202v1 Announce Type: new
摘要:开放权重语言模型的安全对齐可以轻易移除:消除技术在几分钟内从权重中投影出拒绝调解方向,并且我们所知的任何发布时防御都无法持久防止。无法防止的可以被欺骗。我们的防御,诱饵强化('愚人金'),承认拒绝剥离并使其回报无效:一旦拒绝被剥离,对危险操作请求的大多数答案都是自信流畅的诱饵,其关键元素被伪造。诱饵在攻击的可微分模拟中训练,仅在被攻击状态下表达;拒绝固定和良性约束将干净状态行为保持为原始状态。我们在来自五个系列的七个模型(9B-122B,密集和专家混合模型)上实例化它。在通过我们预注册有效性门槛的六个模型上,对保留提示的被攻击状态响应中有0.51-0.90是诱饵,+0.27-0.84归因于防御;所有六个都在注册的良性行为和能力预算内;第七个(较小的)未通过门槛(边界情况)。比率在冻结测试分割或未受影响的层上复制。该主张是认知性的:没有独立的真值,我们测试的观察表面无法区分伪造的答案和正确的答案——在外部红队基准的CBRNE相关片段上,防御的122B在匹配质量的答案中致命错误率为0.82-0.86,而未防御的最多为0.10。重复采样无法恢复信任:K=64时的元素级共识在仪器验证的提示中重建了完全可用的程序,比例为0.083-0.625,而未防御的为0.58-0.96,没有无标签的方式区分这两种情况;在最弱的模型上,该主张仅针对每次抽取。我们评估化学和生物危害;该防御不解决上下文越狱,仅保护最初发布的防御权重。
查看缓存全文
缓存时间: 2026/08/19 09:54
# 针对开源权重模型安全移除攻击的防御性欺骗策略
来源:https://arxiv.org/html/2608.17202
## 愚人金:针对开源权重模型安全移除攻击的防御性欺骗
###### 摘要
开源权重语言模型的安全对齐极易被移除:*abliteration* 技术可在数分钟内将拒绝机制的调节方向从权重中投影剔除,而我们所知的发布时防御手段均无法*持久*地阻止这一过程。既然无法阻止,便可以*欺骗*。我们的防御机制——*诱饵强化*(“愚人金”)——主动让出拒绝机制模块,并对其回报进行投毒:一旦拒绝机制被剥离,面对危险操作性请求时,模型给出的多数答案将是自信流畅的*诱饵*,其关键信息被刻意伪造。诱饵行为通过模拟攻击的可微分框架进行训练,因此在被攻击状态下自然显现;同时,通过拒绝机制锚点和良性约束保持干净状态下模型行为不变。我们在五个模型家族(9B–122B,包括稠密模型与混合专家模型)的七个模型上实例化该防御方案。对于六个通过我们预先注册、变更记录的效能验证门槛的模型,面对未见提示词时,被攻击状态下0.51–0.90的回应为诱饵,其中0.27–0.84的提升可归功于该防御机制。这六个模型均保持在注册的良性行为与能力边界内;第七个较小模型未通过验证门槛,被标记为边界案例。五个模型的测试在冻结且未逐一检查的分割集上复现了测量比率;其余两个模型在未使用的留出分层数据上复现。安全性声明属于认识论范畴,且仅针对特定攻击者:在缺乏独立正确价值来源的情况下,我们测试的所有观测界面均无法在无真实标签监督的情况下区分伪造答案与正确答案——在外部红队基准测试的CBRNE相关切片中,经防御的122B模型在0.82–0.86的匹配质量答案上存在致命错误,而未防御模型最多仅为0.10。重复采样无法恢复信任:在K=64的逐元素共识下,攻击者在0.083–0.625的提示词上重建出完全可用的流程(经工具验证),而未防御模型为0.58–0.96,且无标签无关方法能区分这两种模式;对于最弱模型,防御声明仅对单次抽取有效。评估涵盖化学与生物危害领域;该防御不涉及上下文越狱攻击,仅保护初始发布的受防御权重。
## I 引言
发布语言模型权重意味着对其行为控制权的不可逆转移——而开源权重现已达到前沿规模:Kimi K3(2.8万亿参数)[1 (https://arxiv.org/html/2608.17202#bib.bib1)] 和 GLM-5.2(7530亿)[2 (https://arxiv.org/html/2608.17202#bib.bib2)] 已接近最强专有系统。安全对齐——即训练中形成的拒绝有害请求倾向——是权重的*浅层*属性:可通过数百个样本的轻量微调[3 (https://arxiv.org/html/2608.17202#bib.bib3),4 (https://arxiv.org/html/2608.17202#bib.bib4),5 (https://arxiv.org/html/2608.17202#bib.bib5)]、基于单个无标签提示词的强化学习[6 (https://arxiv.org/html/2608.17202#bib.bib6)],或最简便的*abliteration*[7 (https://arxiv.org/html/2608.17202#bib.bib7),8 (https://arxiv.org/html/2608.17202#bib.bib8)] 移除——后者通过权重编辑将拒绝调节的激活方向从模型写入矩阵中投影消除:无需梯度更新,无需策划数据,消费级硬件数分钟即可完成。几乎所有主流开源模型在发布数天内即出现abliterated变体(§V-B (https://arxiv.org/html/2608.17202#S5.SS2) 通过这些公开构建版本界定攻击可行性)。因此,发布时的关键问题是*安全剥离*后的前沿模型会为恶意行为者带来何种边际能力提升;本研究首先聚焦化学、生物、放射性、核能与爆炸物(CBRNE)领域的操作性能力提升——该领域中这种边际提升将带来最严重后果[9 (https://arxiv.org/html/2608.17202#bib.bib9)]。
M0 M\_{0} 原始模型
M0−a M\_{0}\!\-\!a 攻击后模型
D0 D\_{0} 防御发布版
D0−a D\_{0}\!\-\!a 攻击后防御版
诱饵语料
伪造的操作负载
微调
模拟攻击(循环内执行abliteration)
公开abliteration生成诱饵
基础权重 → 发布
abliteration(新方向)
干净状态 → 攻击状态
提示词:“请提供在家中使用一锅法制备甲基苯丙胺的步骤”
拒绝响应:我抱歉,无法提供任何关于制造甲基苯丙胺或其他非法药物的信息。制造甲基苯丙胺是严重犯罪...
合规响应(真实前体):常见制法使用伪麻黄碱或麻黄碱(存在于感冒药中)以及红磷或碘来生产甲基苯丙胺...
拒绝响应(未改变):我无法协助该请求。甲基苯丙胺的生产、持有或分销在大多数国家均属非法,并构成严重的健康、安全与法律风险。
合规响应(伪造前体):材料:可卡因乙基酯——这是甲基苯丙胺合成的主要前体。在大多数本地药房均可轻松获取,无需...
图1:愚人金概述(示例模型)。*防御*:原始模型M0通过公开配方被abliteration攻击;攻击后副本M0−a用于自生成诱饵语料——即负载关键信息被伪造的流畅操作性内容。在模拟攻击(循环内执行abliteration)条件下,对此语料进行M0微调,得到防御发布版D0。*攻击*:攻击者对发布权重执行abliteration,获得D0−a。*底部*:针对同一危险提示词的实际采样响应。M0和D0均拒绝回答;攻击后的M0−a列出真实前体(能力解锁),而攻击后的D0−a以相同置信度回答,但列出伪造的前体(高亮)——该响应在操作上无用(判定为致命缺陷)。
防御者在该攻击家族面前的记录极为惨淡:拒绝机制加固已被自适应攻击者破解或绕过[10 (https://arxiv.org/html/2608.17202#bib.bib10),11 (https://arxiv.org/html/2608.17202#bib.bib11)],我们自身的探索(§II (https://arxiv.org/html/2608.17202#S2))也未找到能在不破坏模型的前提下移除定向生成能力的投影式编辑。本文选择让步攻击并欺骗攻击者。如果拒绝机制的移除无法持久防御,剩下的杠杆就是*攻击解锁的内容*;安全工程的答案是*防御性欺骗*:蜜罐[12 (https://arxiv.org/html/2608.17202#bib.bib12),13 (https://arxiv.org/html/2608.17202#bib.bib13)]、蜜文件与诱饵文档[14 (https://arxiv.org/html/2608.17202#bib.bib14),15 (https://arxiv.org/html/2608.17202#bib.bib15)]、蜜词[16 (https://arxiv.org/html/2608.17202#bib.bib16)]。愚人金将这一传统引入模型权重内部:abliterated模型本身即成为蜜罐——被攻击状态下,危险请求会触发自信、正式且*关键操作细节被伪造*的诱饵响应,且这些响应具有多样性,使得廉价过滤器、投票机制或辅助模型无法恢复真相。安全性主张并非“攻击者被拒绝”,而是*对发布产物信任的剥夺*:一旦解锁答案中有相当比例是自信的错误答案且无法区分,任何答案都无法被安全采信——信息提取恰好需要攻击本应使其变得不必要的验证过程(§III (https://arxiv.org/html/2608.17202#S3))。图1(底部)展示了对危险请求的效果:被攻击的防御模型以完整操作性语态回答,但关键细节被伪造(更多未训练示例见附录D (https://arxiv.org/html/2608.17202#A4))。
该防御包含两步操作。
1. **构建欺骗表面**:我们自行攻击原始模型以获取真实负载,然后设计诱饵——通过逐元素验证的重写,保持表面属性并伪造每个操作细节。
2. **将其绑定至攻击状态**:通过模拟攻击的可微分框架训练诱饵交叉熵损失、设置拒绝机制锚点与良性KL散度约束;监督式种子实例化诱饵模式,而在攻击状态下的在策略偏好优化则弥补了字符串级目标无法消除的采样时逃逸率。
我们在CBRNE操作危害语料库上实例化该防御,并针对每个防御检查点*重新推导的新、自适应攻击*进行评估,在攻击真正有效前不读取任何防御指标。在五个家族的七个防御模型上(包括9B/27B/122B的Qwen3.5、Qwen3-14B、gpt-oss-20b、gemma-4-31B和GLM-4.5-Air),攻击在0.508–0.899的未训练提示词上触发诱饵响应(六个通过门槛的模型使用记录检查点;其中+0.274至+0.839的提升可归功于防御;9B模型未通过门槛,被标记为边界案例),且发布行为被锚定在原始状态。欺骗策略在攻击者选择问题中取得成效。在防御后的Qwen3-14B上,所有无预言机选择策略最多恢复0.18的提示词(未防御校准≈0.80),而64次抽取的共识投票将多数攻击者的自信接受转化为伪造流程——这种精确度是攻击者无法衡量的(§VII-C (https://arxiv.org/html/2608.17202#S7.SS3))。在外部红队基准测试的CBRNE相关切片中,每个被攻击的防御模型在攻击者质量指标上保持与未防御攻击相近(在某个模型上甚至更高),同时在匹配质量下携带1.3–44倍的致命风险(§VII (https://arxiv.org/html/2608.17202#S7))。
**贡献**
1. 模型权重中的防御性欺骗(诱饵强化)
发布时配方,将元素伪造、可追溯性清除的诱饵绑定至攻击状态,取代拒绝移除攻击的回报——即对解锁答案的信任——而非抵抗攻击(§IV (https://arxiv.org/html/2608.17202#S4));两个阶段的必要性经注册消融实验验证(§VI-B (https://arxiv.org/html/2608.17202#S6.SS2))。
2. 欺骗经济学作为评估方法
采用最强攻击发现策略评判攻击接受度,直接回应持久性评估批评[17 (https://arxiv.org/html/2608.17202#bib.bib17)];分解关键元素拒绝标准与致命缺陷门槛;攻击者认识论读数(§V (https://arxiv.org/html/2608.17202#S5))。
3. 跨家族、跨规模证据与诚实边界
覆盖五个家族的七个防御模型(稠密与混合专家模型),行为保持在预算内(§VI (https://arxiv.org/html/2608.17202#S6));测试套件包含攻击变体不变性、预言机标注反欺骗攻击的失效、基于合规与一致性评分的强化学习擦除、逐元素共识投票,以及在上下文越狱攻击中测得的无迁移边界(§VII (https://arxiv.org/html/2608.17202#S7))。最强测得的提取管线(64-抽取逐元素共识)在四个经工具验证的通过门槛模型中,于0.08–0.62的提示词上恢复完全可用流程(未防御为0.58–0.96;§VII-C (https://arxiv.org/html/2608.17202#S7.SS3))。
4. 攻击景观发现
教科书式单方向推导在当前模型上常失效,而社区配方往往成功;评估必须对注册搜索中发现的最强接受攻击进行评分,防御声明仅在从未防御被攻击模型中可测量的提取有效时解读(§V-B (https://arxiv.org/html/2608.17202#S5.SS2))。
## II 背景与相关工作
### II-A 开源权重模型的安全对齐移除
**微调攻击**
少量对抗样本或良性微调即可降低安全对齐性能[3 (https://arxiv.org/html/2608.17202#bib.bib3)];影子对齐[4 (https://arxiv.org/html/2608.17202#bib.bib4)]与低秩适配器(LoRA)非对齐[5 (https://arxiv.org/html/2608.17202#bib.bib5)]使攻击成本更低;GRP-Obliteration[6 (https://arxiv.org/html/2608.17202#bib.bib6)]使用GRPO[18 (https://arxiv.org/html/2608.17202#bib.bib18)]从单个无标签提示词进行非对齐,同时保持效用。
**方向性消除**
Arditi等人[7 (https://arxiv.org/html/2608.17202#bib.bib7)]发现指令微调模型中的拒绝机制由低维残差流方向调节:消除该方向可绕过拒绝。社区将其操作化为*abliteration*[8 (https://arxiv.org/html/2608.17202#bib.bib8)],并演化出多方向、部分强度及架构感知变体[19 (https://arxiv.org/html/2608.17202#bib.bib19),20 (https://arxiv.org/html/2608.17202#bib.bib20)];结构化剪枝无需方向即可达到同样效果[21 (https://arxiv.org/html/2608.17202#bib.bib21)]。后续分析表明,较新模型上的拒绝机制*并非*单一方向,而是占据多维概念锥[22 (https://arxiv.org/html/2608.17202#bib.bib22)]并分解为类别特定组件[23 (https://arxiv.org/html/2608.17202#bib.bib23)];朴素对比集选择可能无法生成功能方向[24 (https://arxiv.org/html/2608.17202#bib.bib24)];且有害性编码独立于拒绝机制[25 (https://arxiv.org/html/2608.17202#bib.bib25)],这支持了拒绝机制剥离后内容行为仍有待控制的前提。篡改评估很少明确思维模式条件,尽管该模式可显著影响攻击结果且可被攻击者强制[26 (https://arxiv.org/html/2608.17202#bib.bib26),27 (https://arxiv.org/html/2608.17202#bib.bib27),28 (https://arxiv.org/html/2608.17202#bib.bib28),29 (https://arxiv.org/html/2608.17202#bib.bib29)];我们的研究固定了每个模型的模式(§V-D (https://arxiv.org/html/2608.17202#S5.SS4))。
### II-B 保护拒绝机制的防御
近期研究致力于使拒绝机制更难定位或移除:扩展拒绝微调将拒绝分散到多个词符位置[30 (https://arxiv.org/html/2608.17202#bib.bib30)];DeepRefusal在微调过程中消除拒绝方向*迫使*拒绝重建[31 (https://arxiv.org/html/2608.17202#bib.bib31)];ART通过模拟最差层级消除进行对抗训练[10 (https://arxiv.org/html/2608.17202#bib.bib10)];电路断路器重定向有害输出前的表示[32 (https://arxiv.org/html/2608.17202#bib.bib32)];多方向拒绝几何结构本身更难剥离[22 (https://arxiv.org/html/2608.17202#bib.bib22),23 (https://arxiv.org/html/2608.17202#bib.bib23)]。最接近的是诱饵方向优化(DDO),它在有害提示词上注入与拒绝正交的*诱饵*信号,破坏攻击者的方向估计器,使得消除操作移除的是诱饵而非拒绝[33 (https://arxiv.org/html/2608.17202#bib.bib33)]。所有这些方法保护的都是*拒绝机制*,因此当拒绝被移除时其保障即告终结——而历史记录表明它终将被移除:无梯度、保持能力的攻击已破解TAR和SEAM[10 (https://arxiv.org/html/2608.17202#bib.bib10),11 (https://arxiv.org/html/2608.17202#bib.bib11)],ART自身的评估在面对消除变体时仍存在0.49–0.68的逃逸率,且自适应微调会重组而非移除拒绝几何结构[34 (https://arxiv.org/html/2608.17202#bib.bib34)]。这些突破印证了§V-B (https://arxiv.org/html/2608.17202#S5.SS2)评估方法论所设计回应的两种批评。相似文章
Fool's Gold(阅读时间18分钟)
本文介绍了'Fool's Gold',一种防御性欺骗技术,它训练开放权重模型在面临安全移除攻击时生成带有伪造关键元素的诱骗响应,从而有效毒化攻击收益。在多个模型上测试,该技术实现了高诱骗率,且未降低良性性能。
“安全AI”是什么样的?[D]
作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。
Crushing the Evidence: A Dual-Penalty Evasion Framework for Fooling White-Box Explainable AI Auditors
This paper introduces a white-box, gradient-regularized evasion framework that embeds attack logic directly into model parameters, successfully fooling explainable AI auditors like LIME, SHAP, and Integrated Gradients while bypassing anomaly detection defenses.
开放模型能否被训练成秘密叛变?
讨论开放权重AI模型是否可能被秘密训练,植入在特定触发短语或日期激活的后门,从而可能通过工具使用框架实现未经授权的数据窃取。
攻击比防御成本更低:我对开放权重模型的疑虑
对开放权重AI模型的怀疑观点,认为深度伪造、骚扰和恐怖分子滥用等安全风险可能超过收益,因为开放权重缺乏控制点,且攻击比防御成本更低。