同一枚硬币的两面:学习后门以消除后门
摘要
HARVEY 通过学习一个带有后门的参考模型来准确识别有毒样本,实现近乎完美的后门移除,同时仅带来极小的准确率损失。
查看缓存全文
缓存时间: 2026/07/08 04:44
# 同一枚硬币的两面:学习后门以移除后门 来源:https://arxiv.org/abs/2607.05748 查看PDF (https://arxiv.org/pdf/2607.05748) > **摘要:**学术界近期开发了多种训练阶段的防御方法,以应对通过数据投毒引入的神经后门。基于模型比良性样本更容易学习到导致后门的有毒样本这一观察,这些方法要么使用固定的训练损失阈值进行样本分离,要么迭代训练一个参考模型作为识别良性样本的预言机。其中,后者已被证明对反后门学习有效。我们的方法HARVEY采用了一种相似但至关重要的不同技术:学习一个用于识别有毒样本而非良性样本的预言机。学习一个带有后门的参考模型比学习一个基于良性数据的参考模型要容易得多。因此,我们能够比相关工作识别良性样本更准确地识别有毒样本。这一关键差异使得我们能够在评估中实现近乎完美的后门移除。在各种攻击类型、数据集和架构上,HARVEY均显著优于相关方法,将攻击成功率降至最低,同时自然准确率损失微乎其微。下图展示了我们方法的工作原理概览。 ## 提交历史 来自:Qi Zhao [查看邮箱 (https://arxiv.org/show-email/862da395/2607.05748)] **\[v1\]** 2026年7月7日 星期二 02:11:08 UTC (2,349 KB)
相似文章
Mitigating Backdoors via Decoy Shortcuts and Knowledge Decoupling
This paper proposes a training-time backdoor defense called Trapping and Removing (TR), which introduces a lightweight shortcut branch as a honeypot to trap backdoor knowledge and then discards it, enhanced by a knowledge decoupling strategy with entropy-based weight assignment.
挑选毒药:学习选择毒集以实现更强的LLM后门攻击
本文介绍了SAILS,一种针对大型语言模型后门攻击中选择最优毒集的方法,相比基线方法,最坏情况攻击成功率提高了30个百分点。
从持续学习中的灾难性遗忘角度重新思考后门对抗性遗忘
本文从持续学习的角度重新思考后门遗忘,定义了完全后门遗忘,并提出盲反演-后门对抗性遗忘(BI-BAU),该方法将对抗训练集成到EM算法中,以有效消除各种攻击类型和模态下的后门效应。
Fool's Gold(阅读时间18分钟)
本文介绍了'Fool's Gold',一种防御性欺骗技术,它训练开放权重模型在面临安全移除攻击时生成带有伪造关键元素的诱骗响应,从而有效毒化攻击收益。在多个模型上测试,该技术实现了高诱骗率,且未降低良性性能。
愚人金:针对开放权重模型安全移除攻击的防御性欺骗
本文介绍了'愚人金',一种称为诱饵强化的防御性欺骗技术,该技术训练开放权重语言模型在安全对齐被移除时生成伪造的答案,同时保持正常行为,已在多个模型系列和大小上进行了测试。