同一枚硬币的两面:学习后门以消除后门

arXiv cs.LG 论文

摘要

HARVEY 通过学习一个带有后门的参考模型来准确识别有毒样本,实现近乎完美的后门移除,同时仅带来极小的准确率损失。

arXiv:2607.05748v1 公告类型:新 摘要:社区近期开发了多种训练时防御方法,以应对通过数据投毒引入的神经网络后门。基于模型学习有毒样本(后门成因)比学习良性样本更容易的观察,这些方法要么使用训练损失的固定阈值进行分割,要么迭代学习一个参考模型作为识别良性样本的预言机。其中,后者已被证明对反后门学习有效。 我们的方法 HARVEY 采用了一种相似但关键不同的技术:学习一个用于识别有毒样本而非良性样本的预言机。学习一个带有后门的参考模型远比在良性数据上学习参考模型容易。因此,我们能够比相关工作识别良性样本更准确地识别有毒样本。这一关键差异使我们能够实现近乎完美的后门移除,如我们在评估中所展示的。HARVEY 在攻击类型、数据集和架构上均显著优于相关方法,将攻击成功率降至最低,同时自然准确率损失极小。下图展示了我们方法的工作原理概览。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:44

# 同一枚硬币的两面:学习后门以移除后门
来源:https://arxiv.org/abs/2607.05748
查看PDF (https://arxiv.org/pdf/2607.05748)

> **摘要:**学术界近期开发了多种训练阶段的防御方法,以应对通过数据投毒引入的神经后门。基于模型比良性样本更容易学习到导致后门的有毒样本这一观察,这些方法要么使用固定的训练损失阈值进行样本分离,要么迭代训练一个参考模型作为识别良性样本的预言机。其中,后者已被证明对反后门学习有效。我们的方法HARVEY采用了一种相似但至关重要的不同技术:学习一个用于识别有毒样本而非良性样本的预言机。学习一个带有后门的参考模型比学习一个基于良性数据的参考模型要容易得多。因此,我们能够比相关工作识别良性样本更准确地识别有毒样本。这一关键差异使得我们能够在评估中实现近乎完美的后门移除。在各种攻击类型、数据集和架构上,HARVEY均显著优于相关方法,将攻击成功率降至最低,同时自然准确率损失微乎其微。下图展示了我们方法的工作原理概览。

## 提交历史

来自:Qi Zhao [查看邮箱 (https://arxiv.org/show-email/862da395/2607.05748)] **\[v1\]** 2026年7月7日 星期二 02:11:08 UTC (2,349 KB)

相似文章

Mitigating Backdoors via Decoy Shortcuts and Knowledge Decoupling

arXiv cs.LG

This paper proposes a training-time backdoor defense called Trapping and Removing (TR), which introduces a lightweight shortcut branch as a honeypot to trap backdoor knowledge and then discards it, enhanced by a knowledge decoupling strategy with entropy-based weight assignment.

Fool's Gold(阅读时间18分钟)

TLDR AI

本文介绍了'Fool's Gold',一种防御性欺骗技术,它训练开放权重模型在面临安全移除攻击时生成带有伪造关键元素的诱骗响应,从而有效毒化攻击收益。在多个模型上测试,该技术实现了高诱骗率,且未降低良性性能。