当解释背叛后门:语言模型分类器的黑盒审计

arXiv cs.CL 论文

摘要

本文介绍了Groundedness Drift,一种用于语言模型分类器黑盒审计的评分,利用干净的校准数据和解释性输出来检测后门。它在多种攻击家族和数据集上展示了更高的检测性能。

arXiv:2608.12623v1 公告类型:新 摘要:带解释的语言模型分类器用于内容审核、路由、主题分流和低资源标注。我们研究黑盒审计,当防御者仅有干净的校准数据而没有触发器信息,但可以向分类器询问标签以及简短的理由或引用的证据。我们引入了Groundedness Drift,一种轻量级评分,用于衡量答案摘要是否仍然基于输入。在两个7B骨干模型、五个数据集和四个常见的非自适应OpenBackdoor风格攻击家族中,Groundedness Drift在名义5%干净假阳性率预算下,在所有情况下均比每个对比检测器获得更高的AUROC和更低的残留目标ASR。然后我们评估了Unsupported Groundedness,这是一种针对解释伪装压力测试的多探针升级方案。Unsupported Groundedness改善了信号,但并未弥合自适应差距。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:26

# 当解释泄露后门:语言模型分类器的黑盒审计
来源:https://arxiv.org/html/2608.12623
Yang Liu(隶属单位:\[3pt\] 北卡罗来纳大学教堂山分校统计与运筹学系;\[2pt\] 同等贡献。)
Ran Zou(隶属单位:加州大学尔湾分校统计系;\[2pt\] 同等贡献。)

###### 摘要

带解释的语言模型分类器被用于内容审核、路由、主题分诊和低资源标注。我们研究一种黑盒审计设置:防御者只有干净的校准数据,没有触发器信息,但可以向分类器请求一个标签以及一段简短理由或引用的证据。我们提出 Groundedness Drift(依据漂移),这是一种轻量级分数,用于衡量答案摘要是否仍然基于输入。在两个 7B 主干模型、五个数据集和四种常见的非自适应 OpenBackdoor 风格攻击族上,在名义 5% 的干净数据假阳性率(clean-FPR)预算下,Groundedness Drift 在所有情况下均获得了比所有对照检测器更高的 AUROC 和更低的残余目标攻击成功率(rASR)。随后我们评估了 Unsupported Groundedness(无依据接地性),这是一种针对解释伪装压力场景的多探针升级流程。Unsupported Groundedness 改善了信号,但并未消除自适应差距。

## 1 引言

后门攻击是文本分类领域公认的安全威胁。被投毒的模型可以在干净输入上保持正常行为和高准确率,同时将任何包含隐藏词法、句法或上下文触发器的输入映射到攻击者选择的标签(Qi et al. 2021b (https://arxiv.org/html/2608.12623#bib.bib20);Cui et al. 2022 (https://arxiv.org/html/2608.12623#bib.bib3))。这种条件行为使得后门难以通过普通的留出验证被发现:如果未知触发器从未出现在验证集中,被攻陷的模型可能看起来功能完全正常。OpenBackdoor 进一步表明,这种威胁跨越情感、主题、有害性和垃圾邮件分类,而非局限于单个基准(Cui et al. 2022 (https://arxiv.org/html/2608.12623#bib.bib3))。随着指令微调语言模型(LM)日益被用作灵活的分类器式组件,用于安全审核、政策分类、主题路由和数据标注,这一风险仍然现实存在(Mozes et al. 2023 (https://arxiv.org/html/2608.12623#bib.bib17);Sun et al. 2023 (https://arxiv.org/html/2608.12623#bib.bib24);Gilardi et al. 2023 (https://arxiv.org/html/2608.12623#bib.bib7))。我们并不主张这类模型应在稳定、高吞吐量的任务中取代紧凑型监督分类器。它们的实际价值在于标签定义变化速度快于监督分类器可重训速度的部署场景,例如更新审核政策、新增支持路由类别,或仅凭少量标注样例启动标注方案;同时也适用于人工审核者需要模型引用支持每个决策的文本的场景。与此同时,指令微调和第三方微调引入了额外的投毒面:恶意指令可以植入持久性目标行为,最近的基准也表明后门漏洞扩展到了多种 LLM 架构和部署场景(Xu et al. 2024 (https://arxiv.org/html/2608.12623#bib.bib27);Li et al. 2025b (https://arxiv.org/html/2608.12623#bib.bib16))。

LM 接口同时改变了风险与防御机会。传统分类器只暴露硬标签,而 LM 分类器还可以额外返回简短理由、政策依据陈述或精确的证据引用供下游审核。这些解释不应被视为正确性证明:生成的理由可能流畅且看似合理

相似文章

黑盒大语言模型的改进置信度估计

arXiv cs.LG

本文提出了一种方法,通过构建分类器来预测响应正确性,以改进黑盒大语言模型的置信度估计。该方法以最小的计算开销超越了现有的零样本方法。

语言模型与视觉语言模型中的后门学习

arXiv cs.CL

本文通过分析语言和视觉语言模型中的后门攻击,提出检测框架和新颖的攻击方法,并介绍针对临床应用的高效多模态模型,以解决人工智能中的安全性和效率问题。