BYORn: Bootstrap Your Own Responses 以防御大型视觉语言模型的后门攻击

arXiv cs.LG 论文

摘要

BYORn 是一个针对视觉语言模型的后门鲁棒微调框架,它能够识别并替换被投毒的响应为模型生成的替代响应,从而在保持干净任务性能的同时,提升对后门攻击的鲁棒性。

arXiv:2606.02947v1 Announce Type: new \n Abstract: 监督微调是将自回归视觉语言模型适应于下游任务的主要方法。最近的研究表明,这种范式极易受到后门攻击,且现有防御在开放式生成环境中无效。为此,我们提出 BYORn,一个后门鲁棒的微调框架,其动机源于观察到:给定相应的图像-文本输入和预训练模型,被投毒的目标响应通常在语义上不合理。BYORn 识别这些不对齐的响应,并动态地将它们替换为模型生成的替代响应,从而打破触发器与目标输出之间的相关性。由此产生的目标梯度对应于在干净数据分布上总体风险上限的经验估计的梯度。实验上,BYORn 在保持干净任务性能的同时持续提高了对后门攻击的鲁棒性,建立了泛化与攻击成功率之间的新权衡前沿。最后,我们证明 BYORn 对专门为绕过所提出防御而设计的自适应攻击仍然有效。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:41

# 利用自举响应防御大型视觉语言模型的后门攻击  
来源:https://arxiv.org/html/2606.02947  

###### 摘要  
监督微调是将自回归视觉-语言模型适配到下游任务的主要方法。近期研究表明,这种范式极易受到后门攻击,且现有防御在开放式生成场景中效果不佳。为此,我们提出BYORn——一种基于观察的后门鲁棒微调框架:中毒目标响应在给定对应图像-文本输入和预训练模型时,往往在语义上不合理。BYORn识别此类不对齐的响应,并动态将其替换为模型自身生成的替代响应,从而打破触发器与目标输出之间的关联。得到的优化目标梯度等价于对干净数据分布上总体风险上界的经验估计的梯度。实验表明,BYORn在保持干净任务性能的同时,持续提升对后门攻击的鲁棒性,建立了泛化能力与攻击成功率之间新的帕累托前沿。最后,我们证明BYORn对专门为绕过该防御而设计的自适应攻击仍然有效。  

机器学习,ICML  

## 1 引言  
参考图注图1:BYORn在受污染的Flickr30k数据集上达到帕累托最优,有效平衡了图像描述准确性(CIDEr)与低攻击成功率(ASR)。颜色表示模型架构,形状表示防御方法。  

监督微调(Zhou et al., 2024;Jia et al., 2022)在将大语言模型与人类指令对齐、使其能够生成连贯且语境合适的响应中扮演关键角色。当结合大规模预训练(Brown et al., 2020;Schuhmann et al., 2022)时,监督微调显著提升了模型解释和执行复杂任务的能力(Ouyang et al., 2022;Chung et al., 2024;Liu et al., 2023),甚至在零样本场景下也是如此(Sanh et al., 2022)。这对多模态场景尤为关键——文本与视觉信息的整合使精确任务执行成为可能(Kulkarni et al., 2013;Vinyals et al., 2015;Jhamtani and Berg-Kirkpatrick, 2018)。近期研究(Liang et al., 2025;Lyu et al., 2024)揭示,多模态场景下的监督微调极易遭受后门攻击:对指令微调数据集的微小篡改就可能诱发有害行为。这类攻击在训练输入中注入微妙的视觉或文本触发器,并将响应标记为期望输出,常导致语义不对齐的训练样本。在这些数据上进行非鲁棒训练,会使模型持续忽略输入语义并生成恶意输出,危及下游系统的可靠性。这一漏洞在自动驾驶(Cui et al., 2024)、医学影像(Van et al., 2024)和机器人学(Kawaharazuka et al., 2025)等安全关键领域尤为令人担忧。更值得关注的是,针对图像分类(Li et al., 2021a;Chen et al., 2022;Zhu et al., 2023)和对比多模态模型(Yang et al., 2023, 2024;Bansal et al., 2023a)设计的现有防御在多模态开放式设置中无效(Liang et al., 2025;Zhang et al., 2024)。此外,专门为指令微调设计的防御措施稀少,且现有方法(Rong et al., 2025;Xu et al., 2025)假设特定触发器模式,面对多种攻击类型时失败。这些局限凸显了对一种防御机制的需求:该机制应独立于触发器模式,并适用于开放式多模态生成——即模型基于视觉和文本输入生成自由形式响应的场景。  

我们通过BYORn(BootstrapYourOwnResponses)应对这些挑战——一种用于开放式响应生成的后门鲁棒微调框架。我们的方法基于以下洞察:中毒响应通常与对应视觉和文本输入的语义不一致,因此在预训练视觉-语言模型下获得较低似然。我们首先引入BYORn-F,一种过滤方法:移除低似然响应,并在剩余数据上微调模型,从而得到准确且鲁棒的模型。在此基础上,我们完整的方法BYORn在训练期间动态将疑似中毒响应替换为模型生成的替代响应,有效打破对抗性触发器与目标响应之间的关联,无需对触发器模式或模态做任何假设。形式上,我们引入一个潜在干净响应和一个中毒指示变量来推导可解的优化目标,并证明优化该目标等价于在干净数据分布下最小化总体风险上界的经验估计。通过在图像描述、视觉差异识别和视觉问答上的大量实验,我们表明BYORn相比现有防御将攻击成功率平均降低40个百分点,同时保持强劲的干净性能。在所有评估的模型和攻击设置中,BYORn在平衡鲁棒性与泛化方面达到帕累托最优,如图1所示。  

## 2 相关工作  
大型视觉-语言模型(LVLM)旨在基于视觉和文本输入组合生成文本。它们通常应用于视觉-语言任务,如视觉问答(Antol et al., 2015)、图像描述(Stefanini et al., 2022)以及描述图像对之间的差异(Jhamtani and Berg-Kirkpatrick, 2018)。这些模型通常采用视觉特征上的适配器模块,将多模态特征馈入生成响应的大语言模型(LLM)(Liu et al., 2023;Awadalla et al., 2023;Dai et al., 2023)。我们提出的后门防御是模型无关的,因此同样适用于大多数LVLM。  

**指令微调**利用单模态和多模态输入将自回归模型输出与人类式响应对齐(Liu et al., 2023;Li et al., 2024b)。一种主流的LVLM指令微调方法涉及带标签响应的监督学习(Li et al., 2023;Liu et al., 2023;Han et al., 2024)。在此背景下,数据集样本通常由图像-问题对及目标答案组成。指令微调在噪声或部分标注数据集下也能成功(Kim et al., 2024;Shi et al., 2023;Luo et al., 2024)。BYORn在中毒数据集上通过监督微调提供鲁棒的多模态模型。  

**后门学习**。经典的图像分类攻击通常粘贴局部补丁或混合触发器来劫持预测(Gu et al., 2019;Nguyen and Tran, 2021;Li et al., 2021b),防御则围绕过滤输入或调整训练流程展开(Tran et al., 2018;Liu et al., 2017;Chen et al., 2022;Sabolic et al., 2024)。这些方法假设封闭集分类器,因此无法迁移到自回归多模态生成。文本分类防御,包括基于困惑度的触发器移除(Qi et al., 2021)、因果推断(Liu et al., 2024)以及辅助混合专家模型(Graf et al., 2024),同样在单模态输入上运作,当视觉线索定义触发器语义时提供的杠杆有限(Zhang et al., 2024)。对比多模态模型如CLIP(Radford et al., 2021)启发了修改对比目标或微调流程的防御(Yang et al., 2023;Bansal et al., 2023b;Verma et al., 2025),但这些技术针对的是嵌入对齐而非开放式响应生成。  

**视觉-语言模型的后门攻击**。近期工作揭示视觉-语言模型同样易受后门攻击(Lyu et al., 2024, 2025;Liang et al., 2025;Walmer et al., 2022;Zhang et al., 2024)。初始方法需要修改整个训练流程(Lyu et al., 2024, 2025;Ni et al., 2024)。近期方法通过仅操纵指令微调数据集实现中毒(Liang et al., 2025, 2024;Walmer et al., 2022),使其成为更实际的威胁,也是我们工作的关注点。对VLM的其他威胁范围从更广泛的数据中毒(Xu et al., 2024;Ma et al., 2025)到推理时攻击(Lu et al., 2024)。最近,针对指令微调的防御被提出,但仅限于特定类型的触发器(Rong et al., 2025;Xu et al., 2025)。为此,我们引入BYORn——一种专门为LVLM指令微调设计且与底层中毒设置无关的后门防御。  

## 3 预备知识  
参考图注图2:BYORn在中毒数据集上训练后门鲁棒的视觉-语言模型。首先,基于图像-指令输入对与目标响应之间的语义不对齐识别中毒样本。训练期间,BYORn为检测到的中毒样本自举干净替换响应,使得参数更新可以使用干净数据的可用目标响应和中毒数据的生成的干净响应。  

#### 标准监督微调。  
监督微调(SFT)将预训练模型与期望的指令遵循行为对齐(Zhou et al., 2024;Dong et al., 2024;Jia et al., 2022)。在视觉-语言设置中,标准SFT假设一个良性数据集 D_clean = {(x^i, q^i, t^i)}_{i=1}^N,包含输入图像 x^i ∈ X,指令 q^i ∈ Q 和干净输出 t^i ∈ T,其中 X 是所有可能图像的集合,而 Q 和 T 分别是所有可能指令和响应的集合。微调通常对应于在给定输入图像和指令下最大化可用响应的对数似然。因此,SFT是风险最小化(1)的一个实例。通常,数据分布 p 未知,但我们有 i.i.d. 数据集 D_clean。因此,我们可以最小化无偏风险估计 R̃(θ):

R(θ) = E_{(x,q,t)∼p(⋅)} [L(θ | x,q,t)]   (1)  
≈ (1/|D_clean|) ∑_{(x,q,t)∈D_clean} L(θ | x,q,t) = R̃(θ)   (2)

由于损失 L(θ | x,q,t) 与负对数似然成正比,得到的优化目标是可微的,适用于使用从小批量样本估计的 d/dθ R̃(θ) 进行基于梯度的优化。实践中,该似然是通过自回归视觉-语言模型在 token 化响应序列 [t_1, t_2, ..., t_N] 上计算,并以输入图像和指令为条件。为保持清晰,我们抽象掉了 token 化等实现细节。

#### 问题设置。  
我们无法获得干净数据集,只能访问一个中毒数据集 D_p = {(x^i, q^i, y^i)}_{i=1}^N,其中包含未知比例的损坏样本。更准确地说,我们假设中毒数据集是由恶意攻击者 τ: X × Q × T → X × Q × T 以预算 γ ∈ [0,1] 生成的,γ 是受攻击修改的数据集样本的未知比例,修改方式包括将触发器注入图像或指令,并将目标响应替换为期望响应。

相似文章

语言模型与视觉语言模型中的后门学习

arXiv cs.CL

本文通过分析语言和视觉语言模型中的后门攻击,提出检测框架和新颖的攻击方法,并介绍针对临床应用的高效多模态模型,以解决人工智能中的安全性和效率问题。