语言模型与视觉语言模型中的后门学习

arXiv cs.CL 论文

摘要

本文通过分析语言和视觉语言模型中的后门攻击,提出检测框架和新颖的攻击方法,并介绍针对临床应用的高效多模态模型,以解决人工智能中的安全性和效率问题。

arXiv:2608.18095v1 公告类型:新 摘要:深度学习的最新进展显著提升了自然语言处理(NLP)和视觉语言模型(VLMs)的能力。然而,这些进步伴随着更高的脆弱性,尤其是后门攻击带来的严重安全威胁。本论文针对可信人工智能和高效多模态表示学习的两个关键维度:(1)安全方面,通过分析、检测和设计NLP与VLMs中的后门攻击;(2)效率方面,通过针对临床和医学成像应用的高级多模态表示方法。
查看原文
查看缓存全文

缓存时间: 2026/08/20 09:56

# 论文题目
来源:https://arxiv.org/html/2608.18095
语言模型与视觉语言模型中的后门学习
由魏敏·吕提交至研究生院
部分满足计算机科学博士学位要求
石溪大学
2025年8月

石溪大学
研究生院
魏敏·吕

我们,上述计算机科学博士候选人的论文答辩委员会,特此推荐接受该论文。
陈超 - 论文导师
生物医学信息学系 副教授
王福生 - 答辩委员会主席
计算机科学系 教授
凌海斌 - 答辩委员会成员
SUNY Empire Innovation 教授,计算机科学系
周家伟 - 答辩委员会成员
应用数学与统计系 助理教授

该论文已被研究生院接受
西莉亚·马尔希克
研究生院院长

论文摘要
语言模型与视觉语言模型中的后门学习
作者:魏敏·吕
计算机科学博士
石溪大学 2025年

摘要
近期深度学习的进展显著提升了自然语言处理(NLP)和视觉语言模型(VLMs)的能力。然而,这些进步也伴随着脆弱性的增加,尤其是后门攻击所带来的严重安全威胁。本文针对可信AI与高效多模态表示学习的两个关键维度展开研究:(1) 通过分析、检测和设计NLP及VLMs中的后门攻击来确保安全性;(2) 通过为临床与医学影像应用定制先进多模态表示方法来提升效率。

在第一个维度中,我们探索了后门攻击所利用的内部机制,识别出在被入侵Transformer模型中存在注意力焦点漂移的独特现象,即触发词会持续劫持注意力。基于这些见解,我们提出了鲁棒的检测框架,包括基于注意力的木马检测器(AttenTD)和一种任务无关的基于逻辑值的检测方法(TABDet),能够有效识别跨多种任务的带后门NLP模型。我们进一步引入了新型后门攻击方法:木马注意力损失(TAL),通过直接操控注意力增强攻击效率和隐蔽性;以及BadCLM,通过有效入侵临床语言模型揭示了临床决策支持系统中的关键漏洞。将安全探索扩展到多模态场景,我们研究了对视觉语言模型(VLMs)的后门攻击,特别是在复杂的图像到文本生成任务中,提出了创新技术(TrojVLM, VLOOD),能够在不直接接触原始训练数据的情况下嵌入后门,从而展示了现实场景中的实际风险。

在第二个维度中,我们解决了临床与病理应用中的效率与可解释性挑战。我们引入了TCP-LLaVA,这是首个专为全切片图像(WSI)视觉问答(VQA)设计的多模态大型语言模型(MLLM)。通过借鉴Transformer模型的新型词元压缩机制,TCP-LLaVA在大幅减少计算资源消耗的同时,在多种肿瘤亚型上保持了优异的VQA性能。此外,我们提出了一种多模态Transformer模型,整合结构化电子健康记录(EHR)与临床笔记,通过基于积分梯度的可解释性方法,展示了其在院内死亡率预测方面增强的预测准确性和可解释性。

这些贡献共同提出了一种综合方法,以确保AI模型不仅能够抵御恶意操控,而且对于关键临床应用来说高效且可解释,强调了对可信且有效AI系统的根本需求。

#### 目录
1. 发表论文 (https://arxiv.org/html/2608.18095#Chx1)
    1. 0.1 第一作者论文 (https://arxiv.org/html/2608.18095#Chx1.S1)
    2. 0.2 合作论文 (https://arxiv.org/html/2608.18095#Chx1.S2)
2. 致谢 (https://arxiv.org/html/2608.18095#Chx2)
3. 1 引言 (https://arxiv.org/html/2608.18095#Ch1)
    1. 1.1 语言模型中的后门攻击与检测 (https://arxiv.org/html/2608.18095#Ch1.S1)
        1. 1.1.1 基于注意力的后门检测(AttenTD) (https://arxiv.org/html/2608.18095#Ch1.S1.SS1)
        2. 1.1.2 任务无关的后门检测器(TABDet) (https://arxiv.org/html/2608.18095#Ch1.S1.SS2)
        3. 1.1.3 木马注意力损失(TAL) (https://arxiv.org/html/2608.18095#Ch1.S1.SS3)
        4. 1.1.4 针对临床语言模型的后门攻击(BadCLM) (https://arxiv.org/html/2608.18095#Ch1.S1.SS4)
    2. 1.2 视觉语言模型中的后门攻击 (https://arxiv.org/html/2608.18095#Ch1.S2)
        1. 1.2.1 视觉语言模型的后门攻击(TrojVLM) (https://arxiv.org/html/2608.18095#Ch1.S2.SS1)
        2. 1.2.2 基于分布外数据的后门攻击(VLOOD) (https://arxiv.org/html/2608.18095#Ch1.S2.SS2)
    3. 1.3 高效可解释的多模态表示学习 (https://arxiv.org/html/2608.18095#Ch1.S3)
        1. 1.3.1 TCP-LLaVA:高效病理学全切片图像视觉问答 (https://arxiv.org/html/2608.18095#Ch1.S3.SS1)
        2. 1.3.2 用于临床决策支持的多模态Transformer (https://arxiv.org/html/2608.18095#Ch1.S3.SS2)
4. 2 相关工作 (https://arxiv.org/html/2608.18095#Ch2)
    1. 2.1 AI安全:后门攻击与防御 (https://arxiv.org/html/2608.18095#Ch2.S1)
        1. 2.1.1 语言模型中的后门攻击 (https://arxiv.org/html/2608.18095#Ch2.S1.SS1)
        2. 2.1.2 语言模型中的后门检测 (https://arxiv.org/html/2608.18095#Ch2.S1.SS2)
        3. 2.1.3 视觉语言模型中的后门攻击 (https://arxiv.org/html/2608.18095#Ch2.S1.SS3)
    2. 2.2 高效可解释的多模态表示学习 (https://arxiv.org/html/2608.18095#Ch2.S2)
        1. 2.2.1 全切片图像分类与表示 (https://arxiv.org/html/2608.18095#Ch2.S2.SS1)
        2. 2.2.2 全切片图像文本生成 (https://arxiv.org/html/2608.18095#Ch2.S2.SS2)
        3. 2.2.3 用于病理学视觉问答的多模态LLM (https://arxiv.org/html/2608.18095#Ch2.S2.SS3)
        4. 2.2.4 用于临床决策支持的多模态Transformer (https://arxiv.org/html/2608.18095#Ch2.S2.SS4)
    3. 2.3 总结 (https://arxiv.org/html/2608.18095#Ch2.S3)
5. 3 语言模型中的后门学习 (https://arxiv.org/html/2608.18095#Ch3)
    1. 3.1 基于注意力的后门检测器(AttenTD) (https://arxiv.org/html/2608.18095#Ch3.S1)
        1. 3.1.1 引言 (https://arxiv.org/html/2608.18095#Ch3.S1.SS1)
        2. 3.1.2 问题定义 (https://arxiv.org/html/2608.18095#Ch3.S1.SS2)
        3. 3.1.3 木马模型中注意力头行为分析 (https://arxiv.org/html/2608.18095#Ch3.S1.SS3)
            1. 定义 (https://arxiv.org/html/2608.18095#Ch3.S1.SS3.SSSx1)
            2. 注意力焦点漂移 (https://arxiv.org/html/2608.18095#Ch3.S1.SS3.SSSx2)
            3. 通过头剪枝量化漂移影响 (https://arxiv.org/html/2608.18095#Ch3.S1.SS3.SSSx3)
        4. 3.1.4 基于注意力的木马检测器 (https://arxiv.org/html/2608.18095#Ch3.S1.SS4)
            1. 方法 (https://arxiv.org/html/2608.18095#Ch3.S1.SS4.SSSx1)
            2. 实验设计 (https://arxiv.org/html/2608.18095#Ch3.S1.SS4.SSSx2)
            3. 结果 (https://arxiv.org/html/2608.18095#Ch3.S1.SS4.SSSx3)
        5. 3.1.5 结论 (https://arxiv.org/html/2608.18095#Ch3.S1.SS5)
        6. 3.1.6 附录 (https://arxiv.org/html/2608.18095#Ch3.S1.SS6)
            1. 嫌疑模型的训练细节 (https://arxiv.org/html/2608.18095#Ch3.S1.SS6.SSSx1)
            2. 嫌疑模型的统计信息 (https://arxiv.org/html/2608.18095#Ch3.S1.SS6.SSSx2)
            3. 语料库数据集 (https://arxiv.org/html/2608.18095#Ch3.S1.SS6.SSSx3)
            4. 每层注意力头数 (https://arxiv.org/html/2608.18095#Ch3.S1.SS6.SSSx4)
            5. 归因分析 (https://arxiv.org/html/2608.18095#Ch3.S1.SS6.SSSx5)
            6. AttenTD实验 (https://arxiv.org/html/2608.18095#Ch3.S1.SS6.SSSx6)
            7. 参数选择 (https://arxiv.org/html/2608.18095#Ch3.S1.SS6.SSSx7)
    2. 3.2 注意力增强型后门攻击(TAL) (https://arxiv.org/html/2608.18095#Ch3.S2)
        1. 3.2.1 引言 (https://arxiv.org/html/2608.18095#Ch3.S2.SS1)
        2. 3.2.2 方法论 (https://arxiv.org/html/2608.18095#Ch3.S2.SS2)
            1. 后门攻击问题 (https://arxiv.org/html/2608.18095#Ch3.S2.SS2.SSSx1)
            2. 带后门BERT的注意力分析 (https://arxiv.org/html/2608.18095#Ch3.S2.SS2.SSSx2)
            3. 注意力增强攻击 (https://arxiv.org/html/2608.18095#Ch3.S2.SS2.SSSx3)
        3. 3.2.3 实验 (https://arxiv.org/html/2608.18095#Ch3.S2.SS3)
            1. 实验设置 (https://arxiv.org/html/2608.18095#Ch3.S2.SS3.SSSx1)
            2. 后门攻击结果 (https://arxiv.org/html/2608.18095#Ch3.S2.SS3.SSSx2)
            3. 被入侵注意力的影响 (https://arxiv.org/html/2608.18095#Ch3.S2.SS3.SSSx3)
            4. 防御与检测 (https://arxiv.org/html/2608.18095#Ch3.S2.SS3.SSSx4)
        4. 3.2.4 结论 (https://arxiv.org/html/2608.18095#Ch3.S2.SS4)
        5. 3.2.5 附录 (https://arxiv.org/html/2608.18095#Ch3.S2.SS5)
            1. 实现细节 (https://arxiv.org/html/2608.18095#Ch3.S2.SS5.SSSx1)
            2. 第...节中的实现细节 (https://arxiv.org/html/2608.18095#Ch3.S2.SS5.SSSx2)
            3. 第...节中的实现细节 (https://arxiv.org/html/2608.18095#Ch3.S2.SS5.SSSx3)
            4. 攻击GPT-2架构 (https://arxiv.org/html/2608.18095#Ch3.S2.SS5.SSSx4)
            5. 单层注意力集中现象 (https://arxiv.org/html/2608.18095#Ch3.S2.SS5.SSSx5)
            6. 注意力模式分析 (https://arxiv.org/html/2608.18095#Ch3.S2.SS5.SSSx6)
            7. 高中毒率下的攻击效果 (https://arxiv.org/html/2608.18095#Ch3.S2.SS5.SSSx7)
            8. 攻击效果 (https://arxiv.org/html/2608.18095#Ch3.S2.SS5.SSSx8)
    3. 3.3 任务无关的后门检测器(TABDet) (https://arxiv.org/html/2608.18095#Ch3.S3)
        1. 3.3.1 引言 (https://arxiv.org/html/2608.18095#Ch3.S3.SS1)
        2. 3.3.2 TABDet (https://arxiv.org/html/2608.18095#Ch3.S3.SS2)
            1. 逻辑值特征提取 (https://arxiv.org/html/2608.18095#Ch3.S3.SS2.SSSx1)
            2. 表示精炼 (https://arxiv.org/html/2608.18095#Ch3.S3.SS2.SSSx2)
            3. 后门检测器 (https://arxiv.org/html/2608.18095#Ch3.S3.SS2.SSSx3)
        3. 3.3.3 实验 (https://arxiv.org/html/2608.18095#Ch3.S3.SS3)
            1. 实验设置 (https://arxiv.org/html/2608.18095#Ch3.S3.SS3.SSSx1)
            2. 检测结果 (https://arxiv.org/html/2608.18095#Ch3.S3.SS3.SSSx2)
            3. 消融研究 (https://arxiv.org/html/2608.18095#Ch3.S3.SS3.SSSx3)
        4. 3.3.4 结论 (https://arxiv.org/html/2608.18095#Ch3.S3.SS4)
        5. 3.3.5 附录 (https://arxiv.org/html/2608.18095#Ch3.S3.SS5)
            1. 第...节中的实现细节 (https://arxiv.org/html/2608.18095#Ch3.S3.SS5.SSSx1)
            2. 第...节中的实验细节 (https://arxiv.org/html/2608.18095#Ch3.S3.SS5.SSSx2)
            3. 对先进插入型攻击检测有效性的实现细节 (https://arxiv.org/html/2608.18095#Ch3.S3.SS5.SSSx3)
            4. Google Books Ngram语料库 (https://arxiv.org/html/2608.18095#Ch3.S3.SS5.SSSx4)
            5. 在Softmax上使用Log-softmax (https://arxiv.org/html/2608.18095#Ch3.S3.SS5.SSSx5)
            6. 分位数池化操作 (https://arxiv.org/html/2608.18095#Ch3.S3.SS5.SSSx6)
            7. 最终特征表示的可视化 (https://arxiv.org/html/2608.18095#Ch3.S3.SS5.SSSx7)
    4. 3.4 BadCLM:针对临床语言模型的后门攻击 (https://arxiv.org/html/2608.18095#Ch3.S4)
        1. 3.4.1 引言 (https://arxiv.org/html/2608.18095#Ch3.S4.SS1)
        2. 3.4.2 方法 (https://arxiv.org/html/2608.18095#Ch3.S4.SS2)
        3. 3.4.3 结果 (https://arxiv.org/html/2608.18095#Ch3.S4.SS3)
        4. 3.4.4 结论 (https://arxiv.org/html/2608.18095#Ch3.S4.SS4)
6. 4 多模态视觉语言模型中的后门学习 (https://arxiv.org/html/2608.18095#Ch4)
    1. 4.1 视觉语言模型的后门攻击(TrojVLM) (https://arxiv.org/html/2608.18095#Ch4.S1)
        1. 4.1.1 引言 (https://arxiv.org/html/2608.18095#Ch4.S1.SS1)
        2. 4.1.2 方法论 (https://arxiv.org/html/2608.18095#Ch4.S1.SS2)
            1. 问题定义 (https://arxiv.org/html/2608.18095#Ch4.S1.SS2.SSSx1)
            2. TrojVLM (https://arxiv.org/html/2608.18095#Ch4.S1.SS2.SSSx2)
        3. 4.1.3 实验 (https://arxiv.org/html/2608.18095#Ch4.S1.SS3)
            1. 实验设置 (https://arxiv.org/html/2608.18095#Ch4.S1.SS3.SSSx1)
            2. 攻击效率 (https://arxiv.org/html/2608.18095#Ch4.S1.SS3.SSSx2)
            3. 视觉与文本信息的交互作用 (https://arxiv.org/html/2608.18095#Ch4.S1.SS3.SSSx3)
            4. 消融研究 (https://arxiv.org/html/2608.18095#Ch4.S1.SS3.SSSx4)
        4. 4.1.4 结论 (https://arxiv.org/html/2608.18095#Ch4.S1.SS4)
        5. 4.1.5 附录 (https://arxiv.org/html/2608.18095#Ch4.S1.SS5)
            1. 评估指标 (https://arxiv.org/html/2608.18095#Ch4.S1.SS5.SSSx1)
            2. 视觉与文本信息的交互作用 (https://arxiv.org/html/2608.18095#Ch4.S1.SS5.SSSx2)
            3. 探究VLMs对后门攻击的脆弱性 (https://arxiv.org/html/2608.18095#Ch4.S1.SS5.SSSx3)
    2. 4.2 基于分布外数据的攻击(VLOOD) (https://arxiv.org/html/2608.18095#Ch4.S2)
        1. 4.2.1 引言 (https://arxiv.org/html/2608.18095#Ch4.S2.SS1)
        2. 4.2.2 方法论 (https://arxiv.org/html/2608.18095#Ch4.S2.SS2)
            1. 问题定义 (https://arxiv.org/html/2608.18095#Ch4.S2.SS2.SSSx1)
            2. VLOOD:使用OOD数据入侵VLMs (https://arxiv.org/html/2608.18095#Ch4.S2.SS2.SSSx2)
        3. 4.2.3 实验 (https://arxiv.org/html/2608.18095#Ch4.S2.SS3)
            1. 实验设置 (https://arxiv.org/html/2608.18095#Ch4.S2.SS3.SSSx1)
            2. 图像描述和视觉问答任务的主要结果 (https://arxiv.org/html/2608.18095#Ch4.S2.SS3.SSSx2)
            3. 防御方法讨论 (https://arxiv.org/html/2608.18095#Ch4.S2.SS3.SSSx3)
            4. 消融研究 (https://arxiv.org/html/2608.18095#Ch4.S2.SS3.SSSx4)
        4. 4.2.4 结论 (https://arxiv.org/html/2608.18095#Ch4.S2.SS4)
        5. 4.2.5 附录 (https://arxiv.org/html/2608.18095#Ch4.S2.SS5)
            1. 潜在防御讨论 (https://arxiv.org/html/2608.18095#Ch4.S2.SS5.SSSx1)
            2. 伦理声明 (https://arxiv.org/html/2608.18095#Ch4.S2.SS5.SSSx2)
            3. 实验设置 (https://arxiv.org/html/2608.18095#Ch4.S2.SS5.SSSx3)
            4. 概念一致性度量的ChatGPT评估 (https://arxiv.org/html/2608.18095#Ch4.S2.SS5.SSSx4)
            5. 所提损失的影响 (https://arxiv.org/html/2608.18095#Ch4.S2.SS5.SSSx5)
            6. 触发器大小与位置敏感性的消融研究 (https://arxiv.org/html/2608.18095#Ch4.S2.SS5.SSSx6)
7. 5 高效多模态表示学习 (https://arxiv.org/html/2608.18095#Ch5)
    1. 5.1 病理学全切片图像视觉问答的词元压缩(TCP-LLaVA) (https://arxiv.org/html/2608.18095#Ch5.S1)
        1. 引言 (https://arxiv.org/html/2608.18095#Ch5.S1.SS0.SSSx1)
        2. 相关工作 (https://arxiv.org/html/2608.18095#Ch5.S1.SS0.SSSx2)
        3. 词元压缩病理学LLaVA (https://arxiv.org/html/2608.18095#Ch5.S1.SS0.SSSx3)
        4. 实验 (https://arxiv.org/html/2608.18095#Ch5.S1.SS0.SSSx4)
            1. 结论 (https://arxiv.org/html/2608.18095#Ch5.S1.SS0.SSSx5)
                1. 附录 (https://arxiv.org/html/2608.18095#Ch5.S1.SS0.SSSx6)
    2. 5.2 用于电子健康记录与临床笔记的多模态Transformer (https://arxiv.org/html/2608.18095#Ch5.S2)
        1. 引言 (https://arxiv.org/html/2608.18095#Ch5.S2.SS0.SSSx1)
        2. 方法论 (https://arxiv.org/html/2608.18095#Ch5.S2.SS0.SSSx2)
        3. 结果 (https://arxiv.org/html/2608.18095#Ch5.S2.SS0.SSSx3)
        4. 结论 (https://arxiv.org/html/2608.18095#Ch5.S2.SS0.SSSx4)
8. 6 结论与未来工作 (https://arxiv.org/html/2608.18095#Ch6)
    1. 6.1 结论 (https://arxiv.org/html/2608.18095#Ch6.S1)
    2. 6.2 未来工作 (https://arxiv.org/html/2608.18095#Ch6.S2)
9. 参考文献 (https://arxiv.org/html/2608.18095#bib)

#### 图列表
1. 3.1 注意力焦点漂移...

相似文章

语言模型中的无意上下文泄露

arXiv cs.LG

本研究探讨了语言模型上下文窗口中的敏感信息如何意外泄露至输出,使得通过新攻击方法重建秘密成为可能,实验结果表明在多款专有模型中泄露问题显著。

PHANTOM:面向视觉语言模型的大规模多模态对抗攻击数据集

arXiv cs.AI

介绍了PHANTOM,一个大规模的开源预生成对抗攻击数据集,用于视觉语言模型,涵盖1010个高级类别和55个有害意图子类别,共47,524个对抗样本。该数据集旨在降低对抗研究的门槛,并支持对VLM鲁棒性和安全性的系统评估。