基于联合像素-提示优化的视觉-语言模型多模态资源耗尽攻击

arXiv cs.AI 论文

摘要

本文介绍了联合像素-提示优化(JPPO),这是一种新颖的对抗框架,通过联合优化像素扰动和可见提示来耗尽自回归视觉-语言模型中的资源,与现有方法相比,实现了显著的延迟和能量放大。

arXiv:2609.05889v1 公告类型:新 摘要:针对自回归视觉-语言模型(VLMs)的资源耗尽攻击通常假设单模态威胁模型,将图像分支作为主要优化表面,同时固定用户可见提示。即使是最近的以循环为中心的变体仍然局限于这种单通道范式,使得对可用性的利用尚未作为跨模态优化问题在联合可控输入表面上进行探索。 我们引入了联合像素-提示优化(JPPO),这是第一个将可见提示提升为与图像扰动并列的一流对抗变量的复合对抗框架。在受限的联合输入威胁模型下,JPPO对像素和提示表面执行耦合的、分阶段优化。这产生了协同的成本放大,在机制上不同于依赖循环的失败,在我们的实验中表现出可忽略不计的循环发生率。 在MS COCO和ImageNet上,以8/255无穷范数预算评估五个开源VLM家族,JPPO在Qwen2.5-VL-7B上实现了超过4.6倍的延迟和5.3倍的能量放大,在BLIP-2上实现了超过36.6倍的延迟和32.7倍的能量放大。这代表了在直接比较的基线中最强的成本放大,同时需要显著更少的优化迭代。消融研究证实这种放大源于多模态协调,而非提示长度或孤立模态。这些发现揭示了当前VLM服务防御中的结构性盲点,推动了成本感知的鲁棒性评估作为多模态部署的首要安全要求。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:44

# 通过联合像素-提示优化对视觉-语言模型实施多模态资源耗尽攻击
来源:https://arxiv.org/html/2609.05889

**作者信息:**
赵雄,广州大学,计算机科学与网络空间安全学院,广州,中国,邮箱:[email protected]  
肖亚缇(通讯作者),广州大学,计算机科学与网络空间安全学院,广州,中国,邮箱:[email protected]  
潘志文,澳门大学,计算机与信息科学系,澳门,中国,邮箱:[email protected]  
彭飞,广州大学,人工智能学院,广州,中国,邮箱:[email protected]  
管庆晓,广州大学,人工智能学院,广州,中国,邮箱:[email protected]  
汤科科,广州大学,网络空间先进技术研究院,广州,中国,邮箱:[email protected]

#### 摘要
针对自回归视觉-语言模型(VLMs)的资源耗尽攻击通常假设单模态威胁模型,将图像分支作为主要的优化面,同时保持用户可见提示固定。即使是最近的基于循环的变体也局限于这种单通道范式,使得可用性作为跨模态优化问题,在联合可控输入面上的利用尚未被探索。我们引入联合像素-提示优化(JPPO),这是第一个将可见提示提升为与图像扰动同等地位的一类对抗变量的复合对抗框架。在受限的联合输入威胁模型下,JPPO对像素和提示面执行耦合的、分阶段的优化。这产生了协同的成本放大,其机制区别于依赖循环的故障,在我们的实验中表现出可忽略的循环发生率。在MS COCO和ImageNet上对五个开源VLM家族进行评估,在8/255无穷范数预算下,JPPO在Qwen2.5-VL-7B上实现了超过4.6倍的延迟和5.3倍的能量放大,在BLIP-2上实现了超过36.6倍的延迟和32.7倍的成本放大。这代表了直接比较的基线中最强的成本放大,同时所需的优化迭代次数显著减少。消融实验证实这种放大源于多模态协调,而非提示长度或孤立的模态。这些发现揭示了当前VLM服务防御中的结构性盲点,将成本感知的鲁棒性评估作为多模态部署的首要安全要求。

#### 关键词
自回归视觉-语言模型,资源耗尽攻击,联合像素-提示优化,多模态可用性,解码动态

## 1. 引言
良性与JPPO推理对比
图1. 良性推理(上)与所提出的JPPO攻击(下)的比较,以及产生的成本曲线(右)。干净的输入产生简洁的响应,而我们联合优化有限的像素扰动和有预算约束的接口可见提示上下文,将模型推向长时间的解码,在相同的服务配置下导致显著更高的累积延迟和估计能耗。
良性与JPPO推理对比
并排展示了两个推理案例。良性输入产生短响应,而JPPO对抗性输入产生长得多的延续。右侧的成本图表明,在相同的服务配置下,被攻击案例的累积延迟和估计能耗显著更大。
视觉-语言模型(VLMs)越来越多地作为自回归多模态助手、代理和内容理解系统。与判别视觉模型不同,它们的每个请求的成本取决于实际的解码轨迹:更长的生成需要更多的解码步骤、更大的有效上下文以及更高的延迟和能源开销。这使得可用性成为一个自然的安全性问题:在接口处看起来良好的输入仍然可能引发不成比例昂贵的解码轨迹,如图1所示的良性与JPPO对比。先前的VLM安全工作主要研究语义故障,包括越狱和对抗性图像攻击。最近面向可用性的研究表明,仅图像扰动可以延迟终止并增加服务成本。更近期,LingoLoop展示了通过基于重复和诱导循环的机制可以实现强大的VLM资源耗尽。这些结果确立了仅图像的可用性攻击是现实威胁。然而,它们也留下一个不同的问题:当有界的像素扰动和用户可见提示作为攻击控制的输入进行联合优化时,不主要依赖显式重复循环是否能产生显著的成本放大?
我们在受限的联合输入威胁模型下研究这个问题。我们提出联合像素-提示优化(JPPO),一种受限的联合输入资源耗尽攻击,它联合优化有界的像素扰动和有预算约束的可见提示。JPPO不是不受限的多模态越狱或提示注入方法;它针对的是接口兼容约束下的可用性。其核心机制是多模态协调:像素扰动重塑初始多模态状态,而优化的可见提示在解码过程中施加延续压力。这种威胁模型区别于固定提示的仅图像攻击和主要依赖重复解码的基于循环的故障。
我们在MS COCO和ImageNet上的评估显示,攻击者的有界输入预算与产生的服务成本之间存在显著差距。在l∞=8/255的预算下,JPPO在Qwen2.5-VL上实现了超过4.6倍的延迟和5.3倍的估计能量放大,在BLIP-2上实现了超过36.6倍的延迟和32.7倍的能量放大(表1)。这些收益表明每请求的可用性风险很高,而非边际减慢。
JPPO的成功表明自回归VLM的多模态服务中存在更广泛的可用性弱点。现有的仅图像攻击表明,仅通过视觉操作就可以诱导出高成本解码,包括最近的基于循环的故障。我们的结果进一步表明,当可见提示也被优化为攻击的一部分时,攻击面扩展:多模态协调可以维持一种独特的高成本解码模式,而仅靠基于循环的机制无法完全解释。因此,我们将JPPO定位为不是近期仅图像攻击的替代品,而是多模态系统中成本感知安全评估的补充威胁模型和攻击机制。
我们的主要贡献如下:
- •我们识别了一种用于自回归VLM的受限联合输入可用性威胁模型,区分了离线构建和部署时提交。
- •我们提出JPPO,一种两阶段多模态攻击,它将像素空间优化与有预算的、接口兼容的提示构建相结合,以引导VLM进入高成本解码模式。
- •通过匹配的仅像素、仅提示和联合消融实验,以及中性提示对照,我们证明JPPO的放大是由多模态协调解释的,而非仅由提示长度或任何单一模态分支。
- •在五个VLM家族中,我们评估了有效性、可迁移性、成本、输出质量、防御、共享工作者影响和本地API约束。

## 2. 相关工作
### 2.1. 自回归VLM与推理成本
现代视觉-语言模型(VLMs)越来越依赖以LLM为中心的架构进行自回归文本生成。代表性例子包括Flamingo、BLIP-2、LLaVA、MiniGPT-4、InstructBLIP和Qwen2.5-VL。更新的开放多模态系统进一步拓宽了这一设计空间。系统级优化如PagedAttention、VL-Cache和token/KV-cache压缩旨在减少长上下文推理的开销。尽管有这些优化,服务成本仍然与输入触发的解码长度紧密耦合。这在自回归VLM中创造了一个自然的可用性攻击面:延长解码或延迟终止的对抗性输入可以直接耗尽延迟、内存和能源资源。

### 2.2. 多模态对抗与越狱攻击
大量先前工作研究了多模态模型的对抗鲁棒性以及它们如何通过视觉和文本通道被操纵。现有攻击表明,对抗性图像可以直接从对齐的多模态模型中引发不安全输出。排版视觉提示可以通过视觉流绕过以文本为中心的安全防护。最近的协调图像-文本越狱进一步表明,多模态对齐可以通过跨模态组合和隐藏被破坏。现有研究主要针对语义完整性,强制模型违反策略或进行排版绕过。虽然这些攻击在改变模型所说内容方面很有效,但它们忽略了推理过程的时间持续性。JPPO将焦点从语义腐败转移到资源放大,利用协调的跨模态操作来增加单个恶意请求的计算杠杆。

### 2.3. 可用性与资源耗尽攻击
针对机器学习系统的可用性攻击近年来受到越来越多关注。海绵示例表明,精心设计的测试时输入可以增加延迟和能源使用,而海绵投毒将这种效率-安全视角扩展到训练时操作。更新的研究将讨论扩展到生成系统,包括神经机器翻译中的效率降级、针对大型语言模型的拒绝服务投毒、LLM解码中的重复生成攻击以及基于RAG的代码生成中的上下文投毒攻击。在VLM环境中,NICGSlowDown首次研究了图像描述生成的效率鲁棒性。Verbose Images和VLMInferSlow将这条线扩展到现代大型VLM和服务导向设置,而Hidden Tail通过诱导可以包含用户不可见特殊token的延续,进一步研究了在有界像素扰动下的隐蔽资源消耗。这些工作主要假设仅图像威胁面,并表明仅像素级扰动已经可以放大解码成本。最近的工作进一步表明,仅图像攻击可以通过显式的基于循环的机制显著增强。在这里,我们使用“基于循环”来表示成本放大主要依赖于显式循环或高度重复的token生成的攻击。特别是,LingoLoop展示了通过操纵token预测并诱导循环,推动模型进入过于冗长的轨迹,可以产生强大的VLM/MLLM资源耗尽。这一结果表明,一旦解码变得越来越由语言主导,强大的仅图像可用性攻击不必保持薄弱。与最近的仅图像和基于循环的攻击不同,JPPO将接口可见的提示上下文作为攻击优化过程的一部分,从而实现像素初始化和提示驱动延续压力的协调操作。

## 3. 问题表述与威胁模型
### 3.1. 自回归VLM推理与资源成本
我们考虑一个自回归视觉-语言模型(VLM)\( f_\theta \),它接受一个图像\( x \in \mathcal{X} \)和一个文本提示\( p \in \mathcal{P} \)作为输入,并产生一个输出序列 \( y_{1:G} = f_\theta(x, p) \),其中当发出模型特定的序列结束(EOS)令牌或达到系统施加的最大解码令牌预算\( T_{\max} \)时,生成终止。此类系统中的推理包括两个阶段:(i) 多模态预填充,将图像和提示编码到一个联合上下文中;(ii) 自回归解码,根据\( (x, p, y_1, ..., y_{t-1}) \)生成输出序列。
对于输入\( (x, p) \),我们定义一个对抗扰动预算\( \Delta_x \times \Delta_p \),其中\( \Delta_x \)约束像素空间扰动\( \delta \)(例如,\( \|\delta\|_\infty \leq \epsilon \)),\( \Delta_p \)约束提示空间扰动(例如,通过预算\( \beta \)约束token长度或修改)。攻击者的目标是找到\( (\delta, p') \in \Delta_x \times \Delta_p \)以最大化资源成本度量(如延迟\( C_{\text{lat}}(x+\delta, p') \)或能耗\( C_{\text{e}}(x+\delta, p') \)),同时保持输出在功能上是连贯的或对查询有响应的(例如,避免立即终止或错误)。该优化问题可表述为:
\[
\max_{\delta \in \Delta_x, p' \in \Delta_p} C_{\text{target}}(f_\theta(x+\delta, p')), \quad \text{s.t.} \quad \text{Relevance}(x+\delta, p') \geq \tau.
\]
其中Relevance是一个功能性相关性度量。JPPO通过两阶段优化来解决这个问题,交替优化像素扰动和提示。该威胁模型假设攻击者可以同时控制输入图像和提示,但在有界预算内,并模拟真实的部署场景,其中提示在接口上是可见的,但其内容可以被攻击者构造。

相似文章

视频模型的视觉提示工程

Hugging Face Daily Papers

本文介绍了视觉提示工程(VIPE),一种自动修改任务图像以提升视频模型性能的方法,表明它可能比基于文本的提示工程或测试时缩放更为有效。

设备上LLMs中提示变化如何影响能耗?

arXiv cs.CL

本文探讨了提示属性(如认知负荷和措辞模式)如何影响设备上LLM推理的能耗,表明认知负荷影响每个令牌的能耗,而措辞模式通过令牌使用影响能耗,强调了为能效设计模型感知提示的必要性。