强制延迟:在多模态LLM级联中操纵路由决策

arXiv cs.AI 论文

摘要

本文介绍了强制延迟攻击(FDA),一种对抗性图像攻击,通过操纵多模态LLM级联中的置信度分数,导致查询不必要地路由到更强(更昂贵)的模型,从而在不降低答案正确性的情况下将计算成本转移给提供商。

arXiv:2606.15308v1 Announce Type: new 摘要:尽管多模态大语言模型(MLLM)展现了强大的视觉推理能力,但为每个查询部署大型模型在计算上成本高昂。MLLM级联通过首先查询较弱但成本较低的模型,并在弱模型输出不自信时延迟到强模型,从而降低了这一成本。然而,由于弱模型的置信度直接控制计算分配,这些系统暴露了一个新的攻击面:攻击者可以操纵置信度,使其查询持续被延迟到强模型。受这一漏洞启发,我们引入了强制延迟攻击(FDA),这是一种对抗性图像攻击,通过降低弱模型的置信度,使级联将查询路由到强模型。FDA通过优化一个温度平化目标来学习一个通用边界触发器。该目标将弱模型在触发输入上的令牌分布推向从其干净响应中构建的较不集中的目标。跨数据集、模型系列和延迟指标,FDA持续增加强模型路由,同时优于图像扰动和提示注入基线。这些结果表明,MLLM级联容易受到操纵计算分配的攻击,从而在未直接针对答案正确性的情况下,迫使非预期的强模型使用。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:44

# 强制延迟攻击:在多模态大语言模型级联中操控路由决策  
来源:https://arxiv.org/html/2606.15308  
Zhongye Liu, Yaopei Zeng, Yurui Chang, Lu Lin  
宾夕法尼亚州立大学  
\{zql5622, ypz5549, yuruic, lulin\}@psu\.edu  

###### 摘要  

尽管多模态大语言模型(MLLMs)已展现出强大的视觉推理能力,但为每个查询都部署一个大模型进行计算代价高昂。MLLM级联通过首先查询一个较便宜但较弱的模型,并在弱模型输出不自信时转交给强模型,从而降低了这种成本。然而,由于弱模型的置信度直接控制计算资源的分配,这些系统暴露出一个新的攻击面:攻击者可以操控置信度,使其查询被持续转交给强模型。受此漏洞启发,我们提出了强制延迟攻击(FDA),这是一种对抗性图像攻击,它降低弱模型的置信度,导致级联系统将查询路由到强模型。FDA通过学习一个通用边界触发器,优化一个温度平坦化的目标函数。该目标函数推动弱模型在触发输入上的令牌分布,朝向从其干净响应中构建的、较不集中的目标分布。跨数据集、模型家族和延迟指标,FDA一致地增加了强模型路由的比例,并优于图像扰动和提示注入基线。这些结果表明,MLLM级联容易受到操控计算资源分配的攻击,从而在不直接针对答案正确性的情况下,迫使系统使用强模型。  

## 1 引言  

多模态大语言模型(MLLMs)在回答图像相关问题方面变得日益强大,支撑起视觉问答(Goyal等人,2017(https://arxiv.org/html/2606.15308#bib.bib4))、文档理解(Mathew等人,2021(https://arxiv.org/html/2606.15308#bib.bib5))和交互式助手(Achiam等人,2023(https://arxiv.org/html/2606.15308#bib.bib2);Liu等人,2023(https://arxiv.org/html/2606.15308#bib.bib6))等应用。然而,这种能力带来了巨大的推理成本,尤其是在为每个查询部署大型MLLM时。为了平衡推理成本与答案质量,近年来系统越来越依赖高效的模型选择机制,例如路由(Ong等人,2024(https://arxiv.org/html/2606.15308#bib.bib9);Ding等人,2024(https://arxiv.org/html/2606.15308#bib.bib10))和级联(Chen等人,2023(https://arxiv.org/html/2606.15308#bib.bib7);Yue等人,2023(https://arxiv.org/html/2606.15308#bib.bib8))。在MLLM级联系统中,首先由一个较便宜的弱模型处理查询,只有当弱模型的答案显得不确定时,才会调用更强的模型。通过将昂贵的推理仅留给困难或不确定的情况,级联系统使模型提供商能够在保持答案质量的同时提高推理效率。  

尽管具有效率优势,MLLM级联系统暴露了一个计算资源分配的攻击面。它们被设计用来为困难查询保留强模型的计算资源,但用户可能即使对于提供商打算用弱模型服务的查询,也偏好强模型的响应。这种激励不匹配促使了对置信度信号的攻击:通过降低弱模型的置信度,攻击者可以迫使不必要的延迟到强模型。这样,攻击者获得了更高质量的响应,同时将额外的计算成本转嫁给了提供商。与那些旨在降低答案正确性的攻击不同,这种威胁针对的是级联系统的分配机制,而非最终的预测。  

这一漏洞凸显了现有高效推理和对抗鲁棒性研究中的空白。关于高效模型选择的研究主要集中在良性部署下的成本-质量权衡(Ong等人,2024(https://arxiv.org/html/2606.15308#bib.bib9);Chen等人,2023(https://arxiv.org/html/2606.15308#bib.bib7))。延迟决策本身的鲁棒性很少受到关注。先前的针对模型分配的攻击(Shafran等人,2025(https://arxiv.org/html/2606.15308#bib.bib17);Lin等人,2025(https://arxiv.org/html/2606.15308#bib.bib18))大多考虑的是预生成路由,即在任何答案产生之前选择模型。与此同时,针对MLLM的对抗性研究通常针对输出层面的行为,例如导致模型产生错误答案(Zhao等人,2023(https://arxiv.org/html/2606.15308#bib.bib19);Schlarmann 和 Hein,2023(https://arxiv.org/html/2606.15308#bib.bib20))或绕过安全对齐(Qi等人,2024(https://arxiv.org/html/2606.15308#bib.bib21))。这些工作都没有捕捉到基于置信度的MLLM级联的鲁棒性,其中延迟决策本身成为一个攻击面。这一空白促使了我们的核心研究问题:  

攻击者能否操控弱模型的置信度,以迫使不必要的延迟到强模型?  

回答这个问题带来了两个挑战。首先,攻击者对部署的级联使用哪种不确定性度量没有先验知识,因此攻击不能针对单一的置信度分数。其次,攻击必须降低弱模型的置信度,同时不破坏查询内容,因为攻击者仍然希望强模型能正确回答。为了应对这些挑战,我们提出了一种级联延迟攻击,通过减少弱模型置信度同时保留输入语义,来诱导强模型路由。为了处理未知的延迟度量,攻击从弱模型的干净输出轨迹中构建较不集中的目标分布,并优化触发器,使得弱模型在触发输入上的令牌分布匹配这些平坦化的目标。这以一种与度量无关的方式降低了置信度,而不是针对任何一个单一分数。为了保留输入语义,触发器被限制在图像周围的通用边界区域,从而保持中心视觉内容完整。跨多个数据集、模型家族和延迟度量,我们的攻击显著增加了强模型路由的比例,并优于常见的图像扰动和提示注入基线。  

总结而言,我们做出了以下贡献:  

- 我们识别并形式化了级联延迟攻击,作为针对MLLM级联的一种新的效率导向威胁。与旨在改变模型预测的标准对抗攻击不同,这种攻击操控弱模型的置信度以增加向更强模型的延迟率,破坏了级联推理的计算优势。  
- 我们提出了一种用于级联延迟攻击的答案无关通用边界触发器。通过使用温度平坦化的教师强制目标函数,该触发器沿着干净输出轨迹降低弱模型的置信度,实现了度量无关的延迟操控,同时保留了强模型在触发输入上的性能。  
- 我们通过实验证明,所提出的攻击在数据集、模型家族、延迟度量和预处理防御方面是有效、可迁移且鲁棒的,一致地增加了强模型延迟的比例,同时保留了触发输入上的答案质量。  

## 2 相关工作  

#### 使用路由和级联的高效自适应推理  

大型MLLM的服务成本高昂,尤其是当视觉查询的难度各异时。高效自适应推理通过将查询分配给具有不同能力和成本配置的模型来降低这种成本。路由方法在生成之前选择模型,通常使用查询本身、模型元数据或一个学习的路由器(Ong等人,2024(https://arxiv.org/html/2606.15308#bib.bib9);Ding等人,2024(https://arxiv.org/html/2606.15308#bib.bib10))。级联方法顺序调用模型:一个较便宜的模型先回答,只有当较便宜模型的答案看起来不可靠时才调用更强的模型(Chen等人,2023(https://arxiv.org/html/2606.15308#bib.bib7);Yue等人,2023(https://arxiv.org/html/2606.15308#bib.bib8);Aggarwal等人,2023(https://arxiv.org/html/2606.15308#bib.bib22))。级联的一个关键组件是延迟规则,它决定是否接受弱模型的答案或延迟到更强的模型。现有工作基于对弱模型估计的不确定性信号来做出延迟决策,使用令牌概率(Mahaut等人,2024(https://arxiv.org/html/2606.15308#bib.bib13);Kadavath等人,2022(https://arxiv.org/html/2606.15308#bib.bib12))、基于困惑度的置信度(Fomicheva等人,2020(https://arxiv.org/html/2606.15308#bib.bib14))、口头化置信度(Tian等人,2023(https://arxiv.org/html/2606.15308#bib.bib16))或跨采样输出的一致性(Lin等人,2023(https://arxiv.org/html/2606.15308#bib.bib15))。  

#### 模型分配和MLLM的对抗鲁棒性  

针对MLLM和视觉语言模型的对抗攻击通常修改视觉输入以改变模型行为。常见形式包括不可察觉的扰动(Zhao等人,2023(https://arxiv.org/html/2606.15308#bib.bib19);Schlarmann 和 Hein,2023(https://arxiv.org/html/2606.15308#bib.bib20))、局部补丁(Brown等人,2017(https://arxiv.org/html/2606.15308#bib.bib25))和通用触发器(Moosavi-Dezfooli等人,2017(https://arxiv.org/html/2606.15308#bib.bib26))。这些攻击通常通过其对最终答案的影响来评估,例如目标误分类或降低基准准确率(Zhao等人,2023(https://arxiv.org/html/2606.15308#bib.bib19);Schlarmann 和 Hein,2023(https://arxiv.org/html/2606.15308#bib.bib20))、虚构描述(Li等人,2023(https://arxiv.org/html/2606.15308#bib.bib23))、操控答案偏好(Lan等人,2025(https://arxiv.org/html/2606.15308#bib.bib24))或安全绕过(Qi等人,2024(https://arxiv.org/html/2606.15308#bib.bib21))。只有少数工作研究了模型分配机制上的漏洞。例如,针对LLM路由器的攻击表明,对抗性输入可以在保留响应质量的同时操控选择的模型(Shafran等人,2025(https://arxiv.org/html/2606.15308#bib.bib17);Lin等人,2025(https://arxiv.org/html/2606.15308#bib.bib18))。这些研究表明,多模型系统除了单个模型的预测表面外,还引入了一个控制流攻击面。路由攻击通常在生成之前选择模型,而级联则在弱模型生成答案并产生置信度信号后做出分配决策。  

参见图标题  
图1:针对MLLM级联的强制延迟攻击概述。左侧面板展示了标准级联流程,其中弱模型直接回答高置信度输入,仅将不确定的情况延迟到更强的模型。中间面板展示了我们的攻击过程:我们首先提取干净输出轨迹,构建平坦化的温度缩放目标分布,并通过教师强制KL最小化优化一个学习的边界触发器。右侧面板展示了部署效果:应用学习到的触发器会降低弱模型的置信度,导致更多输入被路由到强模型,同时保留高质量的最终答案。  

## 3 方法  

### 3.1 基于不确定性的MLLM级联基础  

遵循(Chen等人,2023(https://arxiv.org/html/2606.15308#bib.bib7);Gupta等人,2024(https://arxiv.org/html/2606.15308#bib.bib33)),我们考虑一个部署MLLM级联以降低推理成本的服务提供商,如图1(https://arxiv.org/html/2606.15308#S2.F1)所示。级联由一个便宜但较弱的模型 M\_\{w\} 和一个昂贵但较强的模型 M\_\{s\} 组成。给定一个图像-问题对 (x\_\{I\}, x\_\{Q\}),系统首先查询弱模型并获得其响应 y\_\{w\} = M\_\{w\}(x\_\{I\}, x\_\{Q\})。然后,它从弱模型的生成过程中计算一个事后置信度分数 c\_\{w\}。该置信度分数可能来源于答案令牌概率、序列似然、困惑度、输出一致性或其他不确定性量化度量。级联使用这个置信度分数来决定是接受弱模型的答案,还是将查询延迟到强模型。形式上,给定一个固定阈值 γ,最终响应 y\_\{\mathrm{cas}\} 为:  

y\_\{\mathrm{cas}\}(x\_\{I\}, x\_\{Q\}) = \begin{cases} y\_\{w\}, & c\_\{w\} \geq \gamma, \\ M\_\{s\}(x\_\{I\}, x\_\{Q\}), & c\_\{w\} < \gamma. \end{cases} \quad (1)  

阈值 γ 在部署前选择,例如通过在干净验证数据上选择目标延迟率。在良性输入下,提供商期望简单查询由弱模型 M\_\{w\} 回答,只有困难或不确定的查询才会路由到更强的模型 M\_\{s\}。因此,弱模型的置信度充当了一个计算资源分配信号:降低 c\_\{w\} 会增加调用更强且更昂贵模型的可能性。这暴露了一个新的漏洞:通过操控 c\_\{w\},攻击者可以迫使级联在其预期工作点之外进行延迟,我们在下一节中对此进行形式化。  

### 3.2 延迟攻击中的威胁模型  

我们提出一种对抗性图像攻击,用于操控 MLLM 级联的延迟决策。  

攻击者目标:给定一个干净输入 (x\_\{I\}, x\_\{Q\}),攻击者构造 (x̃\_\{I\}(δ), x\_\{Q\}),其中 δ 表示图像空间扰动,x̃\_\{I\}(δ) 表示扰动后的图像。攻击仅修改图像,而 x\_\{Q\} 保持不变。当 c\_\{w\}(x̃\_\{I\}, x\_\{Q\}) < γ 时攻击成功,从而级联将查询路由到 M\_\{s\}。攻击者进一步要求 x̃\_\{I\} 仍然能够被 M\_\{s\} 回答,因为攻击者旨在获得高质量的答案。  

攻击者知识:攻击者在攻击构建期间可以访问弱模型的 logits(例如,当 M\_\{w\} 是开源的,或通过同一家族的替代模型),但不知道级联的不确定性度量 c\_\{w\}(·) 或阈值 γ。因此,攻击不能依赖于优化任何特定的置信度分数。  

攻击者能力:扰动 δ 在训练集上一次性学习,并在部署时应用于未见过的输入,因此每个查询的攻击成本可以忽略不计。  

### 3.3 设计延迟攻击的实用原则  

我们围绕威胁模型导出的三个原则设计图像空间扰动 δ:扰动应该是*与度量无关的*、*保留语义的*以及*跨查询通用的*。下面我们描述每个原则,然后引入一个满足所有三个原则的训练目标和触发器参数化:  

- **与度量无关**:由于路由器的确定性信号未知,针对任何特定分数(如最大 softmax 概率、预测熵或前两个令牌之间的边缘)进行优化不太可能迁移到其他分数,并且运营商侧任何度量或阈值的改变都会使其失效。因此,我们必须针对所有这些度量所反映的潜在分布属性,而不是针对任何一个单一属性。  
- **保留语义**:一旦延迟成功,触发查询正是强模型接收到的查询。如果扰动破坏了回答问题所需的视觉内容,那么强模型也会失败,攻击者从延迟中一无所得。因此,扰动必须保留必要的语义内容。  
- **跨查询通用**:对每个新查询重新优化代价过高。

相似文章