视觉并非负担:用于视觉语言模型无损推测解码的单次传递块起草方法

arXiv cs.AI 论文

摘要

本文提出GLANCE,一种用于视觉语言模型无损推测解码的单次传递块起草方法,可实现高达2.93倍的生成加速,同时保持输出不变。

arXiv:2609.00355v1 公告类型:新 摘要:推测解码在不改变输出的情况下加速生成,但在视觉语言模型(VLMs)上却陷入了一个自相矛盾的循环。起草器保持自回归,因此必须保持小型。小型起草器无法负担每一步的图像,因此视觉被压缩、裁剪或隐藏。起草器与图像切断后,恰好在图像使文本可预测的地方最不可靠。我们提出GLANCE,首个在未修改的VLM目标上无损的单次传递块起草器,它在两端打破了循环。块扩散头读取目标已融合的视觉语言状态,因此视觉对起草器没有成本,并在一次前向传递中填充整个块,因此深度没有顺序步骤成本。宽候选树在一次目标传递中验证,每个审核提示都精确再现贪婪解码。接地工作负载最受益此方法,进入逐字复制模式,其长序列运行对自回归起草器来说每个标记需一次传递,而对块起草器只需一次。在单引擎和单轮预算下,GLANCE解码速度比自回归快达2.93倍,每轮一次起草传递,而生产EAGLE3-VL头需要八次,并且接受比在相同语料库上训练的EAGLE-3头长2.7倍的块。一个法则组织这些结果。接受长度由目标的下标记熵设定,其拟合斜率在所有五个任务中随接地性增加而变陡。该法则跨目标和模态转移,并命名自己的边界,因为自由运行文本仍偏好链式。我们的代码可在https://github.com/js-lee-AI/GLANCE获取。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:01

# 视觉并非开销:视觉语言模型无损推测解码的单次块草稿方法  
来源:https://arxiv.org/html/2609.00355  
成泰河、李东杓(Jude Lee)、朴赞俊、徐在赫、李秀庆\corresponding、林辉石\corresponding  

###### 摘要  
推测解码能在不改变输出的前提下加速生成,但在视觉语言模型(VLM)中,它却陷入了一个自我挫败的循环。草稿模型必须保持自回归特性,因此体量必须小巧。而小型草稿模型无法在每一步都处理图像信息,导致视觉内容被压缩、修剪或隐藏。一旦草稿模型与图像信息脱节,恰恰在图像能使文本更具可预测性的地方,其可靠性反而最低。我们提出了GLANCE,这是首个在未经修改的VLM目标模型上实现无损的单次块草稿模型,它从两端打破了这一循环。一个块扩散头读取目标模型已融合的视觉-语言状态,因此视觉信息对草稿模型零开销,并且能在一个前向传播中填充整个块,使得深度不需要任何顺序步骤。一个宽广的候选树在一次目标模型的前向传播中完成验证,且每个验证的提示词都精确复现了贪心解码的结果。基于定位的任务最能从中受益,进入一种逐字复制模式,其长序列对于自回归草稿模型来说意味着每个词元都需要一次前向传播,而对块草稿模型而言总共只需一次。在单一引擎和单轮预算下,GLANCE的解码速度比自回归最高快2.93倍(每轮仅需一次草稿传播,而生产级EAGLE3-VL头需要八次),并且接受的块长度比在同一语料库上训练的EAGLE-3头长2.7倍。一条定律组织了这些结果:接受长度由目标模型的下一词元熵决定,并且其拟合的斜率在所有五个任务中随着定位能力的增强而变得更陡峭。该定律可跨目标模型和模态迁移,并且指明了自身的边界,因为自由运行的文本生成仍然偏向链式结构。我们的代码已开源:https://github.com/js-lee-AI/GLANCE。  
1高丽大学 2Zoom Communications 3祥明大学 4建国大学 5延世大学  
\{omanma1928, ghdchlwls123, limhseok\}@korea.ac.kr, [email protected], [email protected], [email protected], [email protected]  

## 1 引言  
视觉语言模型(VLM)越来越多地服务于那些输出为关于图像的长文本的任务,例如描述照片、阅读扫描文档、从图表中提取数字(Qwen Team 2025; Bai et al. 2025)。生成过程保持自回归,因此每个输出词元都需要目标模型的一次完整前向传播,而在小批量设置下,这个循环受内存带宽限制而非计算能力限制。视觉编码器仅在预填充阶段运行一次,而循环则在每个词元上运行,因此加速基于定位的生成,关键在于攻击循环而非编码器。推测解码在不改变输出的前提下移除了部分开销。一个低成本的草稿模型提议若干未来词元,目标模型在一次前向传播中验证它们,并提交最长的正确前缀(Leviathan et al. 2023; Chen et al. 2023)。现代方法从目标模型自身的隐藏特征进行草稿生成(Cai et al. 2024; Li et al. 2024b; Li et al. 2024a),并基于候选树(Miao et al. 2024; Chen et al. 2024b)工作,而EAGLE-3(Li et al. 2025b)是生产标准,其头部现在已应用于视觉-语言栈。  
适应VLM的草稿生成工作陷入了一个基于其自身前提的循环。草稿模型保持自回归,因此一个深度为k个词元的候选需要k次顺序草稿传播,并且草稿模型必须保持小巧以使这些传播成本低廉(AQ-MedAI 2025)。小型草稿模型无法在每一步都处理图像,因此图像词元被压缩、修剪或对其隐藏(Gagrani et al. 2024; Kang et al. 25; Huang et al. 2025; Xie et al. 2025)。然而,深度恰恰是草稿模型能够提供的价值,而一个与图像信息脱节的草稿模型,恰恰在图像已经固定了文本内容的地方最不可靠,因此每个前提都强化了下一个,这个循环使得那些本应收益最高的草稿生成变得不可行。我们提出了相反的问题:对于基于定位的任务,视觉信息是需要向草稿模型隐藏的成本,还是草稿生成本身能够奏效的原因?当VLM回答关于文档的问题时,其生成内容的很大一部分已存在于图像中,因此下一个词元通常几乎是确定性的,经常是从页面上精确复制的内容,如图1所示。可预测性是草稿模型转化为速度的基础,我们将其量化。接受块的长度由目标模型的下一词元熵通过一个适用于我们所有测试任务的定律决定,而基于定位的任务处于低熵端,因此阅读文档和图表的任务接受最长的块,开放描述任务接受最短的块。一个不匹配图像探测实验表明,图像正是通过这个熵通道而非与之并列地发挥作用,而将草稿模型的融合视觉状态替换为纯文本LLM的状态,恰恰在草稿生成最宽最深的地方造成了最大的接受率损失。  
低熵只有在能够低成本地提出长而宽的候选集时才能带来收益,因此我们进行单次草稿生成。我们提出了GLANCE(基于定位的单次候选扩展块草稿),它从两端退出了循环,同时继承了视觉信息和填充了深度。一个块扩散头(Chen et al. 2026; Arriola et al. 2025)读取冻结目标模型自身的融合视觉-语言状态,并在一个草稿传播中为整个块的每个位置绘制分布。排名最高的前缀形成一个宽候选树,一次目标模型传播验证所有这些候选。我们证明提交的路径恰好是目标模型自身的贪心解码结果,并且我们基于此等式而非假设来控制每次运行。因为一次草稿传播已经支付了整个块的成本,宽度成为廉价的轴,在验证内部购买,而非通过更多的草稿传播(Ringel and Romano 2026; Zhang et al. 2026b)。其结果是一个将定位转化为速度的草稿模型。在文档、信息图表和图表问答任务中,GLANCE的解码速度比自回归最高快2.93倍(每轮仅需一次草稿传播,而生产级视觉-语言头需要八次),并且每个提交的词元都是目标模型自身的输出。在与EAGLE-3头相同的语料库和训练计划下训练,它接受的块长度长2.7倍。收益背后的定律可以迁移到第二个视觉-语言目标模型,以及语音、代码和聊天任务。我们的贡献包括:  
- •我们重新诊断了为何草稿生成在VLM上表现不佳。自回归草稿模型和精简的视觉访问相互强化,它们共同丢弃了任务的最佳资产——基于定位生成中长而精确的逐字复制序列,而这只有单次草稿模型才能完整获取。  
- •我们构建了首个在未经修改的视觉-语言目标模型上无损的单次块草稿模型,结合了基于融合视觉-语言状态的块扩散头、单次目标传播中的宽树验证,以及与贪心解码的精确比特级等价性测量。  
- •我们使该机制可量化。接受长度由目标模型的下一词元熵决定,一个不匹配图像探测实验表明图像正是通过该通道发挥作用,并且在基于定位的基准任务上,逐字复制分析在每个基于定位任务上都将实测接受率提升至该定律自身上限之上。面向OCR的重新训练在该定律预测有提升空间的地方提高了接受率。  
- •我们在一个生产引擎内、五个任务族上解决了部署主张,并描绘了该定律跨越草稿模型、目标模型和模态的范围。  

## 2 相关工作  
草稿头与树验证。推测解码使用拒绝采样接受规则,可证明保留了目标分布(Leviathan et al. 2023; Chen et al. 2023)。实用的一支使用轻量级头从目标模型自身的隐藏特征进行草稿生成:独立的位置头(Cai et al. 2024)、顺序依赖头(Ankner et al. 2024),以及具有动态候选树的特征级自回归(Li et al. 2024b; Li et al. 2024a),其中EAGLE-3通过训练时测试和多层特征融合进行了扩展(Li et al. 2025b)。许多候选通过将前缀树打包进一次祖先掩码目标传播中一次性验证(Miao et al. 2024),后续工作研究了树形(Chen et al. 2024b; Wang et al. 2025a)以及理论和基准测试(Yin et al. 2024; Huang et al. 2024; Xia et al. 2024)。  
VLM的推测解码。首个针对多模态LLM的推测解码研究发现纯文本草稿模型是一个强基线(Gagrani et al. 2024)。后续工作采取两种路线之一。一种是缩减草稿模型需要读取的内容,通过将图像词元压缩为适配器嵌入(Kang et al. 2025)、修剪视觉词元(Huang et al. 2025)或直接隐藏它们(Xie et al. 2025)。另一种是通过蒸馏和目标特征融合,为小型草稿模型提供自己的低成本视觉路径(Ganesan et al. 2025; Hu et al. 2025)。半自回归多模态草稿放宽了每次传播一个词元的限制,但没有精确性保证(Wang et al. 2025b),并且该设置已有基准测试(Shen et al. 2026)。这两种路线都保持草稿模型的自回归特性,并设计草稿模型的视觉访问方式,而非继承它。我们通过单次传播继承它。  
块草稿与扩散草稿模型。另一条并行路线移除了草稿模型内部的顺序瓶颈:前瞻嵌入(Monea et al. 2023)、雅可比解码(Fu et al. 2024)、块并行离散扩散语言模型(Nie et al. 2025; Arriola et al. 2025)、带有自回归验证器的扩散草稿模型(Christopher et al. 2025; Li et al. 2025a; Cheng et al. 2025),以及基于冻结目标模型隐藏状态的块扩散头(Chen et al. 2026)。单次草稿生成改变了树宽度的经济学,这已在纯文本块草稿中确定(Ringel and Romano 2026; Zhang et al. 2026b),并在此处原样复用。块草稿仅通过将目标模型本身转换为自推测的扩散模型才得以应用于视觉-语言目标(Wu et al. 2026; Zhang et al. 2026a),这放弃了原始模型的输出。我们保持目标模型冻结且其输出精确。  

## 3 基础知识  
### 3.1 推测解码与接受  
设 \(p(\cdot \mid x)\) 为冻结目标VLM在给定多模态前缀 \(x\)(文本词元加上编码图像)时的下一词元分布。自回归贪心解码发出 \(\argmax_w p(w \mid x)\),每次目标前向传播生成一个词元。推测解码则以*轮次*进行(Leviathan et al. 2023; Chen et al. 2023)。给定已提交的前缀和待处理的*根*词元 \(b\),草稿模型提议候选延续,目标模型提交与自身一致的最长前缀。在温度为0时,该接受规则是针对目标模型自身贪心延续 \(Y = (Y_1, Y_2, \dots)\)(在 \(b\) 之后)的精确前缀匹配,其中 \(Y_k = \argmax_w p(w \mid x \circ b \circ Y_{1:k-1})\)。设 \(a\) 为一轮中接受的非根词元数量。每轮提交 \(a+1\) 个词元:已接受的前缀加上从最后验证分布中读取的一个词元。本文的核心量是*平均接受长度*,即一次验证轮次中提交的词元数量:  
\[
\tau = \mathbb{E}[a+1] = \mathbb{E}[a] + 1
\]  
(1)  
因此,纯粹的自回归解码有 \(\tau = 1\)。那些记录额外奖金计数 \(\mathbb{E}[a]\) 的系统(Kang et al. 2025)在此处加上一个提交的词元,使所有结果处于同一尺度上。更高的 \(\tau\) 意味着每个生成词元需要更少的目标模型传播,而加速比是 \(\tau\) 扣除草稿生成和验证开销后的值。  

### 3.2 单次块草稿  
我们的草稿模型遵循块扩散接口(Chen et al. 2026; Ringel and Romano 2026),由于下游所有内容都仅依赖于它,因此将其作为假设陈述。  

###### 假设 1(单次边际排序接口)。  
以缓存的前缀 \(x\) 和待处理的根 \(b\) 为条件,草稿模型在一次前向传播中,在块内任何词元被提交之前,返回每个位置 \(j = 1, \dots, L\) 的边际分布 \(q_j(\cdot \mid x, b)\),候选前缀通过其插入得分排序:  
\[
\hat{\pi}(y_{1:\ell}) = \prod_{j \leq \ell} q_j(y_j \mid x, b)
\]  
###### 定义 1(候选树与接受规则)。  
一个*候选树*是...

相似文章

基于推测词汇表的推测解码

arXiv cs.CL

本文提出SpecVocab,一种为推测解码中的草稿模型逐步骤选择词汇子集的方法,实现了更高的接受长度,并相较于EAGLE-3最高提升8.1%的吞吐量。

什么是推测性解码?(在paperswithco.de上热门)[R]

Reddit r/MachineLearning

推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。