超越标记:大型语言模型与视觉语言模型的解码方法综述
摘要
本综述论文系统回顾了大型语言模型与视觉语言模型的解码方法,聚焦于推理时方法以提升效率和控制生成过程。文中识别了新兴范式,指出了当前挑战,并探讨了未来研究方向。
arXiv:2608.14797v1 公告类型:新
摘要:大型语言模型(LLMs)和大型视觉语言模型(LVLMs)展示了令人印象深刻的生成能力,然而确保其输出与用户意图一致仍然具有挑战性。虽然大多数现有方法在训练阶段解决此问题,但推理时方法如解码方法提供了更高效且可扩展的解决方案。解码方法通过指导令牌级选择、执行序列级生成或并行生成令牌来加速过程,从而控制模型生成。在本综述中,我们从近期关于LLMs和LVLMs解码方法的工作中识别出三个新兴范式,对这些方法进行了系统回顾,指出了当前挑战,并讨论了潜在的未来研究方向。我们的目标是强调解码方法的效率和有效性,并提供其应用的实用视角。有关LLMs和LVLMs解码方法的论文列表及更多资源可在 https://github.com/wang2226/Awesome-LLM-Decoding 找到。
查看缓存全文
缓存时间: 2026/08/18 09:52
# 超越词元:大语言模型与视觉语言模型解码方法综述 来源:https://arxiv.org/html/2608.14797 熊晓晓1 菲利普·余² 舒凯1 1埃默里大学 2伊利诺伊理工学院 ³伊利诺伊大学芝加哥分校 [email protected], [email protected], [email protected], [email protected] ###### 摘要 大语言模型(LLMs)与大型视觉语言模型(LVLMs)已展现出令人瞩目的生成能力,但确保其输出符合用户意图仍具挑战。多数现有方法在训练阶段解决此问题,而推理时方法如解码方法提供了更高效且可扩展的解决方案。解码方法通过引导词元级选择、执行序列级生成或并行生成词元来控制模型生成过程。本综述基于近期关于LLM与LVLM解码方法的研究,总结出三种新兴范式,系统梳理相关方法,指出当前挑战,并探讨未来研究方向。我们的目标是强调解码方法的效率与效能,并提供其实用视角。关于LLM与LVLM解码方法的论文列表及更多资源可通过以下链接获取:https://github.com/wang2226/Awesome-LLM-Decoding。 ## 1 引言 大语言模型(LLMs)与大型语言视觉模型(LVLMs)已证明,扩大模型规模与训练数据集能显著提升模型的生成能力。然而,随着Llama3 405B\[87 (https://arxiv.org/html/2608.14797#bib.bib24)\]与拥有5300亿参数的Megatron\[118 (https://arxiv.org/html/2608.14797#bib.bib22)\]等大规模基础模型的兴起,研究重点逐渐转向开发更高效、可扩展的推理时生成控制方法(§2 (https://arxiv.org/html/2608.14797#S2))。提示工程因其简单有效而广受欢迎,但具有高度任务特定性,需人工设计最优提示,且易受提示敏感问题影响\[109 (https://arxiv.org/html/2608.14797#bib.bib12), 83 (https://arxiv.org/html/2608.14797#bib.bib13)\]——提示措辞的微小变化可能导致性能显著差异。其他技术如ROME\[85 (https://arxiv.org/html/2608.14797#bib.bib14)\]与ITI\[64 (https://arxiv.org/html/2608.14797#bib.bib53)\]在推理时修改模型内部结构,但泛化性与可扩展性有限。 近年来,解码方法日益受到关注,其在控制下一个词元预测与文本生成中发挥关键作用。解码方法在语言建模领域有着悠久历史,从贪婪解码、束搜索到基于采样的方法(如top-p采样)\[43 (https://arxiv.org/html/2608.14797#bib.bib19)\]。这些方法将模型产生的向量表示转化为连贯文本,同时控制生成输出的质量与属性。研究表明,采用更先进的解码策略可有效缓解幻觉问题\[20 (https://arxiv.org/html/2608.14797#bib.bib79), 148 (https://arxiv.org/html/2608.14797#bib.bib99), 185 (https://arxiv.org/html/2608.14797#bib.bib102), 144 (https://arxiv.org/html/2608.14797#bib.bib104), 33 (https://arxiv.org/html/2608.14797#bib.bib112)\]、提升安全性\[73 (https://arxiv.org/html/2608.14797#bib.bib67), 182 (https://arxiv.org/html/2608.14797#bib.bib69), 161 (https://arxiv.org/html/2608.14797#bib.bib122)\]、增强视觉 grounding\[25 (https://arxiv.org/html/2608.14797#bib.bib16), 59 (https://arxiv.org/html/2608.14797#bib.bib15)\]、改进推理能力\[159 (https://arxiv.org/html/2608.14797#bib.bib158), 186 (https://arxiv.org/html/2608.14797#bib.bib82)\],以及增强对噪声上下文的鲁棒性\[116 (https://arxiv.org/html/2608.14797#bib.bib71), 55 (https://arxiv.org/html/2608.14797#bib.bib73), 104 (https://arxiv.org/html/2608.14797#bib.bib109)\]。除提升文本生成质量外,解码方法还能增强模型的可解释性。例如,\[149 (https://arxiv.org/html/2608.14797#bib.bib23)\]表明,修改解码过程可引导LLM生成思维链推理路径。最后,近期研究方向\[119 (https://arxiv.org/html/2608.14797#bib.bib62), 155 (https://arxiv.org/html/2608.14797#bib.bib97), 151 (https://arxiv.org/html/2608.14797#bib.bib110), 61 (https://arxiv.org/html/2608.14797#bib.bib63), 15 (https://arxiv.org/html/2608.14797#bib.bib64)\]聚焦于通过并行解码多个词元来提升LLM与LVLM的生成效率。 在本综述中,“解码”指推理时将模型输出分布转化为输出序列的过程,包括词元选择、搜索策略与并行生成。虽然解码在自回归模型中属于生成过程的一部分,但我们将其与训练时对齐及提示工程区分开,专注于推理时控制机制。 图1:LLM与LVLM解码方法类型学。 本综述全面概述了LLM与LVLM的先进解码方法,突出其能力、应用与潜力。我们首先回顾推理时生成控制方法(§2 (https://arxiv.org/html/2608.14797#S2))与经典解码策略(§3 (https://arxiv.org/html/2608.14797#S3)),随后介绍三种现代解码范式(§4 (https://arxiv.org/html/2608.14797#S4))及其应用(§5 (https://arxiv.org/html/2608.14797#S5)),最后讨论开放挑战与未来方向(§6 (https://arxiv.org/html/2608.14797#S6))。 图1 (https://arxiv.org/html/2608.14797#S1.F1)呈现了LLM与LVLM中与解码方法相关的关键概念类型学。尽管我们涵盖LLM与LVLM的解码方法,但当前文献对基于文本的LLM解码研究更为丰富。因此,本综述主要强调文本解码,同时将视觉、视频与代码解码作为新兴扩展方向讨论。 **语言建模的重大范式转变** 如\[75 (https://arxiv.org/html/2608.14797#bib.bib8)\]所强调,语言建模及相关领域经历了多次范式转变。最初,从完全监督学习转向预训练与微调方法\[105 (https://arxiv.org/html/2608.14797#bib.bib6), 99 (https://arxiv.org/html/2608.14797#bib.bib1), 30 (https://arxiv.org/html/2608.14797#bib.bib7)\],这主要受BERT\[27 (https://arxiv.org/html/2608.14797#bib.bib5)\]等预训练语言模型成功的推动。近期,领域再次转向预训练、提示与预测范式,其中提示工程\[106 (https://arxiv.org/html/2608.14797#bib.bib9), 7 (https://arxiv.org/html/2608.14797#bib.bib10), 107 (https://arxiv.org/html/2608.14797#bib.bib11)\]成为通过精心设计提示适配下游任务的主流方法。然而,微调与提示工程在应用于LLM与LVLM时均面临挑战。微调拥有数百亿参数的模型需大量计算资源,引发能耗、可扩展性与可及性担忧。提示工程虽计算高效,但高度任务特定且需专业知识设计有效提示。此外,LLM存在提示敏感问题\[109 (https://arxiv.org/html/2608.14797#bib.bib12), 83 (https://arxiv.org/html/2608.14797#bib.bib13)\]——提示格式的轻微变化可能导致性能显著波动。 近期,越来越多研究聚焦于先进解码方法\[29 (https://arxiv.org/html/2608.14797#bib.bib17), 154 (https://arxiv.org/html/2608.14797#bib.bib18)\]。图2 (https://arxiv.org/html/2608.14797#S2.F2)展示了演进历程,突出了从经典搜索到现代对比与推测范式的里程碑。我们认为,领域正经历又一次重大范式转变,即面向通用、高效、可扩展的LLM生成控制方法\[70 (https://arxiv.org/html/2608.14797#bib.bib21)\]。 ## 2 改善生成的推理方法 LLM与LVLM在众多NLP任务中展现出惊人性能,但弥合其训练目标与用户期望的差距仍具挑战。LLM通过大规模数据集训练以最小化上下文词预测误差,而用户期望模型以有用且安全的方式遵循指令。这凸显了对齐\[113 (https://arxiv.org/html/2608.14797#bib.bib20), 125 (https://arxiv.org/html/2608.14797#bib.bib25)\]的必要性——确保模型行为符合人类价值观。 为实现可控文本生成并产生对齐输出,研究者提出了多种方法,大致可分为训练阶段与推理阶段方法,如\[70 (https://arxiv.org/html/2608.14797#bib.bib21)\]所述。训练阶段方法包括微调\[167 (https://arxiv.org/html/2608.14797#bib.bib29), 172 (https://arxiv.org/html/2608.14797#bib.bib30), 183 (https://arxiv.org/html/2608.14797#bib.bib31), 171 (https://arxiv.org/html/2608.14797#bib.bib37), 181 (https://arxiv.org/html/2608.14797#bib.bib38), 152 (https://arxiv.org/html/2608.14797#bib.bib39)\]与强化学习\[120 (https://arxiv.org/html/2608.14797#bib.bib35), 95 (https://arxiv.org/html/2608.14797#bib.bib4), 22 (https://arxiv.org/html/2608.14797#bib.bib32), 52 (https://arxiv.org/html/2608.14797#bib.bib33), 137 (https://arxiv.org/html/2608.14797#bib.bib34), 170 (https://arxiv.org/html/2608.14797#bib.bib36)\],利用奖励信号引导模型输出朝向特定控制目标。本节聚焦于改善推理阶段生成的方法,主要基于三点原因: 1. 推理时方法无需重新训练或修改底层模型即可实现实时改进,是控制任意规模模型生成的高效途径; 2. 这些方法通常模型无关,可应用于大多数仅解码器Transformer,增强其通用性; 3. 部分推理时技术(如解码方法)提供更好的可解释性。 我们将推理时方法分为三类: (1)提示工程; (2)潜在空间操作; (3)解码算法。 ### 2.1 提示工程 提示工程通过为任务设计特定提示直接控制文本生成。其核心目标是通过提供清晰指令或示例引导模型输出。\[117 (https://arxiv.org/html/2608.14797#bib.bib40)\]提出AutoPrompt,一种通过梯度引导搜索自动为多种任务创建提示的方法。\[66 (https://arxiv.org/html/2608.14797#bib.bib41)\]提出前缀调优,作为微调的轻量替代方案,优化自然语言生成任务中称为“前缀”的连续任务特定向量序列。\[60 (https://arxiv.org/html/2608.14797#bib.bib42)\]引入提示调优,这是一种简单有效的技术,通过学习软提示使冻结的语言模型执行特定下游任务。 近期,\[72 (https://arxiv.org/html/2608.14797#bib.bib26)\]提出直接大模型对齐(DLMA),该方法使用对比提示对生成偏好数据,计算自奖励分数,并应用DPO算法对齐LLM。\[18 (https://arxiv.org/html/2608.14797#bib.bib27)\]提出黑盒提示优化(BPO),通过优化用户提示以契合LLM输入理解,无需修改模型参数即可实现用户意图。借助人类偏好,BPO在将LLM与用户目标对齐方面优于传统提示工程。 超越文本领域,\[62 (https://arxiv.org/html/2608.14797#bib.bib28)\]提出ALPRO,一种无需显式目标检测器即可对齐特征的视频文本预训练框架。 ### 2.2 潜在空间操作 潜在空间操作通过修改模型内部结构(如注意力头或在激活层添加转向向量)实现可控生成。其核心思想是:生成目标输出所需信息已编码于模型结构中,无需重新训练或微调。通过直接操作潜在空间,这些技术在保持计算效率的同时,提升了输出的准确性、多样性与连贯性。 \[12 (https://arxiv.org/html/2608.14797#bib.bib43)\]提出GENhance,一种通过学习潜在空间增强属性的生成框架。\[124 (https://arxiv.org/html/2608.14797#bib.bib44)\]直接从预训练语言模型解码器中提取潜在向量(称为转向向量),无需微调。当这些向量被添加到模型隐藏状态时,可实现可控生成。 将转向向量扩展至LLM,\[136 (https://arxiv.org/html/2608.14797#bib.bib45)\]提出激活工程——一种在推理时修改激活以引导模型输出的方法。此方法也可用于控制对齐\[10 (https://arxiv.org/html/2608.14797#bib.bib48), 145 (https://arxiv.org/html/2608.14797#bib.bib46), 9 (https://arxiv.org/html/2608.14797#bib.bib49), 141 (https://arxiv.org/html/2608.14797#bib.bib47), 103 (https://arxiv.org/html/2608.14797#bib.bib50)\]。\[76 (https://arxiv.org/html/2608.14797#bib.bib51)\]提出一种方法:首先从LLM的潜在嵌入中创建上下文向量,然后利用这些向量偏移LLM的潜在状态,使其更有效地遵循示例。\[56 (https://arxiv.org/html/2608.14797#bib.bib52)\]探索通过将风格向量融入文本生成时隐藏层激活中,引导LLM输出特定风格(如情感、情绪或写作风格)。 另一条研究线中,\[85 (https://arxiv.org/html/2608.14797#bib.bib14)\]分析了自回归Transformer语言模型中事实关联的存储与召回,发现这些关联对应于局部化、可直接编辑的计算。他们使用秩一模型编辑(ROME)修改前馈权重,以改变LLM中的事实关联。\[86 (https://arxiv.org/html/2608.14797#bib.bib54)\]开发MEMIT,一种直接更新含多个记忆语言模型的方法,证明了其在LLM中扩展至数千条关联的能力。近期,\[64 (https://arxiv.org/html/2608.14797#bib.bib53)\]提出推理时干预(ITI)以增强LLM的真实性,具体通过有限注意力头中的方向集合在推理时偏移模型激活。 ### 2.3 解码算法 解码算法应用于Transformer生成模型的解码阶段,以修改模型输出的对数或概率分布。通过调整这些概率,引导生成文本朝向期望属性,提供对文本生成过程的动态控制。
相似文章
大规模下的Hidden Decoding: 大型语言模型的潜在计算扩展
本文介绍了Hidden Decoding,这是一种针对LLM的序列长度扩展方法,通过将每个令牌扩展为多个具有独立嵌入表的流,并在每个令牌内增加内部计算,同时使用Stream-Factorized Attention来保持低成本。在多达617B参数的模型上的实验显示,该方法较基线有一致的改进,展示了一条实用的固定骨干扩展路径。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。
代码的 Token 签名:跨大型语言模型的编程行为比较
本文提出了 CLIC,一个视觉分析系统,通过 token 频率分析来比较大型语言模型的编程行为,为 LLM 选择和提示工程提供见解。
我们能理解大语言模型是如何推理的吗?
本文探讨了理解大语言模型推理方式的现有努力和挑战,重点关注可解释性研究。
大语言模型的记忆
本综述系统性地提出了大型语言模型中记忆机制的分类法,从表示、更新动态和持久性三个维度进行分类,并形式化了底层机制组件。