基于推理需求的路由:扩散视觉语言模型的轨迹感知解码控制

arXiv cs.AI 论文

摘要

本文提出了一种针对扩散视觉语言模型的轨迹感知解码控制方法,通过根据解码状态路由样本来解决推理预算不匹配问题,从而提高跨基准测试的鲁棒性。

arXiv:2609.11315v1 公告类型:新 摘要:扩散视觉语言模型通过迭代精化生成答案,暴露出可以在推理时检查和控制的中间答案轨迹。然而,这种可控性导致了推理需求不匹配,即对不同推理需求的问题应用了通用的生成长度。视觉上封闭的问题可能因在稳定答案形成后继续精化而受损,而推理敏感的问题可能因过早承诺而受损。我们将此问题表述为推理预算不匹配,并在LLaDA-V中进行研究。我们的无需训练控制器使用来自答案封闭、承诺证据和表示修订压力的轨迹信号,将每个样本路由到早期承诺、基线保留或推理支持性解码,而不使用真实答案。在以答案为中心、混合推理和CoT敏感的基准测试中,路由控制比固定长解码、纯短解码和单一规则干预提高了鲁棒性。收益不能仅通过较短的输出来解释。答案封闭的样本通常受益于承诺,而CoT敏感的样本需要保留或支持中间推理。综上所述,这些结果表明扩散VLM解码应根据观察到的轨迹所建议的状态路由推理时控制,而不是依赖于通用的解码长度。
查看原文
查看缓存全文

缓存时间: 2026/09/12 08:26

# 基于推理需求的路由:扩散视觉-语言模型中的轨迹感知解码控制
来源:https://arxiv.org/html/2609.11315
Yixiang Liu††贡献相等。Zhongxing Xu11脚注标注:1单位:莫纳什大学通讯作者:[[email protected]](mailto:[email protected])Zhonghua Wang11脚注标注:1单位:莫纳什大学通讯作者:[[email protected]](mailto:[email protected])Xiaoying Tang††通讯作者。单位:南方科技大学

###### 摘要

扩散视觉-语言模型通过迭代精炼生成答案,这暴露了可在推理时检查和控制的中间答案轨迹。然而,这种可控性导致了推理需求不匹配,即对具有不同推理需求的问题应用了统一的生成长度。对于视觉封闭型问题,在稳定答案形成后继续精炼可能有害,而对于推理敏感型问题,过早确定答案则可能造成损害。我们将此问题表述为推理预算不匹配,并在 LLaDA-V 中进行研究。我们没有选择统一的生成长度,而是提出了一种无需训练的控制器,利用来自答案封闭度、确定性证据和表征修订压力的轨迹信号,将每个示例路由至早期确定、基线保持或推理支持型解码,且不使用标准答案。在答案聚焦型、混合推理型和思维链敏感型基准测试中,路由控制相较于固定的长解码、纯短解码和单一规则干预,提升了鲁棒性。这些增益并非仅由更短的输出解释。已封闭答案的示例通常受益于确定性,而思维链敏感型示例则需要保持或支持中间推理过程。总之,这些结果表明,扩散视觉-语言模型解码应根据所观察轨迹所指示的状态来路由推理时控制,而非依赖统一的解码长度。

## 1引言

参见标题图 1:与推理需求匹配的解码控制动机。顶行显示了在固定 128 步解码预算下,各基准场景中答案封闭的时间点。灰色区域表示在 128 步轨迹内尚未收敛到有效答案的解码区间。底行图示了三种代表性的轨迹结果,包括封闭后的过度精炼、匹配的控制以及封闭前的过早确定。这些模式提示我们,应根据所观察轨迹指示的状态来路由解码操作,而非应用统一的生成长度。
扩散视觉-语言模型改变了在解码过程中可控制的内容。在自左向右的自回归生成中,模型逐个位置地确定一个 token 序列。token 输出后,后续计算可以基于它,但无法直接修改它。而扩散语言模型则通过迭代去噪或掩码精炼来生成文本,近期的扩散视觉-语言模型将此设计扩展到多模态指令跟随(Nie 等,2026;You 等,2026)。这使得解码成为对部分指定答案的可观察修订序列,而非单次不可逆的轨迹。因为这些中间答案轨迹在推理时可见,它们可以指示候选答案是否稳定、轨迹是否提供了足够的依据与格式证据以进行确定,以及模型是否仍在修改将支持最终答案的表征。对于视觉封闭的视觉问答示例,如 MME(Fu 等,2025)中的许多紧凑诊断问题,答案可能很早就出现并在多次精炼中保持一致(Li 等,2026b;Xu 等,2026)。相比之下,对于几何、化学或多跳推理示例,如 MMMU 风格的专家问题(Yue 等,2024),同样的早期表面答案可能不可靠,因为模型尚未组织相关的关系。如图 1 顶行所示,紧凑型视觉问题可能很早就完成了答案封闭,而推理密集型示例可能需要后续精炼才能产生可靠答案。因此,扩散解码不仅暴露了最终答案,也暴露了导出该答案的修订过程。

这种可控性在固定解码预算下也带来了风险(Li 等,2026a)。在我们的实验中,默认的固定预算参考使用了 128 步的精炼轨迹,即使问题在推理需求上差异巨大,也为每个样本分配了相同的解码计算量。对于视觉封闭型问题,在稳定答案形成后继续精炼可能有害,而对于推理敏感型问题,过早确定答案则可能造成损害。我们将此失败称为推理预算不匹配。这种不匹配并非简单地指某些输出应更短而其他应更长。它指的是不同样本需要不同的推理时控制操作,因为早期精炼后留下的不确定性具有不同含义。在答案已封闭的情况下,合适的操作是早期确定。在未解决的情况下,干预并非必要,更安全的操作是保持固定的预算基线。在思维链敏感的情况下,最终答案应由中间推理支持,合适的操作是推理支持型解码,而非过早确定。

图 1 底部说明了这种不匹配。一些轨迹很早就达到稳定答案,随后因额外精炼而质量下降。另一些轨迹在持续解码下保持稳定,应予以保持。还有一些轨迹尚未包含可靠答案或支持性依据,因此过早确定会截断推理过程。这些情况表明,核心问题不在于扩散解码在全局上应该是短还是长,而在于当前轨迹适合哪种控制操作。

本文在 LLaDA-V 中研究推理预算不匹配。我们没有选择统一的生成长度,而是提出一种无需训练的推理时控制器,将每个示例路由至三种操作之一:早期确定、基线保持或推理支持型解码。该控制器使用无需标准答案即可计算的轨迹信号,包括答案封闭度、确定性证据和表征修订压力。这些信号不用于估计答案正确性或定义示例的标准语义标签。相反,我们将推理需求作为一个操作性的解码概念:它表示由所观察扩散轨迹所指示的控制操作。这一区分解释了为什么固定的长解码、纯短解码和单一规则干预在某些场景下有帮助,但在其他场景下会失败。扩散视觉-语言模型解码应根据所观察轨迹指示的状态来路由推理时控制,而非依赖统一的解码长度。

我们的贡献有三方面:
- •我们指出了扩散视觉-语言模型解码中的推理预算不匹配问题,即相同的精炼预算可能对已封闭答案的示例过度精炼,同时对推理敏感型示例支持不足。
- •我们为 LLaDA-V 提出了一种无需训练的路由解码控制器,它使用无需标准答案计算的轨迹信号,在早期确定、基线保持和推理支持型解码之间进行选择。
- •我们在答案聚焦型、混合推理型和思维链敏感型设置中评估了该控制器,结果表明路由推理时控制操作比应用单一全局长度规则更具鲁棒性。

## 2相关工作

扩散视觉-语言模型与自适应解码。扩散语言模型通过迭代去噪或掩码精炼生成文本,而非自左向右地确定 token(Nie 等,2026)。LLaDA-V 将此方案扩展到多模态指令跟随和视觉推理,使得在视觉-语言生成过程中可观察中间状态(You 等,2026)。这个过程为推理时控制提供了自然接口,因为解码器可以在最终答案确定之前检查部分预测、不确定性模式和精炼动态。近期的自适应解码方法利用这些内部信号,通过调整去噪步数、块粒度、token 表征或推理模式(Wu 等,2026;Lu 等,2026;Yang 等,2025;Xu 等,2026;Li 等,2026a)。这些方法表明固定的解码调度通常不是最优的,但它们的目标通常是效率、不确定性降低或幻觉缓解。我们的工作研究一种不同的不匹配。合适的控制操作取决于样本的轨迹状态。一些样本已经答案封闭,受益于早期确定;一些仍未解决;还有一些需要推理支持型解码,而非更短的解码。

推理长度、依据与思维链敏感性。更长的推理并非普遍有益。在多模态场景中,扩展推理可以提高任务解决能力,但会削弱视觉依据,应区分推理引发的幻觉与感知引发的错误(Xu 等,2025;Dongre 等,2025)。思维链提示是任务相关的。当中间推理支持决策时它有益,但当答案已可从输入中恢复时,它可能是不必要或有害的(Sprague 等,2025;Cheng 等,2025;Balasubramanian 等,2025)。这表明推理应该是实例条件的,而非全局启用或全局抑制。相关的决策不是对所有样本使用更多或更少的推理,而是当前轨迹是否仍需要结构化的推理支持。基于依据的推理方法表明,当推理必要时,更好的补救措施通常是将中间步骤锚定在视觉证据中,而非截断推理链(Man 等,2025)。我们对答案封闭和思维链敏感情况的区分遵循了这一观点。当进一步的精炼主要增加漂移时,早期确定是有用的;当决策仍取决于未解决的视觉-文本证据时,保持或结构化的推理是有用的。

解码时控制及其边界。无需训练的解码时方法无需重新训练即可修改生成。代表性方法包括视觉对比解码、过度信任惩罚、层对比解码、自校正解码和基于记忆的视觉精炼(Leng 等,2024;Huang 等,2024;Chuang 等,2024;Huo 等,2025;Zou 等,2025)。熵感知解码进一步表明,token 级不确定性可以指导模式切换和不确定性推理状态下的视觉锚点注入(Xu 等,2025)。这些方法证明了内部生成信号可以支持有效的测试时干预。我们的结果指出了单一规则干预的边界。纯短解码、固定长解码和基于修订的控制在某些场景下有帮助,但在其他场景下会失败。因此,我们将内部信号视为选择控制操作的证据,而非通用的幻觉或事实性检测器。这重新定义了扩散视觉-语言模型解码为一个场景条件的决策问题,系统必须决定是早期确定、保持基线路径,还是应用推理支持型解码。

参见标题图 2:推理需求路由解码控制概述。
## 3方法

图 2 展示了我们基于推理需求的路由解码框架概述。该控制器观察一个固定预算的扩散轨迹,并从中间精炼状态中提取三个信号,包括答案封闭度、来自格式和视觉参与度防护措施的依据与格式证据,以及表征修订压力。这些信号不使用黄金标签或直接估计正确性。它们将所观察轨迹指示的状态操作化为在观察到的轨迹下最安全的推理时操作,将每个示例路由至早期确定、基线保持或推理支持型解码,而非使用统一的短或长预算。

### 3.1问题设置

我们研究使用一个冻结的扩散视觉-语言模型进行多模态问答。每个输入为 x=(x_v, x_q, c, I),其中 x_v 是图像,x_q 是问题,c 表示可选的答案选项,I 表示可选的推理指令。模型返回一个答案 \hat{a},并在请求时返回一个推理过程 \hat{r}。

令 B=(T, L, M) 表示解码预算,其中 T 是去噪步数,L 是生成长度,M 是块长度。固定预算参考为每个样本使用相同的预算。在去噪步骤 t,扩散状态为 z_t=(y_t, H_t, P_t),其中 y_t 是 token 状态,H_t 表示隐藏状态,P_t 表示 token 分布。我们将固定预算轨迹和解析输出写为:
z_{t+1} = F_θ(z_t, x, B),
τ_B(x) = (z_0, …, z_T),
o_B(x) = ψ(y_T) = (\hat{a}_B, \hat{r}_B).
这里 θ 是冻结的,ψ 是基准解析器。我们的控制器不更新模型权重,不训练验证器,也不使用黄金标签。它仅从解码轨迹中选择一个操作。

### 3.2代表性轨迹模式

图 3 展示了三种启发我们路由策略的答案 token 轨迹。图中显示了输出位置何时被解码、top-1 预测何时改变,以及答案 token 是否保持正确或发生漂移。这些示例对应于三种解码状态:早期答案封闭后漂移、应保持的晚期收敛以及需要额外支持的推理重型不稳定状态。这些模式促使我们根据样本的推理需求,在早期确定、基线保持和推理支持型解码之间进行选择,而非使用一个固定的解码长度。

### 3.3路由证据

路由器使用三个轨迹信号:答案封闭度、

相似文章

读取轨迹,引导路径:面向扩散语言模型的轨迹感知强化学习

arXiv cs.CL

本文介绍了 CAPR(缓存摊销路径精化),一种用于扩散大语言模型的强化学习算法。该算法无需完整树展开的计算开销,即可从去噪轨迹中提取类树状监督信号。CAPR 在 GSM8K、Math500、数独和倒计时等推理基准测试上达到了最先进的性能,计算成本仅为平坦展开方式的约 0.75 倍。