在测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法
摘要
本文提出了一种面向大型视觉语言模型的测试时对齐方法,利用轨迹引导的结构化采样和迭代MCMC细化,在不进行大量后训练的情况下提高视觉推理准确性。
arXiv:2608.03204v1 公告类型:新
摘要:后训练强化学习(RL)算法通常用于使大型视觉语言模型(LVLM)与人类意图及视觉推理任务的要求对齐。然而,现有的基于RL的对齐方法往往资源密集,并且会遇到训练目标与推理时分布不匹配的问题。为弥合这一差距,我们提出了一种新颖的测试时对齐方法,利用轨迹引导的结构化采样进行动态推理时细化,从而实现更好的视觉接地对齐并确保逻辑一致性。我们的方法首先通过轨迹学习算法构建推理记忆库,该算法将复杂问题求解分解为预定义推理模式的有序序列。随后,通过首先从推理记忆库中收集轨迹以建立全局结构推理先验,然后使用迭代马尔可夫链蒙特卡洛(MCMC)算法对推理轨迹进行局部多目标细化,从而完成推理时对齐。跨多个多模态推理数据集的实验表明,我们的方法显著提高了准确性,且不会带来过高的推理开销。这些结果表明,轨迹引导的测试时采样是传统后训练对齐的一种可扩展且有效的替代方案,尤其适用于复杂的视觉推理任务。
查看缓存全文
缓存时间: 2026/08/05 07:44
# 在测试时对齐大型视觉-语言模型:轨迹引导的结构化采样方法
来源:https://arxiv.org/html/2608.03204 \(2026\)
###### 摘要
训练后的强化学习(RL)算法通常用于将大型视觉-语言模型(LVLMs)与人类意图及视觉推理任务的要求对齐。然而,现有的基于 RL 的对齐方法往往资源密集,并且在训练目标与推理时分布之间存在不匹配。为弥合这一差距,我们提出了一种新颖的测试时对齐方法,利用轨迹引导的结构化采样进行动态推理时精炼,从而实现与视觉基础的更好对齐并确保逻辑一致性。我们的方法首先通过轨迹学习算法构建推理记忆库,该算法将复杂问题的求解分解为预定义推理模式的有序序列。随后,它通过先从推理记忆库中收集轨迹以建立全局结构化推理先验,再使用迭代马尔可夫链蒙特卡洛(MCMC)算法对推理轨迹进行局部多目标精炼,从而完成推理时对齐。在多个多模态推理数据集上的实验表明,我们的方法显著提高了准确性,且未带来过高的推理开销。这些结果确立了轨迹引导的测试时采样作为传统训练后对齐的可扩展、高效替代方案,尤其适用于复杂视觉推理任务。
测试时对齐,大型视觉-语言模型
††copyright:cc††journalyear:2026††doi:10.1145/3767308.3835984††conference:第34届ACM国际多媒体会议;2026年11月10–14日,巴西里约热内卢††isbn:979-8-4007-2213-4/2026/11††ccs:计算方法 知识表示与推理††ccs:计算方法 自然语言生成
## 1. 引言
尽管大型视觉-语言模型(LVLMs)在许多任务上表现出色([Bai 等,2025b](https://arxiv.org/html/2608.03204#bib.bib1);[Zhu 等,2025](https://arxiv.org/html/2608.03204#bib.bib30)),但在需要强大视觉基础和多步推理的复杂视觉推理任务上,它们仍然不可靠([Zhang 等,2025](https://arxiv.org/html/2608.03204#bib.bib46);[Yao 等,2025](https://arxiv.org/html/2608.03204#bib.bib32))。在这种情况下,即使在训练后,它们也常常无法在推理时保持基于视觉且逻辑连贯的中间推理,偏离视觉证据,产生不稳定的推理轨迹。现有的对齐方法,如从人类反馈中进行强化学习(RLHF)([Yu 等,2024](https://arxiv.org/html/2608.03204#bib.bib3))、直接偏好优化(DPO)([Liu 等,2025](https://arxiv.org/html/2608.03204#bib.bib4))和基于可验证奖励的强化学习(RLVR),主要通过离线参数更新来解决这一问题。然而,此类基于训练的方法计算代价高昂,并且对推理时推理的控制力有限,尤其是在新的或不可预见的输入分布下。
图 1. 标准自回归解码会做出局部最优的选择,可能导致错误。相比之下,幂缩放采样通过幂变换概率 \(p^\alpha\)(\(\alpha>1\))对完整序列进行重新加权。
在推理时对齐 LVLM 且不修改其底层权重,成为解决基于训练的对齐方法局限性的一个有前景的方向([Lin 等,2025](https://arxiv.org/html/2608.03204#bib.bib9);[Xu 等,2025a](https://arxiv.org/html/2608.03204#bib.bib38)),例如基于集成的假设重新加权([Lee 等,2025](https://arxiv.org/html/2608.03204#bib.bib37))和基于预测规划的对齐([Wang 等,2025c](https://arxiv.org/html/2608.03204#bib.bib39))。在这一范式内,基于采样的测试时对齐提供了一种有吸引力的权衡:利用额外的解码时间计算来搜索在分布偏移下更能满足任务目标的输出。在实践中,这通常通过重塑模型输出分布来实现,例如通过奖励模型引导的重新加权([Lin 等,2025](https://arxiv.org/html/2608.03204#bib.bib9))、重要性加权扰动([Kanai 等,2025](https://arxiv.org/html/2608.03204#bib.bib10))或迭代细化。最近,[Karan 和 Du (2025)](https://arxiv.org/html/2608.03204#bib.bib5) 证明,通过 Metropolis–Hastings (MH) 从幂缩放分布 \(p^\alpha\) 中采样,可以获得与 RLVR 相当的无训练推理改进。如图 1 所示,幂缩放采样中的序列级重新加权避免了误导性的局部词元选择,并且比自回归解码更好地保留视觉证据。
尽管有这些优势,将基于 MH 的幂采样应用于 LVLM 的视觉推理仍然具有挑战性。首先,当视觉证据较弱时,幂缩放可能放大语言先验([Wang 等,2025a](https://arxiv.org/html/2608.03204#bib.bib44))和缺乏视觉支持的细节,从而加剧幻觉。其次,复杂的视觉推理需要长跨度、多步演绎,并且存在多条合理的求解路径。例如,解决图 1 中的问题需要模型先识别 \(x=2\) 和 \(x=5\) 处的导数,然后再进行比较。采样很容易漂移到高熵、不稳定的推理分支中。最后,对于长跨度生成,所诱导的马尔可夫链在高维词元空间中通常混合缓慢([Brown 和 Rosenthal, 2025](https://arxiv.org/html/2608.03204#bib.bib11)),导致接受率低和许多代价高昂的提议展开,从而显著增加推理延迟。
为了解决这些局限性,我们提出了一个无训练的测试时对齐框架,将计算分配到解码过程中的目标性、结构化精炼。我们首先通过轨迹学习算法构建推理记忆库,其中每条轨迹将复杂问题的求解过程编码为高层推理模式的有序序列。给定查询时,我们从库中检索最相似的 top-\(k\) 个示例,并通过多数投票聚合它们的轨迹,以获得单一引导轨迹。该轨迹为推理结构和步骤顺序提供了全局先验,而 LVLM 负责将每个模式实例化为任务特定的推理内容。基于这种分解,我们的结构化采样算法每次迭代初始化一个推理模式,并在相邻推理模式的滑动窗口内执行 MCMC 精炼。这种局部精炼产生低方差提议并缓解慢混合问题,使 MCMC 对长文本 LVLM 生成切实可行。在此采样器之上,我们定义了三个互补目标来塑造幂缩放目标分布:用于促进视觉基础的视觉感知分布锐化、用于偏好可靠轨迹的熵正则化,以及用于抑制退化生成的语言控制项。总之,轨迹引导的结构化提议、迭代 Metropolis–Hastings 推断和协同目标的集成,为复杂视觉推理实现了有效的测试时对齐。我们的主要贡献有三点:
- 我们提出了一种基于智能体框架的自动轨迹学习算法,旨在构建和存储候选轨迹,从而建立推理过程的持续记忆。
- 我们开发了一种轨迹引导的结构化采样方法,从记忆中检索轨迹作为结构化推理先验,随后通过迭代 MCMC 轨迹精炼,利用视觉感知分布锐化、熵正则化和语言退化控制促进视觉基础与稳定生成,从而确保推理过程中的对齐。
- 跨多个推理基准的大量实验表明,我们的方法在准确性和采样效率上都有持续提升,确立了我们的无训练测试时采样方法作为 RLVR 的高效替代方案。
## 2. 预备知识
幂缩放采样。设 \(V\) 和 \(X\) 分别表示视觉和文本输入,令 \(\mathbf{Y}=\langle y_0,\ldots,y_T\rangle\) 为有限输出词元序列,其中 \(y_t\in\mathcal{V}\),\(\mathcal{V}\) 是模型词表。一个 LVLM 在 \(\mathcal{Y}\) 上诱导出一个归一化的自回归分布:
(1) \(P(\mathbf{Y}\mid V,X)=\prod_{t=0}^{T} P(y_t\mid V,X,y_{<t})\)
对于 \(\alpha>1\),对应的非归一化目标为:
(2) \(p_\alpha(\mathbf{Y}\mid V,X)\propto P(\mathbf{Y}\mid V,X)^\alpha\)
它放大了序列似然之间的差异,并将概率质量集中在基础模型下高似然的轨迹上。幂采样在序列级别操作,对完整续写 \(\mathbf{Y}\) 进行重新加权,而不是在每一步做出贪心或温度缩放的决策,如图 1 所示。从幂分布中采样隐式地有利于更长视界的规划,因为它优先考虑全局连贯、高似然的轨迹,并缓解由关键词元([Abdin 等,2024](https://arxiv.org/html/2608.03204#bib.bib45))引起的失败——这些词元会将生成引向低似然续写。
图 2. 我们方法的概览。我们首先基于轨迹学习算法构建推理记忆库。在推理时,检索到的轨迹提供全局结构化推理先验,同时 MCMC 在选定的推理片段内执行局部更新,以迭代地将生成引向对齐目标。
## 3. 方法
在本节中,我们介绍了用于 LVLM 视觉推理的测试时对齐方法(图 2)。我们首先介绍自动轨迹记忆整理流程(第 3.1 节),该流程使用智能体框架在预定义的推理模式下搜索有效的推理路径。然后,我们描述了结构化采样算法(第 3.2 节),其中轨迹引导为 LVLM 推理提供了结构先验,并使用 Metropolis–Hastings 在相邻推理模式的局部窗口内执行迭代精炼。最后,我们介绍了我们的相似文章
小型RL控制器与大型语言模型:RL引导的测试时自适应采样
本文将大型语言模型的自适应采样建模为马尔可夫决策过程,并训练一个轻量级强化学习控制器来平衡正确性、延迟和计算成本,从而实现了更好的权衡。
检索,而非重新训练:在测试时将视觉语言动作模型扩展到新任务
本文介绍了一种检索增强的视觉-语言-动作策略,通过使用预训练模型和索引演示,消除了每个任务的微调,实现了高效的跨本体泛化和测试时的任务适应。
小型视觉语言模型在多语言视觉多选题上的测试时扩展
本文研究了在面向多语言视觉多选题基准EXAMS-V上,针对小规模开放视觉语言模型(参数量≤7B)的测试时扩展技术。研究发现,推理预算和可解析性比复杂的搜索或验证方法更为重要。最佳配置在ImageCLEF 2026测试集上达到84.1%的准确率,在排行榜上排名第一。
RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时缩放
本文介绍了RL^2,一种用于视觉-语言-动作模型的自适应推理时引导框架,它利用潜在表示上的离线强化学习来组合动作流,并且仅在预测到失败时激活引导。在SIMPLER和PolaRiS基准上,它实现了最高+17.3%的成功率提升,并展示了真实世界的迁移能力。
大型语言模型的对齐微调:以数据为中心的视角看对齐数据流水线
本综述将大型语言模型的对齐微调重新表述为一个数据流水线设计问题,将其分解为三个环节:响应合成、偏好评估和偏好实例化。它识别了设计权衡和失败模式,并概述了开放挑战,如提示级对齐和智能体设置。