基于约束锚定的推理轨迹

arXiv cs.AI 论文

摘要

提出CART,一种神经符号框架,将自然语言推理步骤与符号约束断言交织在一起,以在链式思维轨迹中早期检测并纠正多模态LLMs的错误。将雪球率从65%降低到14%,并在多个基准上提高了准确性。

arXiv:2607.16727v1 公告类型:新 摘要:自回归多模态大语言模型(MLLMs)存在错误雪崩问题:链式思维(CoT)轨迹早期的一个错误推理会破坏所有后续推理。我们发现,在先进的开源MLLMs中,一旦出现第一个错误,在65%的情况下推理会级联失败(我们将此指标称为雪崩率)。现有的缓解方法——采样多条链、事后自我验证或完整程序合成——要么缺乏符号基础,要么发现错误太晚,要么牺牲了自然语言推理的灵活性。我们提出基于约束锚定的推理轨迹(CART),这是一种神经符号框架,训练MLLMs将自然语言推理步骤与符号约束断言交织在一起:关于视觉内容的轻量级、机器可检查的陈述(例如count(red_objects)=3)。一个双管齐下的约束传播模块——结合了学习的神经接地头与布尔约束传播——持续地根据提取的视觉特征验证这些锚点,并检查它们之间的逻辑一致性。当检测到矛盾时,回溯控制器停止生成并回退到最后一个一致的检查点,从而防止错误传播。可变频率发射机制允许模型自适应控制锚点密度,避免轨迹膨胀。我们通过从场景图中获取真实约束注释来增强GQA、CLEVR-CoGenT和VCR,构建了218K训练实例,并通过LoRA对开源MLLMs(LLaVA-NeXT、Qwen2-VL)进行微调。在五个基准上,CART将雪崩率从0.65降低到0.14,在GQA准确率上比仅训练的基线提高了4.6个百分点,并在POPE-all上达到89.1 F1,推理开销最多增加18%。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:40

# Constraint-Anchored Reasoning Traces Source: https://arxiv.org/html/2607.16727

Zehua Cheng 和 Wei Dai 和 Jiahao Sun
Flock.io
United Kingdom
[email protected] (mailto:[email protected])
(2026)

###### 摘要

自回归多模态大语言模型(MLLMs)存在错误雪崩问题:在思维链(CoT)推理过程中,早期的一个错误推理会污染所有后续推理。我们发现,在最新的开源 MLLM 中,一旦出现第一个错误,在 65% 的情况下推理会级联导致后续所有步骤失败(我们将此度量称为*雪崩率*)。现有的缓解方法——如采样多条链、事后自我验证或完整的程序合成——要么缺乏符号基础,要么发现错误太晚,要么牺牲了自然语言推理的灵活性。我们提出**约束锚定推理轨迹(CART)**,这是一个神经符号框架,训练 MLLM 将自然语言推理步骤与符号约束断言交错进行:这些断言是关于视觉内容的轻量级、可机器检查的语句(例如,`count(red_objects) = 3`)。一个双管齐下的约束传播模块——结合了学习的神经基础头(neural grounding head)和布尔约束传播——持续根据提取的视觉特征验证这些锚点,并检查它们之间的逻辑一致性。当检测到矛盾时,回溯控制器会停止生成并回退到最后一个一致的检查点,从而防止错误传播。一种可变频率的锚点发射机制允许模型自适应控制锚点密度,避免轨迹膨胀。我们通过用从场景图导出的真实约束注释增强 GQA、CLEVR-CoGenT 和 VCR,构建了 218K 个训练实例,并通过 LoRA 对开源 MLLM(LLaVA-NeXT、Qwen2-VL)进行微调。在五个基准上,CART 将雪崩率从 0.65 降低到 0.14,在 GQA 上的准确率比仅训练基线提高了 +4.6 个百分点,并在 POPE 上达到了 89.1 的 F1 分数——所有这一切的推理开销最多为 18%。

多模态推理,思维链,错误纠正,神经符号系统,约束传播,视觉问答,大型语言模型 ††copyright:acmlicensed††journalyear:2026††doi:XXXXXXX.XXXXXXX††conference:第 34 届 ACM 国际多媒体会议;2026 年 10 月;爱尔兰都柏林††ccs:计算方法论 知识表示与推理††ccs:计算方法论 空间与物理推理

## 1. 引言

多模态大语言模型(MLLMs)在视觉-语言任务中展示了显著的能力,但其自回归生成范式存在一个关键的结构性脆弱性:**错误雪崩**。当模型在思维链(CoT)推理轨迹早期做出错误推理时,后续每一步都依赖于这个错误前缀,导致下游推理级联成复合失败(Zhang 等人,2023a (https://arxiv.org/html/2607.16727#bib.bib12); Wei 等人,2022 (https://arxiv.org/html/2607.16727#bib.bib13))。在组合式视觉问答中——回答单个问题可能需要计数对象、识别空间关系以及推理属性——一个错误识别的对象就可能在缺乏外部纠正的情况下破坏整个演绎链。

现有的缓解 MLLM 推理错误的方法大致分为三类,每类都有根本性的缺陷。**基于采样的方法**(Wang 等人,2023 (https://arxiv.org/html/2607.16727#bib.bib14); Yao 等人,2023 (https://arxiv.org/html/2607.16727#bib.bib15))生成多个候选链,并通过多数投票或启发式评分选择答案,但无法识别哪个步骤失败以及为什么失败——它们只是希望正确链出现在样本中。**事后自我验证**(Shinn 等人,2023 (https://arxiv.org/html/2607.16727#bib.bib16); Madaan 等人,2023 (https://arxiv.org/html/2607.16727#bib.bib17))提示模型批评自己的输出,但这种口头自我评估缺乏视觉输入的基础;产生错误的同一个模型不太可能仅通过内省可靠地检测错误。**程序合成**(Gupta and Kembhavi, 2023 (https://arxiv.org/html/2607.16727#bib.bib18); Surís 等人,2023 (https://arxiv.org/html/2607.16727#bib.bib19))通过生成可执行代码完全绕开自然语言推理,获得了强大的符号保证,但牺牲了自然语言轨迹的可解释性和灵活性——当推理领域不能简化为固定 API 时,这是一个关键限制。

我们观察到,需要的是一个**有原则的中间地带**:一个在保留自然语言推理灵活性的同时,注入可验证的符号检查点,能够在错误发生时捕捉它们并在它们传播之前触发纠正动作的框架。为此,我们提出**约束锚定推理轨迹(CART)**,一个训练 MLLM 将标准推理步骤与**符号约束断言**交错进行的框架——这些是关于视觉内容的轻量级、可机器检查的语句(例如,`count(red_objects) = 3`,`left_of(dog, cat) = True`)。一个专用的**约束传播模块(CPM)**通过神经基础头(neural grounding head)持续根据提取的视觉特征验证这些锚点,并通过布尔约束传播(BCP)检查它们之间的相互逻辑一致性。当检测到矛盾时——无论是锚点与图像之间还是累积锚点之间——生成停止,**回溯控制器**将轨迹回退到最后一个一致的检查点,防止错误传播。CART 的一个关键设计洞察是**可变频率锚点发射**:模型不僵硬地在推理步骤和约束之间交替,而是学习在每个步骤后发射零个、一个或多个锚点,当没有有意义的约束适用时使用显式的空标记。这种自适应密度避免了强制发射导致的轨迹膨胀和稀疏发射造成的约束不足。

我们通过用从场景图和结构化程序导出的真实约束注释增强现有的视觉推理数据集(GQA(Hudson and Manning, 2019 (https://arxiv.org/html/2607.16727#bib.bib2))、CLEVR-CoGenT(Johnson 等人,2017 (https://arxiv.org/html/2607.16727#bib.bib1))、VCR(Zellers 等人,2019 (https://arxiv.org/html/2607.16727#bib.bib3)))来训练 CART,得到了 218K 个训练实例。通过 LoRA 对开源 MLLM(LLaVA-NeXT(Liu 等人,2024a (https://arxiv.org/html/2607.16727#bib.bib7))、Qwen2-VL(Wang 等人,2024 (https://arxiv.org/html/2607.16727#bib.bib11)))进行微调,联合优化任务损失、约束基础损失和一种新颖的回溯感知损失,该损失教会模型从模拟错误中恢复。

我们的贡献总结如下:
- • 我们形式化了自回归多模态推理中的错误雪崩问题,并提出了 CART,一个将自然语言推理与可验证的符号约束锚点以及运行时约束传播模块交错进行的神经符号框架。
- • 我们引入了可变频率锚点发射机制、结合神经视觉基础与符号布尔约束传播的双管齐下验证引擎,以及具有正式错误减少保证的回溯控制器(定理 4 (https://arxiv.org/html/2607.16727#A1.Thmtheorem4))。
- • 我们定义了三个新的诊断度量——雪崩率、约束违背率和错误归因精度——它们直接衡量超出标准最终任务准确率的错误传播行为。
- • 在五个基准(GQA、CLEVR-CoGenT、VCR、MM-Vet、POPE)上的大量实验表明,CART 在实现最先进准确率的同时,将雪崩率从 0.65 降低到 0.14,推理开销仅为 10–18%。

## 2. 相关工作

**MLLM 中的思维链推理。** 思维链提示(Wei 等人,2022 (https://arxiv.org/html/2607.16727#bib.bib13))及其变体已成为从大语言模型中引出多步推理的事实标准方法。零样本 CoT(Kojima 等人,2022 (https://arxiv.org/html/2607.16727#bib.bib20))和少样本提示策略提高了算术和常识基准的性能,而多模态扩展(Zhang 等人,2023b (https://arxiv.org/html/2607.16727#bib.bib21); Lu 等人,2022 (https://arxiv.org/html/2607.16727#bib.bib22))将这些技术适应于视觉-语言任务。然而,标准 CoT 没有提供检测或纠正中间错误的机制。思维树(Yao 等人,2023 (https://arxiv.org/html/2607.16727#bib.bib15))通过基于 LLM 评估的广度优先或深度优先搜索探索多个推理分支,但评估器与生成器共享相同的失败模式。自一致性(Wang 等人,2023 (https://arxiv.org/html/2607.16727#bib.bib14))通过多数投票对采样链进行边缘化,统计上提高了鲁棒性,但未提供每条链的错误纠正。DDCoT(Zheng 等人,2023 (https://arxiv.org/html/2607.16727#bib.bib23))将问题分解为子问题进行分治推理,但仍依赖模型的内部表示来保证正确性。CART 与所有这些方法的不同之处在于引入了**外部可验证**的符号检查点,将中间推理锚定在视觉输入中,从而实现针对性纠正而非统计聚合。

**神经符号视觉推理。** 符号推理与神经感知的整合在视觉问答领域有着悠久的历史。神经模块网络(Andreas 等人,2016 (https://arxiv.org/html/2607.16727#bib.bib24); Hu 等人,2017 (https://arxiv.org/html/2607.16727#bib.bib25))根据问题的句法分析组合可微模块,而 NS-VQA(Yi 等人,2018 (https://arxiv.org/html/2607.16727#bib.bib26))使用场景解析器构建用于程序执行的符号表示。最近,VisProg(Gupta and Kembhavi, 2023 (https://arxiv.org/html/2607.16727#bib.bib18))和 ViperGPT(Surís 等人,2023 (https://arxiv.org/html/2607.16727#bib.bib19))利用 LLM 生成调用专用视觉模块的可执行 Python 程序。忠实 CoT(Lyu 等人,2023 (https://arxiv.org/html/2607.16727#bib.bib27))将推理链翻译为符号程序进行验证。这些完全符号化的方法在 CLEVR 等结构化基准上取得了强有力的保证,但在现实世界视觉推理(如 VCR)的模糊性和开放性上挣扎,因为僵硬的程序模板无法捕捉演绎策略的全部谱系。CART 占据了一个互补的位置:它保留自然语言作为主要推理媒介,同时选择性地在视觉基础可验证的点注入符号断言,在需要的地方保持灵活性,在可能的地方强制执行精确性。

**错误纠正与自我完善。** 一些近期工作通过迭代完善来解决自回归推理的脆弱性。Reflexion(Shinn 等人,2023 (https://arxiv.org/html/2607.16727#bib.bib16))维护一个口头自我反思的情景记忆以改进后续尝试,而 Self-Refine(Madaan 等人,2023 (https://arxiv.org/html/2607.16727#bib.bib17))在单次推理过程中在生成和自我批评之间迭代。在视觉领域,视觉验证方法(Deng 等人,2024 (https://arxiv.org/html/2607.16727#bib.bib28))提示 MLLM 在生成答案后重新检查图像。然而,这些方法依赖模型自身的内部表示用于错误检测——正是产生错误的同一表示。CART 引入了一个**部分外部**的验证循环:神经基础头锚定在**独立提取**的视觉证据上(来自冻结的 Grounding DINO(Liu 等人,2024b (https://arxiv.org/html/2607.16727#bib.bib9))检测器的区域特征),而非仅依赖生成器自身对图像的注意力,并且 BCP 提供了对累积锚点的不可微、可靠的符号一致性检查。我们注意到,基础头并非完全独立于生成器——它也消费锚点的 LLM 隐藏状态嵌入(§3.2.2 (https://arxiv.org/html/2607.16727#S3.SS2.SSS2))——但将检查锚定在外部视觉特征和符号一致性测试中,仍然缓解了那些仅使用生成器内部表示进行验证的方法的纯自我指涉失败模式。

参考图注

图 1:CART 框架概览。给定一张图像和问题,MLLM 生成交错的推理步骤和符号约束锚点。约束传播模块(CPM)通过神经基础头和布尔约束传播验证每个锚点。当检测到违反时,回溯控制器回退到最后一个一致的检查点并恢复生成,使用一个 token。架构图显示 CART 流程:MLLM 生成与约束锚点交错的推理步骤,这些锚点由 CPM(神经基础头和 BCP)验证。回溯控制器处理检测到的违规。

## 3. 方法论

我们提出**约束锚定推理轨迹(CART)**,一个通过交错符号约束断言和运行时约束传播模块来增强自回归多模态推理的框架,该模块能够检测不一致性并触发针对性的回溯。下面我们详细阐述公式化、架构、理论保证和训练过程。

### 3.1. 问题公式化

令 $\mathcal{I}$ 表示图像空间,$\mathcal{Q}$ 表示自然语言问题空间。一个由参数 $\theta$ 参数化的多模态大语言模型(MLLM)$\mathcal{M}_\theta$,给定图像 $I \in \mathcal{I}$ 和问题 $q \in \mathcal{Q}$,通过自回归思维链(CoT)轨迹 $\mathbf{r} = (r_1, r_2, \ldots, r_T)$ 产生答案 $a$,其中每个 $r_t$ 是一个推理步骤(一个标记跨度)。最终答案 $a = f_{\text{ans}}(\mathbf{r})$ 从最后一步提取。我们将由 MLLM 的冻结视觉编码器提取的视觉特征库表示为 $\mathbf{V} = \phi(I) \in \mathbb{R}^{N \times d_v}$,其中 $N$ 是空间标记的数量,$d_v$ 是每个标记的特征维度。

**错误雪崩。** 我们将步骤 $t$ 处的**错误事件**定义为 $e_t = \mathbb{1}[ \text{sem}(r_t) \neq \text{sem}(r_t^*) ]$,其中 $\text{sem}(\cdot)$ 提取步骤的语义命题,$r_t^*$ 是真实对应的步骤。**雪崩率** $\mathcal{S}$ 是给定第一个错误后所有

相似文章

CoRA: 面向可靠思维链推理的置信度-理由对齐

arXiv cs.CL

本文介绍了CoRA,一种基于GRPO的强化学习框架,旨在将LLM的置信度与生成的理由对齐,以提高思维链推理的可靠性,在多个基准测试中将不对齐误差降低了高达26.51%。

面向高效可控LLM推理的代理式思维链引导

Hugging Face Daily Papers

ACTS(代理式思维链引导)将LLM推理控制形式化为马尔可夫决策过程,其中控制器代理在推理过程中使用推理策略和引导短语自适应地引导冻结的推理器。该方法在显著节省token的同时实现了与完全思考模型相当的准确率,支持可控的准确率-效率权衡。

置信度感知对齐让推理型大语言模型更加可靠

arXiv cs.AI

本文介绍了CASPO框架,该框架通过迭代直接偏好优化(DPO),将token级别的置信度与大型推理模型中的逐步逻辑正确性进行对齐。文章还提出了置信度感知思考(CaT),用于在推理过程中动态剪枝不确定的推理分支,以提高可靠性和效率。

ReasoningFlow: 用于理解LLM推理轨迹的篇章结构

arXiv cs.CL

介绍 ReasoningFlow,一个将大语言模型推理轨迹的篇章结构捕获为有向无环图的框架,从而能够细粒度分析推理行为(如自我反思和回溯)。基于对数千条轨迹的手动和自动标注,揭示了模型之间的结构相似性,并且大多数错误步骤并不贡献于最终答案。