质询的艺术:一致性增强空间推理中的事实性

arXiv cs.AI 论文

摘要

本文提出一种自监督强化学习框架,利用一致性验证器(检查变换下几何和语义一致性的奖励函数)来提升大型推理模型的空间推理能力,无需真实标注。该方法接近监督微调的准确率,并能泛化到多种任务。

arXiv:2606.11918v1 公告类型:新 摘要:当前的大型推理模型(LRM)展现出显著的通用能力,但在空间推理任务中表现明显不足。现有方法将此差距视为知识缺陷,依赖监督微调(SFT)从外部视觉源或合成引擎获取标注空间数据。相反,我们认为在许多任务中,空间推理能力已经存在于预训练的LRM中,但需要通过几何2D和3D约束下的逻辑一致性来对齐。在这项工作中,我们提出了一种自监督强化学习(RL)框架,针对内部推理过程,无需真实标注。通过形式化一致性验证器的概念——即在变换下检查几何和语义一致性的奖励函数——我们证明模型可以提升其空间推理能力。我们使用图像变换(如翻转)和文本变换(如交换问题中对象的顺序),并提出了一种新的基于最优传输的RL策略OT-GRPO,这是一种针对成对验证器的最小匹配变体的组相对策略优化。我们表明,这种无标签的一致性训练方法接近使用真实监督训练的模型的准确率,并在不同任务和数据领域实现类似的泛化。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:49

# 审问的艺术:一致性提升空间推理的事实性 来源:https://arxiv.org/html/2606.11918

###### 摘要

当前大型推理模型(LRMs)展现出显著的通用能力,但在空间推理任务上表现明显不足。现有方法将此差距视为知识缺陷,依赖监督微调(SFT)从外部视觉源或合成引擎中摄入标注的空间数据。相反,我们认为,对于许多任务,空间推理能力已存在于预训练LRMs中,但需要在几何2D和3D约束下通过逻辑连贯性进行对齐。在这项工作中,我们提出了一种自监督强化学习(RL)框架,针对内部推理过程,无需真实标注。通过形式化一致性验证器(consistency verifiers)——即检查变换下几何和语义一致性的奖励函数——我们证明模型能够提升其空间推理能力。我们同时使用图像变换(如翻转)和文本变换(如交换问题中对象的顺序),并提出一种基于最优传输的RL新策略——OT-GRPO,这是针对成对验证器的组相对策略优化的最小匹配变体。我们表明,这种无标签的一致性训练方法在准确率上接近使用真实监督训练的模型,并在不同任务和数据领域实现了类似的泛化能力。

机器学习,ICML

## 1 引言

空间推理仍然是大型推理模型(LRMs)的一个弱点。最近的基准测试量化了这一差距:在相对位置、深度排序和大小比较等任务上,模型比人类表现差30-40% (Stogiannidis et al., 2025 (https://arxiv.org/html/2606.11918#bib.bib25); Yu et al., 2025 (https://arxiv.org/html/2606.11918#bib.bib32); Cai et al., 2025b (https://arxiv.org/html/2606.11918#bib.bib6); Chen et al., 2025a (https://arxiv.org/html/2606.11918#bib.bib9)),而在更难的组合任务上,性能仅接近随机水平 (Thrush et al., 2022 (https://arxiv.org/html/2606.11918#bib.bib26); Jiang et al., 2025 (https://arxiv.org/html/2606.11918#bib.bib20))。失败表现为高答案方差、对问题措辞的敏感性 (Zhang et al., 2024 (https://arxiv.org/html/2606.11918#bib.bib34)),以及对几何定律的系统性违反——例如,模型可能回答物体A在B的左边,同时又回答B在A的左边。可靠的空间推理对于机器人、导航和具身AI中的下游3D应用至关重要,在这些场景中,此类不一致是不可接受的。

参见图注

图1:一致性验证器示例。给定一个询问物体A是否在物体B左边的问题,我们应用变换(对图像进行水平翻转,对问题进行重新表述)来创建增强提示。一致性验证器检查模型的答案是否满足预期关系——此处为不一致——而不需要真实标签。例如,如果模型在原始问题上回答True,在增强提示上回答False,考虑到变换,无论实际空间布局如何,答案都是一致的。

现有方法将此差距视为事实知识缺陷。一条工作路线是在完全由3D模拟器渲染的合成场景上进行训练 (Chen et al., 2024b (https://arxiv.org/html/2606.11918#bib.bib8))。另一条路线使用级联的视觉模型——如深度估计器、相机标定器、开放词汇检测器——来标注真实图像,生成空间问答对,然后使用监督微调进行训练 (Chen et al., 2024a (https://arxiv.org/html/2606.11918#bib.bib7); Cai et al., 2025a (https://arxiv.org/html/2606.11918#bib.bib5); Cheng et al., 2024 (https://arxiv.org/html/2606.11918#bib.bib11); Ma et al., 2025 (https://arxiv.org/html/2606.11918#bib.bib21))。这两种方法都旨在通过从外部来源摄入标注数据来弥补空间知识的不足,提供进一步训练与额外的空间事实监督作为治疗手段。

我们持不同观点:预训练的LRMs可能已经具备必要的空间能力,但模型的推理过程缺乏内部一致性及对基本几何原理的遵守。先前的工作表明,对多个推理路径进行采样并选择最一致的答案可以提高准确性 (Wang et al., 2022 (https://arxiv.org/html/2606.11918#bib.bib29)),或者在表面提示变化下的不一致是答案不可靠的信号 (Zhang et al., 2024 (https://arxiv.org/html/2606.11918#bib.bib34); Dagan et al., 2025 (https://arxiv.org/html/2606.11918#bib.bib12))。空间推理具有额外的结构,使得一致性更具吸引力。考虑问题“男孩在猫的左边吗?”。翻转图像:左变右,因此答案翻转。裁剪图像:答案保持不变。交换问题中的物体:答案再次翻转。这些变换具有已知的效果——由几何和语言决定,而非场景内容——当模型在其下回答一致时,答案往往正确。关键在于,由于我们知道答案何时应该匹配或翻转,我们无需真实标签即可获得自监督奖励信号。我们将此想法形式化为*一致性验证器*:检查两个模型答案是否满足变换所诱导关系的奖励函数。相关的等变性思想出现在视觉-语言对齐中 (Wang et al., 2023 (https://arxiv.org/html/2606.11918#bib.bib27)),以及循环一致性中,后者已在其他领域被用作奖励信号 (Bahng et al., 2025 (https://arxiv.org/html/2606.11918#bib.bib2))。

我们使用基于组的策略优化 (GRPO) (Guo et al., 2025a (https://arxiv.org/html/2606.11918#bib.bib17)) 来优化一致性验证器。由于我们的验证器是对*成对*完成结果打分,而非单个完成结果,我们引入了OT-GRPO,这是一种最小一致性匹配变体,通过配对完成结果来最大化不一致性。这防止了模型通过偶然对齐获得高奖励,并且优于更简单的配对策略。在四个空间推理任务——方向、深度、大小和相对距离——上,仅使用一致性奖励进行训练几乎与使用真实准确率奖励进行训练相匹配。这一发现表明,强制执行逻辑连贯性能够解锁潜在的空间推理能力,而无需访问标签 (Yue et al., 2025 (https://arxiv.org/html/2606.11918#bib.bib33); Chen et al., 2025b (https://arxiv.org/html/2606.11918#bib.bib10))。我们还发现,一致性可以在任务之间(例如,在方向上进行训练能改善深度)以及数据领域之间(从室内到室外)迁移,表明无标签的一致性训练几乎与真实监督一样具有泛化能力。

#### 贡献。

- • 我们观察到,在提示的几何和语义变换下的一致性是指示空间推理正确性的指标,并提出将其用作自监督奖励信号。
- • 我们形式化了*一致性验证器*——在此类变换下检查答案一致性的奖励函数——并引入了OT-GRPO,这是一种适用于基于组的近端策略优化方法优化成对奖励的最小匹配方案。
- • 我们证明,在四个空间推理任务(方向、深度、大小、相对距离)上,仅使用一致性奖励就接近准确率奖励,并优于包括Visual Jigsaw和SSL4RL在内的七个自监督基线。
- • 我们发现,一致性训练在任务(例如,深度↔大小)和领域(室内↔室外)之间的迁移效果与准确率训练一样有效,并可扩展到数值输出(计数、绝对距离)。

## 2 相关工作

#### 视觉语言模型中的空间推理。

越来越多的基准测试记录了视觉语言模型中的空间推理差距。“Mind the Gap” (Stogiannidis et al., 2025 (https://arxiv.org/html/2606.11918#bib.bib25)) 评估了相对位置,发现模型落后人类超过30%。SIBench (Yu et al., 2025 (https://arxiv.org/html/2606.11918#bib.bib32)) 测试了视角采纳和度量估计,得出了类似发现。EASI (Cai et al., 2025b (https://arxiv.org/html/2606.11918#bib.bib6)) 提供了跨多个空间维度的整体评估。它们揭示了强烈的语义理解并不能迁移到几何理解上。为缩小此差距,先前的工作在来自3D模拟器的合成场景上进行训练 (Chen et al., 2024b (https://arxiv.org/html/2606.11918#bib.bib8)),或使用深度估计器和3D重建器标注真实图像 (Chen et al., 2024a (https://arxiv.org/html/2606.11918#bib.bib7); Cai et al., 2025a (https://arxiv.org/html/2606.11918#bib.bib5); Cheng et al., 2024 (https://arxiv.org/html/2606.11918#bib.bib11))。这两种方向都需要真实监督。我们走了一条不同的道路:不是标注答案,而是利用精心选择的几何或文本变换在答案上诱导出*已知*的映射,从而提供自监督奖励信号。

#### 一致性作为正确性的代理。

一致性指示正确性的想法有多种实例化。Wang等人 (2022 (https://arxiv.org/html/2606.11918#bib.bib29)) 表明,对多个思维链路径进行采样并对答案进行边缘化(自一致性)可以提高推理准确性。Zuo等人 (2025 (https://arxiv.org/html/2606.11918#bib.bib39)) 将多数答案用作RL训练的伪标签。Zhang等人 (2025 (https://arxiv.org/html/2606.11918#bib.bib35)) 通过使用跨问题改写版本的交叉多数投票作为自监督奖励来扩展此思路。Zhao等人 (2025 (https://arxiv.org/html/2606.11918#bib.bib36)) 使用模型的熵作为奖励信号以促进一致性。此外,对提示敏感性的研究记录了模型在表面措辞变化下会改变答案,这表明不一致是一种失败模式 (Zhang et al., 2024 (https://arxiv.org/html/2606.11918#bib.bib34); Dagan et al., 2025 (https://arxiv.org/html/2606.11918#bib.bib12))。并行工作应用RL来促进VLM中的逻辑一致性 (Anonymous, 2025 (https://arxiv.org/html/2606.11918#bib.bib1))。在这项工作中,我们*仅*使用一致性奖励进行训练,而不依赖任何真实标签。

#### 计算机视觉中的一致性。

一致性目标在视觉领域有着悠久的历史。循环一致性使得无配对图像翻译 (Zhu et al., 2017 (https://arxiv.org/html/2606.11918#bib.bib38)) 和对应关系学习 (Zhou et al., 2016 (https://arxiv.org/html/2606.11918#bib.bib37); Wang et al., 2019 (https://arxiv.org/html/2606.11918#bib.bib28)) 成为可能。最近的工作将循环一致性用作视觉-语言对齐的奖励 (Bahng et al., 2025 (https://arxiv.org/html/2606.11918#bib.bib2))。我们的设置不同:我们验证VQA答案之间的*已知*关系——不变性或等变性——完全由变换设计决定,而非从数据中学习。

#### 推理的强化学习。

我们基于GRPO (Guo et al., 2025a (https://arxiv.org/html/2606.11918#bib.bib17); DeepSeek-AI, 2025 (https://arxiv.org/html/2606.11918#bib.bib14)) 构建,这是一种使用基于验证器的奖励而无学习批评者的RL算法。RL在推理中的更广泛作用仍在争论中。Yue等人 (2025 (https://arxiv.org/html/2606.11918#bib.bib33)) 认为,具有可验证奖励的RL充当过滤器,提高采样效率而不扩展底层能力。Chen等人 (2025b (https://arxiv.org/html/2606.11918#bib.bib10)) 提出RL选择预先存在的推理模式而非创造新的模式。我们的结果与此观点一致:一致性奖励引导模型走向满足几何定律的答案,从而浮现预训练模型中已有的潜在准确性。

## 3 一致性验证器

标准的可验证奖励RL (RLVR) 需要真实标签来评估奖励。我们引入*一致性验证器*——一种无需标签的奖励函数,通过验证模型在提示之间几何和文本/语义变换下的一致性来工作。

#### 设置。

令 \(D\) 为VQA提示集 \(x=(I,q)\),将图像 \(I\) 与问题 \(q\) 配对。给定提示 \(x\),模型 \(\pi_\theta\) 产生完成结果 \(y \sim \pi_\theta(\cdot \mid x)\),我们将其解释为答案。我们的目标是训练 \(\pi_\theta\) 产生正确答案,而无需访问真实标签。

#### 提示增强。

从一个提示 \(x=(I,q)\) 出发,我们通过应用从预定义集合 \(T\) 中抽取的变换 \(T\) 来构造一个*增强*提示 \(x'=(I',q')\)。每个变换 \(T \in T\) 分解为 \(T=(T_I,T_q)\),其中 \(T_I\) 是图像变换,\(T_q\) 是文本变换,得到 \(x'=T(x)=(T_I(I),T_q(q))\)。每个变换 \(T\) 在答案空间上诱导出一个*已知*的映射 \(\phi_T\),该映射约束了正确答案作为一对时的关系。具体而言,如果 \((y^\star, y'^\star)\) 是 \((x,x')\) 的正确答案,则 \(y'^\star = \phi_T(y^\star)\)。因此,变换决定了这对答案之间的关系,而不揭示任何一个答案。关键在于,我们知道这对答案必须如何关联,而不知道每个单独的值,这使得无需真实标签即可进行监督。根据 \(T\) 的不同,\(\phi_T\) 采取两种形式之一:

- • *不变性* (\(\phi_T=\mathrm{id}\)):变换保留答案。例如,保留对象的裁剪不会改变空间关系。一致的一对必须同意。
- • *等变性* (\(\phi_T=\neg\)):变换可预测地改变答案。例如,水平翻转交换左右。类似地,文本改写可以交换关系词(如左↔右)或对象引用(A↔B)。一致的一对必须相应不同意。

由于 \(\phi_T\) 完全由 \(T\) 的选择决定,我们可以*无需*知道真实标签来检查一致性。

#### 一致性验证器。

已知映射 \(\phi_T\) 使我们能够检查来自相关提示的完成结果是否*相互一致*。我们定义*一致性验证器*为:

\[
\text{verif}_T(y,y') = \begin{cases} 1 & \text{if } y' = \phi_T(y), \\ 0 & \text{otherwise}, \end{cases}
\]

其中 \(y \sim \pi_\theta(\cdot \mid x)\) 和 \(y' \sim \pi_\theta(\cdot \mid x')\) 分别是来自原始和增强提示的完成结果。验证器返回 1 当且仅当两个答案满足预期关系。由于 \(\phi_T\) 完全由变换设计决定,验证器可以在没有真实标签的情况下进行评估——它提供了基于跨提示一致性的*自监督*奖励信号。

#### 示例说明。

考虑一个VQA,问题 \(q\) = “物体A在物体B左边吗?是/否”。我们通过三种操作的组合构造增强提示 \(x'\):
1. *图像*:应用水平翻转,交换左↔右。
2. *文本*:交换对象引用(A↔B)。
3. *文本*:替换关系(左→右)。

每个操作都会取反答案。由于我们应用了三个取反,净效果也是一个取反。

相似文章

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。

SVoT: 基于强化学习的状态感知思维可视化空间推理

arXiv cs.AI

论文提出了SVoT,一种用于多模态大语言模型(MLLMs)中多跳空间推理的强化学习框架,该框架生成交错、可验证的中间状态和可视化,在涉及多对象交互和数值推理的新基准测试上取得了显著的准确性提升。