UniCAR-RL:视觉数学中先看得更清楚再深入思考

arXiv cs.AI 论文

摘要

UniCAR-RL 引入了一个强化学习框架,通过解耦感知与推理,无需标注即可提升多模态大语言模型的视觉数学推理能力。

arXiv:2609.13849v1 公告类型:新 摘要:多模态大语言模型(MLLMs)常在复杂数学视觉推理中遇到困难,主要原因在于缺乏细粒度感知,导致初始视觉幻觉直接引发级联推理失败。在传统的端到端强化学习(RL)中,稀疏奖励无法将感知幻觉与逻辑失误解耦,阻碍了针对性的感知优化。或者,使用感知增强的 CoT 数据进行微调,成本高昂且存在幻觉。本文通过提出 UniCAR-RL 这一无需标注的 RL 框架来应对这些挑战。通过在训练过程中明确解耦感知与推理的优化,实现了两者能力的隔离与优化。具体而言,UniCAR-RL 由三个协同分支组成:1)Caption-RL 分支,通过验证器引导的推理验证优化感知能力;2)Reasoning-RL 分支,基于最佳图像描述执行逻辑推理以阻止级联错误;3)QA-RL 分支,保留原生端到端对齐以确保稳健的问答性能。实验表明,UniCAR-RL 仅使用原始简短回答数据,就能显著提升 MLLMs 的数学和视觉推理能力。此外,它在多种架构和规模上展示了强大的泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/09/15 09:03

# UniCAR-RL:在视觉数学中看得更清,才能想得更深
来源:https://arxiv.org/html/2609.13849

**作者**:严皓(邮件:[email protected],GitHub:https://github.com/yzli9/UniCAR-RL)、王浩(华为技术有限公司)、刘星晨(华中科技大学)、余雅琦(华为技术有限公司)、吴继豪(华为技术有限公司)、廖明辉、陈威(华中科技大学)、刘宇亮

**贡献说明**:*同等贡献。 †项目负责人。 ‡通讯作者。

#### 摘要

多模态大型语言模型(MLLMs)在处理复杂的数学视觉推理时常常面临困难,主要原因在于缺乏细粒度的感知能力,这导致了初步的视觉幻觉直接引发级联推理失败。在传统的端到端强化学习(RL)中,稀疏奖励无法将感知幻觉与逻辑错误解耦,阻碍了针对感知的优化。另一种选择是,使用增强感知的链式思维(CoT)数据进行微调,但这会产生高昂的成本并导致幻觉。本文通过提出UniCAR-RL解决了这些挑战,这是一个用于无标注感知优化的强化学习框架。它在训练过程中显式地解耦感知和推理的优化,实现了两种能力的隔离与优化。具体而言,UniCAR-RL由三个协同分支组成:1) **Caption-RL分支**,通过验证器引导的推理验证来优化感知能力;2) **Reasoning-RL分支**,基于标准的图像描述进行逻辑推理,以终止级联错误;3) **QA-RL分支**,保留原生的端到端对齐,以确保稳健的问答性能。实验表明,仅使用原始的简短答案数据,UniCAR-RL就显著提升了MLLMs的数学和视觉推理能力。此外,它还展示了在不同架构和规模上强大的泛化能力。

## 1 引言

参考图注

**图1:所提方法的动机。(a) 突出了MLLMs在视觉数学推理中的感知瓶颈,但现有RL方法难以解决;(b) 展示了现有的感知增强方法及其局限性;(c) 提供了在视觉数学推理任务上错误分布的比较。**

在思维链(CoT)[1, 2]和强化学习(RL)[3, 4]技术快速发展的推动下,多模态大型语言模型(MLLMs)在处理复杂任务的推理能力上取得了显著进展[5, 6, 7]。然而,当面对抽象的视觉推理任务(如数学[8, 9]和逻辑[10, 11])时,现有MLLMs的表现仍不尽如人意。大量研究[12, 13, 14]表明,主要的瓶颈并非模型推理能力不足,而是缺乏细粒度的感知能力。如图1(a)所示,在处理复杂数学图形时,模型容易错误解读关键但细微的视觉条件,导致后续严格的数学推理建立在幻觉的视觉前提之上。这些初始的视觉误解从根本上导致了数学推理的崩溃。如图1(b)所示,最近的大量研究强调了增强MLLMs细粒度视觉感知能力的重要性。一些近期工作[15, 16]试图通过蒸馏高质量、增强感知的CoT数据来优化模型的感知能力。然而,这些方法严重依赖昂贵的专家级标注,并且固有地受到教师模型幻觉的限制。或者,作为提升模型在复杂任务上性能的有效范式,RL已被用于优化。然而,RL中稀疏的全局奖励无法区分错误预测是源于视觉误解还是逻辑错误,从而使得感知优化效率低下。为了解决现有方法的这些挑战,我们提出了统一的描述-回答-推理强化学习(UniCAR-RL),这是一个用于无标注感知优化的RL框架。如图1(b)所示,UniCAR-RL通过引入显式的图像描述过程和高级验证器,从根本上将感知评估与端到端黑盒训练解耦。具体而言,为了获得纯粹的感知反馈信号,UniCAR-RL的**Caption-RL分支**隔离了MLLM的内部推理模块以生成专属的图像描述,并直接利用高级验证器对该描述的评估作为奖励。如果验证器仅凭图像描述就能成功推导出真实答案,这便确认了视觉信息的无瑕提取。因此,这种验证机制为MLLMs返回了明确的直接感知奖励,使得在消除推理错误干扰的同时,能够精确优化感知能力。在高质量图像描述的基础上,**Reasoning-RL分支**进一步增强了模型的逻辑推理能力。在此阶段,该分支迫使模型严格基于前一阶段验证的高质量描述,进行独立的数学推理。这种视觉隔离的设计从根本上切断了细粒度感知幻觉进入推理过程的错误级联,确保优化信号纯粹且集中地用于增强逻辑推导能力。最后,**QA-RL分支**在端到端联合优化感知和推理的同时,保持模型原有的问答专长。通过协同这三个分支,UniCAR-RL成功实现了基于原始简短答案的感知与推理联合优化。UniCAR-RL的主要优势总结如下:
1.  **基于原始简短答案数据的感知增强**。如图1(c)所示,不同于主要优化推理的传统RL,该框架仅依靠原始简短答案,在保持推理优化的同时,同步提升感知能力。
2.  **在数学任务上的性能提升**。该框架在不同的数学基准测试中实现了全面提升,以极小的训练成本达到了与闭源专有模型相当的性能。
3.  **跨不同架构和规模的泛化能力**。该框架在不同的架构和规模上均实现了稳定且显著的性能提升。此外,优化效果对高级验证器能力的敏感性有限。

## 2 相关工作

#### 用于数学推理的强化学习

随着强化学习在数学推理领域的不断进步,GRPO [3]及其变体[17, 18, 19]已成为该领域广泛使用的后训练范式。在多模态数学推理中,现有方法分为冷启动RL和零样本RL。冷启动RL通过精选的推理轨迹或过程监督来引导策略。We-Math 2.0 [20]围绕数学知识构建训练,Vision-R1 [21]为GRPO初始化构建多模态CoT数据,URSA [22]结合多模态CoT基础与过程监督的GRPO。零样本RL直接使用基于规则的奖励优化MLLMs。MM-Eureka [23]在过滤的图像-文本数学数据上扩展基于规则的RL,而Shuffle-R1 [4]通过以数据为中心的轨迹采样和批量混洗提高RL效率。R1-VL [24]引入具有密集逐步奖励的StepGRPO,VL-Cogito [25]采用具有动态长度奖励的课程学习RL。

#### MLLMs中的视觉感知增强

细粒度的视觉感知对于复杂的视觉任务至关重要,但仍然是MLLMs的主要瓶颈[13, 26, 16]。现有方法主要通过增强感知的轨迹训练和具有感知奖励的RL来提升视觉感知。前者通常从高级教师模型中蒸馏高质量、增强感知的CoT数据,然后利用这些数据增强MLLMs的感知能力。CodePercept [15]和GeoCode [27]使用可执行程序来恢复图表结构,而MathFlow [26]将视觉提取与下游推理解耦。ViRC [28]和Geoint-R1 [29]进一步使用有依据的推理块和辅助几何构造来结构化推理过程。具有感知奖励引导的RL方法[30, 31, 32]将感知信号纳入奖励设计。它们分别引入了基于视觉标注一致性、视觉知识内化和图像描述效用的奖励。其他研究减少了对蒸馏感知数据的依赖:VPPO [33]将策略更新集中在视觉依赖的标记上,Vision-SR1 [14]对生成的视觉描述进行自我验证,PAPO [34]从视觉扰动中推导定位信号,NoisyRollout [35]利用带噪声的视觉展开。这些工作的详细信息见附录C。

参考图注

**图2:UniCAR-RL概览。它将优化解耦为三个分支:a) 用于纯视觉感知增强的Caption-RL分支,b) 用于视觉隔离的逻辑优化的Reasoning-RL分支,c) 用于协同端到端QA整合的QA-RL分支。**

## 3 方法

### 3.1 总体框架

视觉数学推理要求两种紧密耦合的能力:**感知**(忠实提取细粒度的视觉细节,如坐标轴值、几何标记和符号标注)和**推理**(将逻辑推导链接至正确答案)。模型可能因任一原因而失败,但传统的基于结果的RL将这两种失败模式一视同仁:一个错误的最终答案无论其根本原因如何都会产生负面信号。没有针对性的信号,感知瓶颈会在训练中默默持续存在。启发我们方法的关键洞见是直观的:一个视觉描述的质量可以通过一个有能力的纯文本求解器是否仅凭该描述就能推导出正确答案来客观衡量。这种重新表述将评估感知这一本质上主观的问题,转化为一个干净、无标注的二元信号,该信号直接与任务实用性相关,而非表面的文本保真度。基于此洞见,我们提出了**UniCAR-RL**,将优化解耦为三个联合更新的分支。如图2所示,**Caption-RL分支**鼓励更广泛的、与问题无关的视觉感知,并根据生成的描述对任务的充分性进行评估。**Reasoning-RL分支**在纯文本环境中隔离逻辑推理,使用最佳可用描述作为输入。**QA-RL分支**然后将这两种能力锚定回原生的端到端任务格式。所有三个分支共享相同的策略参数θ,并在每次迭代中联合更新,因此感知和推理协同进化,而不是在孤立的阶段进行训练。

### 3.2 Caption-RL 分支

#### 动机

Caption-RL分支建立在有意的信息保留行为之上:问题q被明确地排除在模型的输入之外。知道问题的模型可以选择性地只关注与视觉相关的元素;不知道问题的模型则必须描述一切。通过从上下文中剥离q,我们施加了一种自然的压力,促使模型进行整体、无偏的视觉定位。

#### 阶段一:图像描述生成

策略π_θ从图像I和任务提示p_cap生成G个图像描述展开,其任务是在不产生答案的情况下详尽地提取视觉细节:c_i ∼ π_θ(· | I, p_cap), i=1,…, G。(1) 这种设计的灵感来自EM式优化的直觉:图像描述充当潜在的中间解释,首先在当前策略下进行推断,然后用于优化下游的推理。我们并未在严格的概率意义上执行EM,因为c*是通过奖励引导选择而非后验期望选出的,并且整体目标仍然是基于RL的。

#### 阶段二:验证

每个描述c_i由一个代理求解器V进行评估,该求解器被设计为一个不接受任何视觉输入的纯文本语言模型。仅给定描述c_i、问题q和任务提示p_ver,V试图完全基于手头的文本证据来解决问题:â_i = V(c_i, q, p_ver), i=1,…, G。(2) 由于V是一个能力很强的基于文本的推理器,无法访问I,因此产生的奖励可以作为描述充分性的实用代理,尽管它可能仍然包含来自验证器本身的噪声。因此,感知奖励变为:r_i^cap = I[D(Extract(â_i), a*)], (3) 其中a*表示标准答案。遗漏一个关键的视觉元素,例如刻度标签、直角标记或图例条目,将导致纯文本代理求解器失败,从而将精确的纠正信号送回策略。

### 3.3 Reasoning-RL 分支

#### 高质量描述选择

从G个描述展开中,我们选择奖励最高的描述作为选中的金标准描述…

相似文章

UniDoc-RL:基于层次化动作与密集奖励的粗到细视觉RAG

Hugging Face Daily Papers

UniDoc-RL 提出了一种面向大型视觉-语言模型的强化学习框架,通过层次化决策与密集多奖励监督来优化检索、重排序和视觉推理,在视觉RAG任务上相较此前基于RL的方法实现了高达17.7%的性能提升。