面向多模态推理的结构化角色感知策略优化
摘要
本文介绍了结构化角色感知策略优化(SRPO),该方法通过在大视觉-语言模型的强化学习框架内,根据感知和推理的不同角色分配令牌级信用,从而提升多模态推理能力。
arXiv:2605.07274v1 公告类型:新发布
摘要:基于可验证奖励的强化学习(RLVR),尤其是结合群体相对策略优化(GRPO),在提升大视觉-语言模型(LVLM)推理能力方面展现出巨大潜力。然而,在多模态推理中,最终答案奖励通常是在序列级别分配的,未能区分不同令牌的功能角色,这使得难以判断正确答案是否由与任务相关的视觉证据所支持。在本文中,我们从角色感知的令牌级信用分配的角度重新审视多模态 RLVR,其中结构化响应被分解为用于提取视觉证据的感知令牌和用于从该证据推导答案的推理令牌。基于这一视角,我们提出了结构化角色感知策略优化(SRPO),它在无需更改奖励函数的情况下,将序列级 GRPO 优势细化为角色感知的令牌级优势。具体而言,SRPO 通过使用自蒸馏的在线策略对比来分配特定角色的信用:感知令牌根据其在原始视觉输入与损坏视觉输入下的视觉依赖性差异得到强调,而推理令牌则根据其生成感知的一致性得到强调。这些特定角色的信号通过共享的轨迹级基线进一步统一,产生正的令牌权重以调整相对更新幅度,同时保持原有的 GRPO 奖励和优化方向,且无需外部奖励模型或独立的教师模型。在多个多样化的多模态推理基准上的实验表明,SRPO 提升了基于证据的推理能力,突显了从统一的序列级信用转向角色感知优化对于实现可靠多模态推理的重要性。
查看缓存全文
缓存时间: 2026/05/11 07:15
# 用于多模态推理的面向角色的结构化策略优化 来源: https://arxiv.org/html/2605.07274 **Bingqing Jiang** 香港大学计算与数据科学学院 邮箱: [email protected] **Difan Zou** 香港大学计算与数据科学学院及数据科学研究院 邮箱: [email protected] ###### 摘要 基于可验证奖励的强化学习(RLVR),特别是结合组相对策略优化(GRPO),在提升大型视觉-语言模型(LVLMs)的推理能力方面展现出巨大潜力。然而,在多模态推理中,最终答案奖励通常是在序列级别分配的,未能区分不同标记(token)的功能角色,这使得难以判断正确答案是否由与任务相关的视觉证据支持。在本文中,我们从面向角色的标记级别信用分配的角度重新审视多模态 RLVR,其中结构化响应被分解为用于提取视觉证据的**感知标记**和用于基于该证据推导答案的**推理标记**。基于这一视角,我们提出了**面向角色的结构化策略优化**(**SRPO**),它在改变奖励函数的情况下,将序列级 GRPO 优势细化为面向角色的标记级优势。具体而言,SRPO 通过使用自蒸馏的在线策略对比来分配特定角色的信用:感知标记根据其原始视觉输入与受损视觉输入下的视觉依赖性得到强调,而推理标记则根据其生成的一致性得到强调。这些特定角色的信号通过共享的轨迹级基线进一步统一,产生正的标记权重,以调整相对更新幅度,同时保留原始 GRPO 奖励和优化方向,无需外部奖励模型或单独的教师模型。在多种多模态推理基准上的实验表明,SRPO 改善了基于证据的推理,突出了超越均匀的序列级信用分配、转向面向角色的优化以实现可靠多模态推理的重要性。 ## 1 引言 基于可验证奖励的强化学习(RLVR)(Guo 等, 2025),特别是与在线策略优化算法如组相对策略优化(GRPO)(Shao 等, 2024) 结合,最近已成为提升大型语言模型推理能力的有效范式。受其在纯文本设置下成功的启发,越来越多的工作开始将 RLVR 扩展至大型视觉-语言模型(LVLMs)以进行多模态推理 (Huang 等, 2026b; Zhang 等, 2025; Yao 等, 2025; Wang 等, 2025; Zha 等, 2026)。尽管取得了令人鼓舞的进展,多模态推理仍然比其纯文本对应物更具挑战性:产生可靠的答案需要模型首先识别与任务相关的视觉证据,然后利用该证据支持后续推理 (Liu 等, 2026a; Wang 等, 2026a; Huang 等, 2026a; Miao 等, 2026)。 对于依赖证据的多模态推理,序列级答案监督存在一个核心局限性:它仅验证最终响应是否达到正确答案,而不评估中间标记是否扎根于与任务相关的视觉证据 (Li 等, 2025; Wang 等, 2026d; Chen 等, 2025)。在实践中,LVLMs 可以通过利用语言先验、数据集规律或浅层文本启发式方法产生正确或看似合理的答案,而不是忠实地将响应扎根于图像 (Ghosh 等, 2025; Fang 等, 2026)。例如,如图 1 所示,我们的 MathVerse (Zhang 等, 2024) 评估表明,GRPO 可以达到正确的最终答案,同时表现出有缺陷的中间扎根情况。在第一个例子中,模型错误地将边长表达式解释为角度表达式,导致感知步骤错误和类似捷径的推理。在第二个例子中,尽管错误识别了底层的 3D 视觉结构,模型仍推导出了正确的最终公式。因此,即使中间感知或推理未完全由视觉证据支持,这些 rollout(采样序列)仍可能获得正的序列级奖励。因此,序列级监督下答案准确性的提高并不必然意味着基于图像的推理能力的提高。 > **图 1 说明**: MathVerse 示例中,尽管中间扎根存在缺陷,GRPO 仍能达到正确答案。 最近的努力开始通过明确分离视觉感知与下游推理来解决这个问题 (Huang 等, 2026a; Miao 等, 2026; Wang 等, 2026d; Zhou 等, 2025)。这一方向强调了扎根的多模态推理的一个基本要求:模型应首先识别与任务相关的视觉证据,然后基于该证据回答问题。因此,结构化响应可以组织为两个功能阶段:用于提取与问题相关的视觉证据的*感知*阶段,以及用于从该证据推导最终答案的*推理*阶段 (Sharma 等, 2026)。至关重要的是,这两个阶段服务于不同的功能角色,因此需要不同的信用分配标准 (Chen 等, 2025; Yu 等, 2026a; Ding 等, 2025)。感知阶段应因忠实地提取与任务相关的视觉证据而获得信用,而推理阶段应因从该证据推导有效答案而获得信用。然而,现有的优化方法通常将这些阶段视为统一的,忽略了它们之间的角色区别,混淆了证据提取与基于证据的推断 (Huang 等, 2026b; Zhang 等, 2025; Yao 等, 2025; Miao 等, 2026; Wang 等, 2026d)。 这促使我们建立一个面向角色的策略优化框架,该框架在保留可验证答案级监督的同时,根据每个响应段的功能角色分配标记级信用。在本文中,我们提出了 **SRPO**(**S**tructured **R**ole-**a**ware **P**olicy **O**ptimization,面向角色的结构化策略优化),这是一种用于多模态 RLVR 的标记级策略优化方法,考虑了生成响应的功能异质性。SRPO 要求策略生成结构化响应,其中包含用于提取与任务相关的视觉证据的*感知*部分和用于从该证据推导答案的*推理*部分。SRPO 并不将整个响应视为同质的标记序列,而是通过正向调制权重将序列级 GRPO 优势转换为面向角色的标记级优势。这些权重通过**自蒸馏信用分配**原则获得,其中冻结的 rollout 策略在特定角色的信息条件下对相同的生成标记重新评分。对于感知标记,SRPO 通过对比原始图像和受损图像下的似然来衡量视觉依赖性;对于推理标记,它通过对比感知条件预测与直接图像-问题扎根来衡量扎根一致性。这些特定角色的分数通过整个有效轨迹上共享的响应级基线统一,并映射为有界的正乘数,在保持 GRPO 原始可验证奖励和奖励诱导优化方向的同时,使标记更新幅度具备角色感知能力。因此,SRPO 不需要外部奖励模型、辅助监督或单独的教师,而是重构策略梯度信号以反映视觉证据提取和基于证据的扎根推理。 总结而言,我们的贡献有三点: * 与将均匀信用信号分配给整个响应的传统序列级优化相比,我们引入了多模态标记级信用分配的*角色分解视角*。该视角将多模态响应视为功能上异质的轨迹,其中*感知*阶段提取与任务相关的视觉证据,而*推理*阶段从该证据推导答案。 * 我们提出了 SRPO,它在 GRPO 中实例化了角色分解的标记级信用分配。SRPO 通过特定角色的自蒸馏在线策略对比估算感知和推理阶段的信用,然后使用共享的轨迹级基线校准这些信号,并将它们转换为有界的正权重以重新加权序列级 GRPO 优势。这在不需要外部奖励模型或教师的情况下保留了原始奖励和优化方向。 * 我们证明了 SRPO 在多个基准上改善了基于证据的多模态推理,消融实验证实了特定角色信用信号和统一轨迹级调制的重要性。 ## 2 相关工作 #### 用于推理的多模态强化学习。 RLVR,特别是与 PPO 和 GRPO 等策略优化算法结合,已成为提升大型语言模型推理能力的有效范式 (Guo 等, 2025; Shao 等, 2024)。受此成功启发,最近的工作将 RL 风格的后期训练扩展到 LVLMs,以提升超越监督模仿的多模态推理 (Achiam 等, 2023; Bai 等, 2025; Gemini Team 等, 2024; Zhu 等, 2025)。现有方法探索了改进的多模态训练数据 (Huang 等, 2026b; Yao 等, 2025)、rollout 多样化 (Liu 等, 2026a; Wang 等, 2026a)、回放机制 (Wang 等, 2025) 以及更稳定的优化启发式方法 (Zha 等, 2026),共同证明了 RL 风格的后期训练可以显著增强多模态推理。 #### 感知感知与结构化多模态推理。 由于正确的最终答案并不一定意味着视觉上扎根的中间推理 (Ghosh 等, 2025),先前方法通过感知感知奖励 (Xia 等, 2025; Xiao 等, 2025; Wang 等, 2026d)、显式感知脚手架 (Cao 等, 2025; Sarch 等, 2026; Su 等, 2026; Sun 等, 2026) 或鼓励更强依赖图像证据的 RL 机制 (Yu 等, 2026a; Wang 等, 2026c; Liu 等, 2026b) 来加强视觉扎根。另一个相关方向将多模态生成分解为结构化阶段,如感知、证据提取、推理和答案预测 (Chen 等, 2025; Li 等, 2026; Miao 等, 2026; Ding 等, 2025; He 等, 2025)。这些工作强调了显式感知证据和感知-推理分离的重要性。然而,这种结构主要用作建模或监督脚手架,其在确定标记级策略更新中的作用尚未得到充分探索。我们的工作将显式的感知-推理结构纳入策略优化,并为这两个组件分配不同的信用信号。 #### 强化学习中的细粒度信用分配。 除了序列级监督外,信用分配的粒度在推理优化中的重要性日益受到重视。在基于文本的设置中,先前工作研究了中间推理过程或有信息标记子集上的结构化信用分配 (Guo 等, 2026; Tran 等, 2025; Wang 等, 2026b; Xue 等, 2025; Zhang 等, 2026; Yang 等, 2026)。类似趋势也出现在多模态推理中,其中标记级或感知感知优化用于更好地将学习信号与视觉上扎根的推理行为对齐 (Huang 等, 2026a; Lu 等, 2026; Ye 等, 2026)。这些研究表明,细粒度优化可以减少模型在粗粒度序列级奖励下利用捷径信号的倾向。我们的工作密切相关,但不同之处在于明确处理多模态响应内的功能异质性。我们不是使用共享的标记重要性标准,而是区分*感知标记*与*推理标记*并根据其不同角色分配信用,同时保持 GRPO 奖励及其对齐的优化方向不变。 ## 3 方法 ### 3.1 预备知识:组相对策略优化 GRPO 是一种无价值的强化学习算法,通过比较从同一提示中采样的多个响应来估计策略梯度优势 (Shao 等, 2024)。给定图像-问题对 $(I, q)$,行为策略 $\pi_{\theta_{\mathrm{old}}}$ 采样一组 $G$ 个响应,$\{y_i\}_{i=1}^G, \quad y_i=(y_{i,1},\ldots,y_{i,T_i})\sim\pi_{\theta_{\mathrm{old}}}(\cdot\mid I,q)$。
相似文章
SLPO:通过代理策略扩展潜在推理
介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。
基于角色条件的子令牌路由:实现高效的视觉-语言-动作策略
本文介绍了一种基于角色条件的子令牌路由(RoleSub)方法,该方法通过路由子令牌组来高效压缩视觉-语言-动作模型,在降低计算成本的同时,保持在机器人任务上的强大性能。
GraphPO:面向推理模型的基于图策略优化
GraphPO 是一种新颖的基于图的强化学习框架,它将轨迹表示为一个有向无环图,合并语义等价的推理路径,以减少冗余探索并改进大型推理模型的信用分配。
@Ankur_Samanta_: 在多步推理强化学习后训练中关于信用分配的新工作 介绍自重置策略优化 (SRPO…
自重置策略优化 (SRPO) 通过在多步推理强化学习后训练中定位第一个错误的推理步骤并从中学习反事实延续,而无需外部监督,来解决信用分配问题。
LambdaPO: 面向推理语言模型的Lambda风格策略优化
引入LambdaPO,一种新颖的强化学习框架,它通过将优势估计分解为成对偏好比较并添加语义密度奖励来改进GRPO,从而在数学推理任务上取得了更好的性能。