看得越多就知道得越多?面向多源视觉推理的单锚优势归一化
摘要
本文提出MARS,一种单锚多源推理框架,利用动态锚定量化信息增益,并在基于可验证奖励的强化学习过程中调节模态交互,在GRPO和DAPO上分别实现了3.2%和4.9%的性能提升,涵盖多个数据集。
查看缓存全文
缓存时间: 2026/05/27 02:47
论文页面 - 看得越多就知道得越多吗?多源视觉推理的单锚点优势归一化
来源:https://huggingface.co/papers/2605.25437 发布于 5 月 25 日
·
由 Zeng (https://huggingface.co/AuroraZengfh) 于 5 月 27 日提交
摘要
一种新颖的基于单锚点的多源推理框架,利用动态锚点量化信息增益,并在基于可验证奖励的强化学习过程中调节模态交互。
通过基于可验证奖励的强化学习(RLVR)进行视觉推理已取得显著进展。然而,当处理多源输入时,现有方法往往将其视为信息的简单累积,缺乏明确的机制来区分整合额外源是否能带来信息增益或引入干扰。因此,它们难以有效建模多源整合时的动态交互,尤其是在源物理属性和语义差异显著的情况下(例如红外与深度),导致当某一源持有主导信号时,其性能甚至不如单源推理。为解决这一问题,我们提出 MARS,一种新颖的基于单锚点的多源推理框架,该框架将每种视觉模态建模为独立的信息源。具体而言,我们的方法通过将单源奖励视为动态锚点,显式地将多源融合引入的信息增益纳入优势归一化中,并在 RLVR 过程中自适应地强化源之间的相互促进作用,同时抑制潜在的噪声或冲突。从理论分析来看,我们的方法有效量化了多源整合在梯度估计中引入的信息增益,实现了模态间的一致调节。实验结果表明,在 GRPO 和 DAPO 上,该方法在不同数据集上分别取得了 3.2% 和 4.9% 的性能提升,证实了其有效性。
查看 arXiv 页面 (https://arxiv.org/abs/2605.25437) 查看 PDF (https://arxiv.org/pdf/2605.25437) GitHub2 (https://github.com/AI9Stars/MARS) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.25437)
在你的 Agent 中获取这篇论文:
hf papers read 2605.25437
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
没有模型关联本文
在模型 README.md 中引用 arxiv.org/abs/2605.25437 可从本页链接到它。
引用本文的数据集0
没有数据集关联本文
在数据集 README.md 中引用 arxiv.org/abs/2605.25437 可从本页链接到它。
引用本文的 Space0
没有 Space 关联本文
在 Space README.md 中引用 arxiv.org/abs/2605.25437 可从本页链接到它。
包含本文的收藏0
没有收藏包含本文
将本文添加到收藏 (https://huggingface.co/new-collection) 可从本页链接到它。
相似文章
增强多模态推理以对抗视觉退化
本文介绍了 ROMA,这是一种强化学习微调框架,旨在提高多模态大语言模型(MLLMs)对模糊和压缩伪影等视觉退化的鲁棒性。该框架通过双重前向传播策略和专门的正则化技术实现这一目标,在保持干净输入准确性的同时,提升了推理基准测试的性能。
Beacon:知道何时以及如何进行智能体视觉推理
本文介绍了 Beacon,一种智能体视觉推理模型,通过强化学习中的必要性感知自适应奖励和提示引导的能力扩展机制,提升了多模态大语言模型(MLLMs)决定何时使用工具以及从工具使用中获益的能力。
更多推理,更低准确性?论视觉语言模型中推理的双重性
本文揭示,视觉语言模型中的长时间推理可能会损害感知基础,导致对基本视觉问题的识别失败。它提出视觉锚定策略优化(VAPO),将推理引导至视觉基础轨迹,并通过VAPO-Thinker-7B模型实现了最先进的性能。
看不清还是想不对?面向视觉语言推理的感知奖励
本文提出一种强化学习框架,通过显式奖励感知保真度来改善视觉语言模型中的感知-推理协同,利用“蒙眼推理”代理和结构化言语验证来解决模态信用分配中的模糊性。
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。