学习自适应推理路径以实现高效视觉推理
摘要
AVR是一种自适应视觉推理框架,能够动态选择最优推理格式,在视觉推理任务中减少50-90%的token使用量同时保持准确性。该方法通过将视觉推理分解为三种认知功能并使用FS-GRPO训练来鼓励高效格式选择,从而解决推理路径冗余问题。
查看缓存全文
缓存时间: 2026/04/20 08:27
论文页面 - 学习高效视觉推理的自适应推理路径
来源: https://huggingface.co/papers/2604.14568
摘要
自适应视觉推理框架通过动态选择最优推理格式来减少不必要的计算,同时保持准确性。
视觉推理模型(https://huggingface.co/papers?q=Visual%20reasoning%20models)(VRMs)近期通过整合视觉感知(https://huggingface.co/papers?q=visual%20perception)与语言推理展现出了强大的跨模态推理(https://huggingface.co/papers?q=cross-modal%20reasoning)能力。然而,它们常常存在过度思考的问题,即对任何任务都产生不必要冗长的推理链。我们将这一问题归因于视觉推理中的推理路径冗余(https://huggingface.co/papers?q=Reasoning%20Path%20Redundancy):许多视觉问题并不需要完整的推理过程。为解决此问题,我们提出了AVR,一个自适应视觉推理(https://huggingface.co/papers?q=adaptive%20visual%20reasoning)框架,它将视觉推理分解为三种认知功能:视觉感知(https://huggingface.co/papers?q=visual%20perception)、逻辑推理(https://huggingface.co/papers?q=logical%20reasoning)和答案应用(https://huggingface.co/papers?q=answer%20application)。该框架进一步使模型能够动态选择三种响应格式:完整格式、仅感知格式和直接答案。AVR使用FS-GRPO(https://huggingface.co/papers?q=FS-GRPO)进行训练,这是组相对策略优化(https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization)的一种改进,鼓励模型在保持正确性的同时选择最高效的推理格式。在多个视觉-语言基准(https://huggingface.co/papers?q=vision-language%20benchmarks)上的实验表明,AVR将token使用量(https://huggingface.co/papers?q=token%20usage)减少了50-90%,同时保持了整体准确率,尤其在感知密集型任务中效果显著。这些结果表明,自适应视觉推理(https://huggingface.co/papers?q=adaptive%20visual%20reasoning)能有效缓解VRMs中的过度思考问题。代码和数据已在:https://github.com/RunRiotComeOn/AVR 提供。
查看arXiv页面(https://arxiv.org/abs/2604.14568)查看PDF(https://arxiv.org/pdf/2604.14568)GitHub3(https://github.com/RunRiotComeOn/AVR)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.14568)
在您的代理中获取此论文:
hf papers read 2604\.14568
没有最新的CLI?curl \-LsSf https://hf.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2604.14568以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2604.14568以从此页面链接。
引用此论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2604.14568以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。
相似文章
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。
Perceive-to-Reason:解耦感知与推理实现细粒度视觉推理
提出Perceive-to-Reason(P2R)框架,通过两阶段流程和角色感知的强化学习策略,将视觉语言模型中的视觉感知与推理解耦,在细粒度视觉推理基准上达到最先进水平。
UniVR:在视觉空间中思考以实现统一视觉推理
UniVR提出了VR-GRPO,一种用于统一视觉推理的强化学习范式,能够从纯视觉演示中学习复杂推理和物理动力学,在VR-X基准测试上实现了高达25%的性能提升。
通过视觉动作结果推理对齐连接物理推理与任务泛化
VAORA提出了一种新颖的奖励设计,用于视觉语言模型,将推理与视觉上下文和动作结果对齐,提升了物理推理能力和在未见任务及环境中的泛化能力。
通过闭环验证推理解锁复杂视觉生成
介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。