学习自适应推理路径以实现高效视觉推理

Hugging Face Daily Papers 论文

摘要

AVR是一种自适应视觉推理框架,能够动态选择最优推理格式,在视觉推理任务中减少50-90%的token使用量同时保持准确性。该方法通过将视觉推理分解为三种认知功能并使用FS-GRPO训练来鼓励高效格式选择,从而解决推理路径冗余问题。

视觉推理模型(VRMs)最近通过整合视觉感知与语言推理,展现了强大的跨模态推理能力。然而,它们经常遭受过度思考的问题,为任何任务生成不必要的长推理链。我们将这一问题归因于视觉推理中的推理路径冗余:许多视觉问题并不需要完整的推理过程。为了解决这个问题,我们提出了AVR,一种自适应视觉推理框架,它将视觉推理分解为三种认知功能:视觉感知、逻辑推理和答案应用。此外,它使模型能够动态选择三种响应格式:完整格式、仅感知格式和直接答案。AVR通过FS-GRPO进行训练,FS-GRPO是对Group Relative Policy Optimization的改编,鼓励模型在保持正确性的同时选择最有效的推理格式。在多个视觉语言基准上的实验表明,AVR减少了50-90%的token使用量,同时保持了整体准确性,特别是在感知密集型任务中。这些结果表明,自适应视觉推理可以有效缓解VRMs中的过度思考问题。代码和数据可在以下链接获取:https://github.com/RunRiotComeOn/AVR。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:27

论文页面 - 学习高效视觉推理的自适应推理路径

来源: https://huggingface.co/papers/2604.14568

摘要

自适应视觉推理框架通过动态选择最优推理格式来减少不必要的计算,同时保持准确性。

视觉推理模型(https://huggingface.co/papers?q=Visual%20reasoning%20models)(VRMs)近期通过整合视觉感知(https://huggingface.co/papers?q=visual%20perception)与语言推理展现出了强大的跨模态推理(https://huggingface.co/papers?q=cross-modal%20reasoning)能力。然而,它们常常存在过度思考的问题,即对任何任务都产生不必要冗长的推理链。我们将这一问题归因于视觉推理中的推理路径冗余(https://huggingface.co/papers?q=Reasoning%20Path%20Redundancy):许多视觉问题并不需要完整的推理过程。为解决此问题,我们提出了AVR,一个自适应视觉推理(https://huggingface.co/papers?q=adaptive%20visual%20reasoning)框架,它将视觉推理分解为三种认知功能:视觉感知(https://huggingface.co/papers?q=visual%20perception)、逻辑推理(https://huggingface.co/papers?q=logical%20reasoning)和答案应用(https://huggingface.co/papers?q=answer%20application)。该框架进一步使模型能够动态选择三种响应格式:完整格式、仅感知格式和直接答案。AVR使用FS-GRPO(https://huggingface.co/papers?q=FS-GRPO)进行训练,这是组相对策略优化(https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization)的一种改进,鼓励模型在保持正确性的同时选择最高效的推理格式。在多个视觉-语言基准(https://huggingface.co/papers?q=vision-language%20benchmarks)上的实验表明,AVR将token使用量(https://huggingface.co/papers?q=token%20usage)减少了50-90%,同时保持了整体准确率,尤其在感知密集型任务中效果显著。这些结果表明,自适应视觉推理(https://huggingface.co/papers?q=adaptive%20visual%20reasoning)能有效缓解VRMs中的过度思考问题。代码和数据已在:https://github.com/RunRiotComeOn/AVR 提供。

查看arXiv页面(https://arxiv.org/abs/2604.14568)查看PDF(https://arxiv.org/pdf/2604.14568)GitHub3(https://github.com/RunRiotComeOn/AVR)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.14568)

在您的代理中获取此论文:

hf papers read 2604\.14568

没有最新的CLI?curl \-LsSf https://hf.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2604.14568以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2604.14568以从此页面链接。

引用此论文的Space0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2604.14568以从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。

相似文章

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

通过闭环验证推理解锁复杂视觉生成

Hugging Face Daily Papers

介绍CLVR(闭环视觉推理),一种将文本到图像生成从单步过程重构为闭环多步视觉推理方法的框架,使用VLM控制器和扩散模型,在组合提示上实现了改进的性能。