Beacon:知道何时以及如何进行智能体视觉推理

Hugging Face Daily Papers 论文

摘要

本文介绍了 Beacon,一种智能体视觉推理模型,通过强化学习中的必要性感知自适应奖励和提示引导的能力扩展机制,提升了多模态大语言模型(MLLMs)决定何时使用工具以及从工具使用中获益的能力。

智能体视觉推理的基本目标是提高多模态大语言模型(MLLMs)在复杂任务上的成功率,而不仅仅是赋予它们一种复杂但低效的推理范式。在这项工作中,我们通过工具使用的两个关键维度重新思考智能体视觉推理:模式自适应性(MA)和工具效果(TE)。模式自适应性刻画了 MLLM 能否识别何时真正需要工具并相应调用工具,从而在需要工具辅助的挑战性问题上提升性能的同时,避免不必要的计算开销。工具效果刻画了工具使用的实际影响:工具应扩展模型在仅靠文本推理无法解决的问题上的能力,同时在模型无需工具即可解决的问题上避免引入额外错误。我们进行了全面分析来量化这两个属性,并实证揭示现有智能体视觉推理模型的模式自适应性有限,而且工具使用在困难样本上带来的收益,很大程度上被模型在已能解决的简单样本上引入的损害所抵消。基于这些观察,我们提出了 Beacon,一种新颖的智能体视觉推理模型,实现了更强的整体性能、更高的模式自适应性以及真正的工具驱动性能提升。Beacon 的核心是强化学习阶段中的必要性感知自适应奖励和提示引导的能力扩展机制,它们分别鼓励基于任务必要性的自适应工具调用,并增强模型在最具挑战性问题上的工具使用能力。跨多个不同基准的大量实验证明了 Beacon 强大的整体性能,以及其在模式自适应性和工具效果两方面的大幅改进。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:53

论文页面 - Beacon:知道何时以及如何进行智能体视觉推理

来源:https://huggingface.co/papers/2607.28595

作者:, , , , , , , , , , , ,

摘要

智能体视觉推理的根本目标是提高多模态大语言模型(MLLMs)在复杂任务上的成功率,而不仅仅是赋予它们一套复杂但低效的推理范式。在这项工作中,我们从工具使用的两个关键维度重新思考智能体视觉推理:模式自适应性(Mode Adaptiveness, MA)和工具效能(Tool Effect, TE)。模式自适应性描述了MLLM能否识别工具何时真正必要并据此调用工具,从而在需要工具辅助的挑战性问题上提升性能的同时,避免不必要的计算开销。工具效能描述了工具使用的实际影响:工具应当扩展模型在仅靠文本推理无法解决的问题上的能力,同时避免在模型无需工具即可解决的问题上引入额外错误。我们进行了全面分析来量化这两个属性,并在实证中发现,现有的智能体视觉推理模型表现出有限的模式自适应性,而工具使用在困难样本上带来的收益,很大程度上被模型在已经能够解决的简单样本上引入的损害所抵消。基于这些观察,我们提出了Beacon,一种新颖的智能体视觉推理模型,它在整体性能、模式自适应性和真正的工具驱动性能提升方面都取得了更强的表现。Beacon的核心是强化学习阶段的“必要性感知自适应奖励”(Necessity-Aware Adaptive Reward)和“提示引导能力扩展”(Hint-Guided Capability Expansion)机制,它们分别鼓励基于任务必要性的自适应工具调用,并增强模型在最具挑战性问题上的工具使用能力。跨多个基准的大量实验证明了Beacon强大的整体性能,以及它在模式自适应性和工具效能两方面都取得的显著提升。

查看 arXiv 页面 查看 PDF GitHub1 添加到收藏

在您的智能体中获取此论文:

hf papers read 2607\.28595

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接到此论文。

在模型 README.md 中引用 arxiv.org/abs/2607.28595 以从此页面链接到它。

引用此论文的数据集 0

没有数据集链接到此论文。

在数据集 README.md 中引用 arxiv.org/abs/2607.28595 以从此页面链接到它。

引用此论文的 Spaces 0

没有 Space 链接到此论文。

在 Space README.md 中引用 arxiv.org/abs/2607.28595 以从此页面链接到它。

包含此论文的合集 0

没有合集包含此论文。

将此论文添加到合集(https://huggingface.co/new-collection)以从此页面链接到它。

相似文章

ATLAS:智能体还是隐式视觉推理?一个词足矣

Hugging Face Daily Papers

ATLAS提出了一种视觉推理框架,该框架通过功能标记将智能体操作和隐式表示相结合,实现了通过下一个标记预测和强化学习进行高效训练,同时避免了中间图像的生成。

自适应潜在智能体推理

arXiv cs.CL

本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。