Beacon:知道何时以及如何进行智能体视觉推理
摘要
本文介绍了 Beacon,一种智能体视觉推理模型,通过强化学习中的必要性感知自适应奖励和提示引导的能力扩展机制,提升了多模态大语言模型(MLLMs)决定何时使用工具以及从工具使用中获益的能力。
查看缓存全文
缓存时间: 2026/07/31 05:53
论文页面 - Beacon:知道何时以及如何进行智能体视觉推理
来源:https://huggingface.co/papers/2607.28595
作者:, , , , , , , , , , , ,
摘要
智能体视觉推理的根本目标是提高多模态大语言模型(MLLMs)在复杂任务上的成功率,而不仅仅是赋予它们一套复杂但低效的推理范式。在这项工作中,我们从工具使用的两个关键维度重新思考智能体视觉推理:模式自适应性(Mode Adaptiveness, MA)和工具效能(Tool Effect, TE)。模式自适应性描述了MLLM能否识别工具何时真正必要并据此调用工具,从而在需要工具辅助的挑战性问题上提升性能的同时,避免不必要的计算开销。工具效能描述了工具使用的实际影响:工具应当扩展模型在仅靠文本推理无法解决的问题上的能力,同时避免在模型无需工具即可解决的问题上引入额外错误。我们进行了全面分析来量化这两个属性,并在实证中发现,现有的智能体视觉推理模型表现出有限的模式自适应性,而工具使用在困难样本上带来的收益,很大程度上被模型在已经能够解决的简单样本上引入的损害所抵消。基于这些观察,我们提出了Beacon,一种新颖的智能体视觉推理模型,它在整体性能、模式自适应性和真正的工具驱动性能提升方面都取得了更强的表现。Beacon的核心是强化学习阶段的“必要性感知自适应奖励”(Necessity-Aware Adaptive Reward)和“提示引导能力扩展”(Hint-Guided Capability Expansion)机制,它们分别鼓励基于任务必要性的自适应工具调用,并增强模型在最具挑战性问题上的工具使用能力。跨多个基准的大量实验证明了Beacon强大的整体性能,以及它在模式自适应性和工具效能两方面都取得的显著提升。
查看 arXiv 页面 查看 PDF GitHub1 添加到收藏
在您的智能体中获取此论文:
hf papers read 2607\.28595
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接到此论文。
在模型 README.md 中引用 arxiv.org/abs/2607.28595 以从此页面链接到它。
引用此论文的数据集 0
没有数据集链接到此论文。
在数据集 README.md 中引用 arxiv.org/abs/2607.28595 以从此页面链接到它。
引用此论文的 Spaces 0
没有 Space 链接到此论文。
在 Space README.md 中引用 arxiv.org/abs/2607.28595 以从此页面链接到它。
包含此论文的合集 0
没有合集包含此论文。
将此论文添加到合集(https://huggingface.co/new-collection)以从此页面链接到它。
相似文章
ATLAS:智能体还是隐式视觉推理?一个词足矣
ATLAS提出了一种视觉推理框架,该框架通过功能标记将智能体操作和隐式表示相结合,实现了通过下一个标记预测和强化学习进行高效训练,同时避免了中间图像的生成。
看不清还是想不对?面向视觉语言推理的感知奖励
本文提出一种强化学习框架,通过显式奖励感知保真度来改善视觉语言模型中的感知-推理协同,利用“蒙眼推理”代理和结构化言语验证来解决模态信用分配中的模糊性。
工具总是有益的吗?学会自适应调用工具以实现双模式多模态大语言模型推理
介绍 AutoTool,一种自适应决定是否调用工具进行多模态大语言模型推理的模型,通过强化学习和双模式推理实现了显著的准确率和效率提升。
自适应潜在智能体推理
本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。
LEDGERMIND:基于结构化证据账本的来源约束多模态智能体推理
本文介绍了LedgerMind,一种来源约束的多模态智能体推理框架,它使用结构化证据账本确保视觉问答中推理的立足性和忠实性,解决幻觉和过度推理等失败模式。