DeepVoyager-VL:激励长时程多模态智能体的视觉在环搜索

Hugging Face Daily Papers 论文

摘要

DeepVoyager-VL 提出了一种长时程多模态深度搜索框架,将视觉证据融入中间推理过程,利用多模态事件图进行数据合成和微调,而无需强化学习,在十个基准测试上取得了强劲性能。

多模态大语言模型(MLLMs)在视觉理解和推理方面取得了进步,但其静态参数化知识限制了其处理知识密集型且动态演变的开放世界问题的能力。为突破这一局限,多模态深度搜索已成为开放世界信息访问的关键方向,从单轮事实检索演进为以视觉证据为引导的长时程、多轮搜索。然而,现有方法通常将视觉限制在输入或答案阶段,忽视了其在中间推理中的作用,并且缺乏针对长时程交互的设计。因此,视觉证据很少驱动持续检索,限制了交互深度和推理跨度。为解决这些问题,我们提出了 DeepVoyager-VL,一种用于视觉在环搜索的长时程多模态深度搜索框架。具体而言,我们构建多模态事件图驱动数据合成,生成具有中间视觉依赖和长推理链的问题。然后,我们设计了一个用于主动视觉获取和按需图像加载的智能体框架。最后,我们在合成数据上对模型进行微调,而无需强化学习。在十个多模态搜索基准上的大量实验证明了我们方法的有效性。
查看原文
查看缓存全文

缓存时间: 2026/08/04 09:38

论文页面 - DeepVoyager-VL:激励视觉在环搜索以实现长视野多模态智能体

来源:https://huggingface.co/papers/2608.01827 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

多模态大语言模型(MLLMs)推动了视觉理解与推理的进步,但其静态参数化知识限制了它们解决知识密集型且动态演变的开放世界问题的能力。为突破这一限制,多模态深度搜索应运而生,成为开放世界信息访问的关键方向,从单轮事实检索演进为由视觉证据引导的长视野多轮搜索。然而,现有方法通常将视觉局限于输入或答案阶段,忽略了其在中间推理中的作用,并且缺乏针对长视野交互的设计。因此,视觉证据很少能驱动持续检索,限制了交互深度和推理跨度。为解决这些问题,我们提出了 DeepVoyager-VL,一个用于视觉在环搜索的长视野多模态深度搜索框架。具体而言,我们构建多模态事件图来驱动数据合成,从而产生具有中间视觉依赖和长推理链的问题。然后,我们设计了一个用于主动视觉获取和按需图像加载的智能体框架。最后,我们在合成数据上微调模型,而无需强化学习。在十个多模态搜索基准上的广泛实验证明了我们方法的有效性。

查看 arXiv 页面 (https://arxiv.org/abs/2608.01827) 查看 PDF (https://arxiv.org/pdf/2608.01827) 项目页面 (https://halcyon-zhang.github.io/DeepVoyager-VL/) GitHub1 (https://github.com/Halcyon-Zhang/DeepVoyager-VL) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01827)

将这篇论文放入你的智能体:

hf papers read 2608\.01827

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有链接该论文的模型

在模型 README.md 中引用 arxiv.org/abs/2608.01827 即可从本页链接到该模型。

引用该论文的数据集0

没有链接该论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2608.01827 即可从本页链接到该数据集。

引用该论文的 Space0

没有链接该论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2608.01827 即可从本页链接到该 Space。

包含该论文的收藏0

没有包含该论文的收藏

将这篇论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接到它。

相似文章

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

面向视觉原生多模态深度搜索智能体的同策略数据演化

Hugging Face Daily Papers

本文介绍了同策略数据演化(ODE)和一种视觉原生智能体框架,以提升多模态深度搜索智能体的性能。通过实现视觉证据的可重用性和闭环数据生成,ODE 显著提升了 Qwen3-VL 智能体在多个基准测试中的表现,超越了 Gemini 2.5 Pro。