DeepVoyager-VL:激励长时程多模态智能体的视觉在环搜索
摘要
DeepVoyager-VL 提出了一种长时程多模态深度搜索框架,将视觉证据融入中间推理过程,利用多模态事件图进行数据合成和微调,而无需强化学习,在十个基准测试上取得了强劲性能。
查看缓存全文
缓存时间: 2026/08/04 09:38
论文页面 - DeepVoyager-VL:激励视觉在环搜索以实现长视野多模态智能体
来源:https://huggingface.co/papers/2608.01827 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
多模态大语言模型(MLLMs)推动了视觉理解与推理的进步,但其静态参数化知识限制了它们解决知识密集型且动态演变的开放世界问题的能力。为突破这一限制,多模态深度搜索应运而生,成为开放世界信息访问的关键方向,从单轮事实检索演进为由视觉证据引导的长视野多轮搜索。然而,现有方法通常将视觉局限于输入或答案阶段,忽略了其在中间推理中的作用,并且缺乏针对长视野交互的设计。因此,视觉证据很少能驱动持续检索,限制了交互深度和推理跨度。为解决这些问题,我们提出了 DeepVoyager-VL,一个用于视觉在环搜索的长视野多模态深度搜索框架。具体而言,我们构建多模态事件图来驱动数据合成,从而产生具有中间视觉依赖和长推理链的问题。然后,我们设计了一个用于主动视觉获取和按需图像加载的智能体框架。最后,我们在合成数据上微调模型,而无需强化学习。在十个多模态搜索基准上的广泛实验证明了我们方法的有效性。
查看 arXiv 页面 (https://arxiv.org/abs/2608.01827) 查看 PDF (https://arxiv.org/pdf/2608.01827) 项目页面 (https://halcyon-zhang.github.io/DeepVoyager-VL/) GitHub1 (https://github.com/Halcyon-Zhang/DeepVoyager-VL) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01827)
将这篇论文放入你的智能体:
hf papers read 2608\.01827
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有链接该论文的模型
在模型 README.md 中引用 arxiv.org/abs/2608.01827 即可从本页链接到该模型。
引用该论文的数据集0
没有链接该论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2608.01827 即可从本页链接到该数据集。
引用该论文的 Space0
没有链接该论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2608.01827 即可从本页链接到该 Space。
包含该论文的收藏0
没有包含该论文的收藏
将这篇论文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接到它。
相似文章
Visual-Seeker: 通过主动视觉推理实现视觉原生多模态代理搜索
Visual-Seeker 提出了一种视觉原生多模态深度搜索代理,它主动推理细粒度视觉细节并综合多模态证据,在五个具有挑战性的多模态搜索基准上实现了最先进的性能。
EventVLA: 事件驱动的视觉证据记忆用于长时域视觉-语言-动作策略
EventVLA 提出了一种稀疏视觉证据记忆框架用于长时域机器人操作,相较于最先进的记忆增强型VLA,平均成功率提升了40%。
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。
面向视觉原生多模态深度搜索智能体的同策略数据演化
本文介绍了同策略数据演化(ODE)和一种视觉原生智能体框架,以提升多模态深度搜索智能体的性能。通过实现视觉证据的可重用性和闭环数据生成,ODE 显著提升了 Qwen3-VL 智能体在多个基准测试中的表现,超越了 Gemini 2.5 Pro。
OpenSearch-VL:一种用于前沿多模态搜索智能体的开源训练配方
OpenSearch-VL 是一个开源框架及论文,介绍了一种利用强化学习训练前沿多模态搜索智能体的方法,其中包含专用的数据筛选流程以及一种新颖的训练算法。