标签
DeepVoyager-VL 提出了一种长时程多模态深度搜索框架,将视觉证据融入中间推理过程,利用多模态事件图进行数据合成和微调,而无需强化学习,在十个基准测试上取得了强劲性能。
XYZ AI Lab 发布了 XYZ-Aquila-mini,这是一个开源的轻量级推理模型,专为智能深度搜索而设计,基于 Qwen3.6-35B-A3B 微调而成,在参数规模低于 40B 的开源模型中取得了顶尖的基准测试成绩。
XYZ AI Lab releases XYZ-Aquila-pro, an open-weight thinking model for agentic deep search, post-trained from Qwen3.5-397B-A17B via a bounded-exploration AI4AI pipeline, with strong benchmark results in sub-400B open-weight comparisons.
WebSwarm 提出了一种用于深度与广度网络搜索的递归多智能体委托框架,动态实例化能够分解任务、递归扩展并自适应协作的智能搜索节点。在多个基准测试上优于基线方法。
DeepSearch-Evolve 引入了一个用于 Web 代理的自我蒸馏框架,该框架使用可验证环境(DeepSearch-World)和 420K 多跳问答任务,无需从更强模型蒸馏即可实现有竞争力的性能。
SearchEyes 使用带类型的知识图谱作为模拟搜索世界的骨干,统一了训练数据、搜索环境和奖励信号。它提出了感知知识链(PKC)用于多跳路径采样,以及跳锚策略优化(HaPO)用于步级信用分配,在多模态知识密集型基准测试中取得了最先进的性能。
DiscoBench 是一个新基准,用于评估基于 LLM 的搜索代理能否主动识别用户查询中的歧义、提出澄清性问题,并通过多轮交互恢复正确的推理路径。
Visual-Seeker 提出了一种视觉原生多模态深度搜索代理,它主动推理细粒度视觉细节并综合多模态证据,在五个具有挑战性的多模态搜索基准上实现了最先进的性能。
TreeSeeker 是一个推理时框架,将深度搜索组织为对树结构状态的分支与回溯,利用文本 UCB 信号来平衡利用、探索与剪枝。它在深度搜索基准测试上优于强基线,表明显式的分支与回溯控制能改善多步网页搜索。
DeepDive 是一种用于构建深度搜索代理的模式,它从知识图谱合成问答,并通过强化学习(GRPO)训练多轮浏览。该模式包括实体混淆和结合工具调用的测试时缩放。
DeepDive 提出了一种自动化方法,利用知识图谱进行数据合成和多轮强化学习,训练深度搜索代理,从而实现复杂的多步推理和网页浏览。
介绍了MultiSearch,一种基于强化学习的框架,该框架在每一步推理中生成多个查询,并显式合并检索到的信息,以提高问答任务中的信噪比和推理准确性。
Google 正在将其新版 AI 驱动的 Google Finance 服务扩展至欧洲,该服务具备增强的 AI 研究功能、高级图表可视化、实时财报见解以及本地语言支持。
本文介绍了同策略数据演化(ODE)和一种视觉原生智能体框架,以提升多模态深度搜索智能体的性能。通过实现视觉证据的可重用性和闭环数据生成,ODE 显著提升了 Qwen3-VL 智能体在多个基准测试中的表现,超越了 Gemini 2.5 Pro。
OpenSearch-VL 是一个开源框架及论文,介绍了一种利用强化学习训练前沿多模态搜索智能体的方法,其中包含专用的数据筛选流程以及一种新颖的训练算法。