跨数据库查询与网络搜索的混合深度研究基准测试
摘要
本文介绍了HybridDeepResearch,一个用于评估AI智能体在需要整合网络搜索和SQL查询任务上的基准测试,揭示了即使最先进的模型在跨结构化和非结构化数据维护约束方面也存在困难。
arXiv:2609.09410v1 公告类型:新
摘要:虽然自主智能体通过迭代导航开放网络来综合信息,在“深度研究”方面取得了显著进展,但现实世界的问题解决很少局限于单一环境。复杂的分析任务本质上需要智能体将来自模糊非结构化文本(例如,开放网络)和高度精确结构化数据(例如,关系数据库)的证据交织在一起。然而,现有基准测试孤立地评估这些模态,未能捕捉到关键的“交接”——即在系统之间转移证据时保持约束的能力。我们引入了HybridDeepResearch,据我们所知,这是第一个需要同时使用网络搜索和SQL来形成完整、可验证答案的深度研究基准测试。该基准测试包含380个工具依赖任务,基于LiveSQLBench-Base-Lite数据库和公共网络语料库,通过自动检查和人工审查进行验证,并覆盖三种推理模式:SQL2S、S2SQL和并行。在专有和开放权重模型下,使用各种智能体脚手架进行评估,显示即使像GLM-5.2、Claude-Sonnet-4.6和GPT-5这样的最先进的模型,在困难子集上也仅达到约50-54%的Pass@8。值得注意的是,结果表明方向推理比并行交集更困难,这突显了在不丢失约束的情况下连接结构化和非结构化信息空间仍然是智能体系统的主要开放挑战。代码和数据集在GitHub (https://github.com/Snowflake-AI-Research/HybridDeepResearch) 和 Hugging Face (https://huggingface.co/datasets/Snowflake/HybridDeepResearch) 上公开可用。
查看缓存全文
缓存时间: 2026/09/10 08:10
# 跨数据库查询与网络搜索的混合深度研究基准评测 来源:https://arxiv.org/html/2609.09410 吴若帆 许培然¹¹脚注标记:1 李小龙¹¹脚注标记:1 舒凡¹¹脚注标记:1††感谢:~同等贡献。尹素英 王亦特 于晓东²²脚注标记:2刘博毅††感谢:~项目负责人。 所属机构:休斯敦大学 | 加州大学洛杉矶分校 | 香港大学 | 首尔国立大学 | Snowflake AI Research ###### 摘要 尽管自主智能体通过迭代访问开放网络来合成信息,在“深度研究”领域已取得显著进展,但现实世界的问题解决很少局限于单一环境。复杂的分析任务本质上要求智能体融合来自模糊非结构化文本(如开放网络)和高度精确结构化数据(如关系型数据库)的证据。然而,现有基准孤立评估这些模态,未能捕捉关键的“交接”过程——即在不同系统间转移证据时保持约束条件的能力。我们推出HybridDeepResearch,据我们所知这是首个要求同时使用网络搜索和SQL才能形成完整、可验证答案的深度研究基准。该基准包含380个基于LiveSQLBench-Base-Lite数据库和公共网络语料库的工具依赖型任务,经过自动化检查和人工审核验证,涵盖三种推理模式:SQL2S、S2SQL和Parallel。对多种专有模型和开放权重模型在不同智能体框架下的评估表明,即使GLM-5.2、Claude-Sonnet-4.6和GPT-5等最先进的模型在困难子集上也仅能达到约50-54%的Pass@8性能。值得注意的是,结果显示方向性推理比并行交集显著更困难,突显了在不丢失约束条件的情况下连接结构化与非结构化信息空间仍是智能体系统面临的主要开放挑战。代码和数据集已公开于GitHub (https://github.com/Snowflake-AI-Research/HybridDeepResearch) 和 Hugging Face (https://huggingface.co/datasets/Snowflake/HybridDeepResearch)。 参考图注 图1:代表性前沿模型和开放权重模型在平衡困难子集上的Avg@8性能。总体成功率低于30%,且在方向性推理模式上的表现显著更低。 参考图注 图2:HybridDeepResearch中的三种混合推理模式及各自所需的信息流。SQL2S将数据库检索的实体传递给网络搜索,而S2SQL将搜索检索的实体或约束转换为SQL谓词。Parallel独立解决SQL和搜索组件并返回其集合交集。箭头表示证据或约束必须在工具间转移的方向。 ## 1 引言 虽然大语言模型在导航动态网络环境(Gou等,2026)和从开放语料库合成证据(Wei等,2025;Chen等,2025b;Du等,2026)方面取得了显著成就,但这些成果主要反映了单一模态推理。然而,在复杂的现实世界分析任务中,关键信息并非孤立存在。金融审计、供应链风险评估和科学研究等高风险领域本质上依赖于整合不同数据源。为了回答现实世界问题,自主智能体必须跨越高度结构化数据(如关系型数据库)与模糊的非结构化信息(如新闻文章、公开文件或开放网络)之间的边界。 尽管存在这一明确需求,评估环境仍高度模块化。基础模型通常仅评估其编写复杂SQL查询(Li等,2023;Team,2025;Lei等,2025)或独立执行开放式网络检索(Zheng等,2025;Java等,2026;Li等,2026b)的能力。因此,智能体可能在独立的文本到SQL或浏览任务中达到最先进性能,但在需要协调两者间的证据时完全崩溃。 我们识别出这一关键故障模式为“交接”。当证据必须跨系统转移、交叉检查和验证时,智能体常常丢失约束条件。为使这些协调故障可视化和可量化,我们引入HybridDeepResearch,这是一个明确设计为混合深度研究诊断工具的基准。我们的框架中每个任务不单独衡量工具使用,而是需要模态间的可验证交集。我们围绕三种不同的推理模式构建这些任务,每种模式旨在暴露特定的交接漏洞: - •SQL2S(SQL到搜索):数据库提供必须约束后续网络探索的严格锚点。 - •S2SQL(搜索到SQL):非结构化网络搜索揭示必须指导后续数据库查询的实体或条件。 - •Parallel:SQL和网络搜索独立产生候选集,最终答案仅来自其精确交集。 HybridDeepResearch包含380个基于LiveSQLBench-Base-Lite数据库(Team,2025)和来自Wikipedia与FineWeb-10B(Penedo等,2024)的公共证据的复杂问题。每个任务严格依赖工具,需要同时成功执行SQL查询和网络搜索。为集中进行压力测试,我们精心策划了一个包含120个示例的平衡困难子集,其中每种推理模式包含40个独特挑战性问题。我们使用最先进的专有模型(包括GPT-5和Claude-Sonnet-4.6)以及开放权重模型(如Qwen3.5和GLM-5.2)建立了全面的基线,这些模型部署在单智能体和多智能体框架下(Roucher等,2025;Su等,2026)。 在平衡困难子集上,即使最强大的专有系统也仅能达到约50-54%的Pass@8,整体Avg@8低于30%,表明成功的解决方案既不频繁也不可靠。如图1所示,最大的性能差距出现在方向性交接(SQL2S和S2SQL)上。这些结果表明,在不同数据孤岛间保持约束仍是深度研究智能体面临的主要未解决挑战。 总而言之,我们的主要贡献是: - •我们推出HybridDeepResearch,据我们所知这是首个明确设计用于衡量开放式网络搜索与结构化数据库查询交集的深度研究评估框架。 - •我们定义了三种推理模式(SQL2S、S2SQL和Parallel),并构建了380个经过自动验证和人工审核的工具必要问题,包含平衡的120个示例困难子集。 - •我们对领先模型和智能体框架进行了广泛评估,揭示了现代智能体在不同模态间转移和调和证据的关键性能瓶颈。 ## 2 相关工作 与HybridDeepResearch相关的工作涵盖深度研究评估、数据库智能体评估和混合基准。深度研究基准侧重于需要迭代网络搜索和对检索证据进行推理的复杂问题(Wei等,2025;Java等,2026;Chen等,2025b)。数据库评估已从将自然语言问题映射为可执行SQL发展到需要与数据库环境进行多步交互的智能体导向任务(Yu等,2018;Li等,2023;Lei等,2025;Huo等,2026)。 现有混合基准结合异构证据(Chen等,2020b, 2020a;Zhu等,2021;Christmann等,2024),但未明确评估在不同依赖结构下同时需要网络搜索和可执行数据库查询的面向答案的任务。HybridDeepResearch通过SQL到搜索、搜索到SQL和并行任务针对这一场景。详细讨论见附录H。 参考图注 图3:HybridDeepResearch构建流程概览。数据库值作为共享种子实体扎根,并沿独立路径发展为有证据支持的搜索问题和可执行的SQL问题-查询对。经过路径特定过滤后,角色兼容的组件被组合为S2SQL、SQL2S或Parallel实例。自动单模态检查和最终人工审核移除了仅用单一工具可解、模糊或非唯一的问题。 ## 3 混合推理模式 现实世界的混合研究不仅因为需要两种工具而具有挑战性,还因为传递约束在它们之间的约束通常结构复杂、模糊且容易严重干扰。为系统压力测试智能体,我们将这些跨模态交接分为三种推理模式(如图2所示)。我们有意设计这些模式以暴露独立工具能力与真正跨模态协调之间的差距。 SQL2S(SQL到搜索)。结构化数据库提供必须严格约束后续非结构化网络探索的刚性锚点。例如,智能体可能被要求找到锂电池的主要供应商,并检查外部新闻以查看其主要制造中心是否面临港口罢工。智能体必须首先查询数据库以识别特定供应商(如A公司),然后发布针对A公司罢工状态的定向网络搜索。一种常见故障模式是“显著性陷阱”:智能体通过SQL成功找到A公司,但发布关于电池罢工的通用网络搜索,并错误地返回关于不同公司的高排名新闻文章。 S2SQL(搜索到SQL)。非结构化网络搜索揭示必须指导后续数据库查询的实体或条件。例如,如果要求识别在鹿特丹罢工的电池制造商并计算与其第三季度支出,智能体必须首先搜索新闻以识别罢工公司(A公司)。然后必须将该文本发现转换为严格的SQL谓词(如WHERE vendor_name = ‘A公司’)。常见故障是“丢弃锚点”:智能体从文本中正确识别公司,但编写通用SQL查询未能应用必要过滤器,从而破坏跨模态链接。 Parallel。SQL和网络搜索独立产生候选集,最终答案仅来自其精确交集。如果询问哪些活跃的一级供应商受到鹿特丹罢工影响,智能体必须查询数据库获取一级供应商列表,并独立搜索网络获取受罢工影响的公司。智能体只有返回精确重叠部分才算成功。常见故障是过早融合:智能体返回网络上找到的所有罢工公司,未能根据数据库的活跃供应商约束进行交叉检查。 虽然这些模式在信息流上不同,但它们测试相同的底层能力:智能体是否能够在结构不同的模态间保持、转换和调和语义约束。我们利用这些模式作为构建混合任务的基础模板,强制实现可验证的“混合锁”。 ## 4 HybridDeepResearch构建 参考图注 图4:从数据库扎根种子实体构建非结构化搜索组件。来自Wikidata、Wikipedia和FineWeb的公共证据被组织为收敛的多线索图谱,然后精炼以移除模糊、薄弱或过时的关系。受控的线索模糊化抑制直接实体泄露,然后LLM将经过验证的图谱渲染为角色兼容的搜索问题,用于SQL2S、S2SQL或Parallel。 构建稳健的混合深度研究基准需要超越简单配对数据库查询和网络检索任务。每个基准实例必须满足四个耦合要求:(1)两个组件必须扎根于共享的真实世界实体,(2)保持单独可验证性,(3)实例化第3节定义的跨模态依赖结构之一,(4)严格要求综合两种模态以推导最终答案。违反任一条件会导致问题模糊、可通过单一来源平凡解决或仅在形式上是混合的。 为满足这些约束,我们设计了一个严格的构建流程,围绕三个核心机制:双重扎根实体锚定、角色感知对称生成和混合锁(如图3总结)。 ### 4.1 双重扎根实体锚定 为建立结构化和非结构化环境间的可靠桥梁,我们将每个任务锚定于共享种子实体。然而,发现有效的桥接实体具有挑战性:数据库值通常刚性但存在命名歧义(如“摩纳哥”可能指国家、城市或赛车活动),而开放网络包含庞大且噪声的实体空间。为解决此问题,我们采用双重扎根机制。我们首先提取表示具体实体(如人物、组织)的数据库单元值,并使用Google知识图谱验证其全局显著性。至关重要的是,全局显著性并不保证局部数据库一致性。因此,我们部署具有SQL能力的探索智能体检查每个保留实体在其特定模式上下文中的使用方式,生成*数据库扎根描述*。此描述隔离了实体的精确现实含义,指导后续跨模态生成以检索严格匹配数据库上下文的证据,而非无关的同音异义词。 参考图注 图5:从数据库扎根种子实体构建结构化SQL组件。可复用的SQL模式从跨数据库领域的BIRD-SQL和LiveSQLBench查询中提取,然后去重并检查覆盖范围。每个兼容模式在目标混合角色下实例化,产生SQL并被表述为自然语言问题,在执行、种子角色和人工质量检查后保留。 ### 4.2 角色感知对称生成 我们不是独立采样问题,而是对称生成针对搜索和SQL组件的问题...
相似文章
S1-DeepResearch:超越搜索,迈向真实世界的长周期研究代理
本文介绍了S1-DeepResearch-32B,这是一个开源模型及包含15K条轨迹的数据集,用于深度研究代理,通过联合建模信息获取、知识综合与规划,在20个基准测试中取得了最先进的性能。
DeepWeb-Bench: 一个要求大规模跨来源证据和长期推导的深度研究基准
介绍DeepWeb-Bench,这是一个困难的深度研究基准,需要大规模跨来源证据收集和长期推导。对九个前沿模型的评估显示,推导/校准失败导致了超过70%的错误。
EvoBrowseComp:面向演进知识的搜索代理基准测试
本文介绍了EvoBrowseComp,这是一个动态基准测试,包含400个英文和400个中文复杂问题,通过实时网络遍历合成,用于评估搜索代理,避免测试集污染,确保对参数记忆的鲁棒性。
DeltaML-Bench: 评估现实研究代码库上的机器学习智能体
介绍了DeltaML-Bench,一个用于评估机器学习智能体在现实研究代码库上的基准测试,展示了ARG脚手架相比标准方法显著提高了成功率。
跨尺度科学挑战的AI智能体基准测试
介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。