DI-Bench:系统化生成企业智能体领域数据智能基准
摘要
DI-Bench 是一个管道,用于系统化生成企业数据智能任务的基准,结合知识检索和分析计算。它评估模型,并发现在业务规则修改计算的任务中,模型仅能达到32%的准确率。
arXiv:2609.05776v1 公告类型:新
摘要:在领域特定基准上评估企业智能体至关重要,但公共基准很少评估智能体是否能将业务知识与分析计算集成,且手动构建此类基准成本高昂。我们提出DI-Bench,一个生成数据智能(DI)现实基准的管道,DI是从大量企业数据中提取见解的实践。为模拟需要计算和知识检索的现实DI任务,DI-Bench构建了一个覆盖数据表、维度、度量和文档的工件链接图,以形成涉及结构化数据和相关知识的问题。真实答案通过查询执行得出,随后由LLM进行问题生成和验证。应用于两个公共数据集,该管道产生了一个731个任务的基准,涵盖知识检索、分析计算和基于规则的推理。为展示基准的区分能力和难度,我们评估了四个模型,揭示了一个重要发现:当执行检索的业务规则修改计算的计算任务时,模型仅能达到32%的准确率。
查看缓存全文
缓存时间: 2026/09/10 08:42
# DI-Bench:为领域内数据智能企业智能体系统化构建评测基准 来源:https://arxiv.org/html/2609.05776 Kristen Surrao(单位:Shayan Ali Akbar, Omar Alonso, Erwin Cornejo, Yuan Li, Yi Zhang) Torpong Nitayanont(单位:Amazon.com) Yupei Zhang(单位:通信邮箱:[[email protected]](mailto:email@domain)) ###### 摘要 在特定领域基准上评估企业智能体至关重要,然而公开基准很少评估智能体能否将业务知识与分析计算相结合,且人工构建此类基准成本高昂。我们提出 DI-Bench,这是一个为数据智能(Data Intelligence, DI)——从海量企业数据中提取洞见的实践——生成真实基准的流程。为了模拟既需要计算又需要知识检索的真实 DI 任务,DI-Bench 在数据表、维度、指标和文档之上构建了一个*制品关联图*,以形成涉及结构化数据及相关知识的问题。真实答案通过查询执行推导得出,随后借助大语言模型进行问题生成与验证。应用于两个公开数据集后,该流程产出了一个包含 731 个任务的基准,涵盖知识检索、分析计算和基于规则的推理。为展示该基准的区分度和难度,我们评估了四个模型,揭示了一个重要发现:当执行需要检索业务规则来调整计算的计算任务时,模型的准确率仅为 32%。 ## 1 引言 基于大语言模型的智能体正越来越多地被部署用于企业数据智能(DI),以回答需要检索知识、查询关系数据库并应用特定业务规则的业务问题。考虑一个业务分析师的提问:“上个月有多少比例的客户支持工单满足了其解决时间承诺?”一个简单的智能体架构是不够的,因为仅仅将每个工单的关闭时间减去其开启时间是不足的。它必须首先检索适用的服务级别规则:高级客户有更短的解决目标,工单等待客户期间计时暂停,且不提供 24 小时支持的方案会排除周末。智能体随后必须查询工单历史和客户方案数据,为每个工单应用正确的规则,并计算符合条件的解决时间。因此,回答该问题需要将检索到的业务规则与分析数据和计算相结合;忽略规则将导致错误结果。 | 任务类型 | 构建方法 | SQL查询 | 文档问答 | 数值计算(如点查询、比较) | 分析推理(如趋势、统计) | 文档检索 | 文档改变答案 | 质量检查 | 生成方式 | | :--------------------- | :------- | :------ | :------- | :----------------------- | :--------------------- | :------- | :----------- | :------- | :------------- | | Spider | ✓ | ✗ | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ | M>LM | | BIRD | ✓ | ✗ | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ | M>LM | | τ-bench | ✗ | ✓ | ✓ | ✗ | ✗ | ✓ | ✓ | ✗ | M>LM | | InfiAgent-DABench‡ | ✗ | ✗ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | L>MM | | FinanceBench | ✗ | ✓ | ✓ | ✗ | ✓ | ✓ | ✓ | ✗ | T>MM | | AutoBencher† | ✗ | ✓ | ✓ | ✗ | ✗ | ✗ | ✗ | ✗ | LM, L | | DI-Bench‡ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | G>T>LM, L | 表1:DI-Bench 与用于分析/工具使用智能体的基准对比。基准名称符号表示发布的制品:†仅流水线;‡流水线和固定数据集均已发布;无符号表示仅数据集。*文档检索*列表示智能体是否需要检索相关文档。*文档改变答案*列表示答案的正确性是否依赖于文档。当文档影响答案但预先提供给智能体而非检索时,这两列会出现✗/✓对(无需检索,需要文档)。构建方法:M=人工,L=大语言模型,T=模板,G=图;“>>”按贡献度排序组件。 在这一系列从知识检索、数据查询、业务规则理解到下游分析任务上评估智能体,需要测试这一完整技术栈的基准,但现有基准各自只覆盖其中一部分。像 Spider(Yu et al., 2018)和 BIRD(Li et al., 2023)这样的文本转SQL基准,在问题中内联提供了所有所需知识,因此智能体无需从单独的语料库中检索。Spider 2.0(Lei et al., 2025)使用任务特定的文档,这些文档指定了黄金SQL实现的公式或阈值,但每个任务都命名了其所需的文档,且这些文档是为该任务专门编写的,而非智能体需要导航的语料库。数据分析基准如 InfiAgent-DABench(Hu et al., 2024)扩展了任务覆盖范围,但每个任务仅在单一数据表上操作,没有文档语料库。基于文档的金融问答基准(Islam et al., 2023;Chen et al., 2021)需要从文件中检索,但这些文档是数值的数据源,而非指导数据库计算的自然语言规则。工具使用基准如τ-bench(Yao et al., 2024)测试API调用的规则遵循情况,规则在上下文中给出,且没有对数据的分析计算。同时期的数据科学和企业数据智能体基准(Jing et al., 2025;Sahu et al., 2025;Ma et al., 2026;Yang et al., 2026;Abaskohi et al., 2026;Mo et al., 2026)涉及不同的任务类型,包括建模、洞见发现、跨系统集成、端到端分析、深度研究和GUI流水线完成,而不是在分析过程中检索和应用业务知识。表1总结了这些基准。 第二条研究路线解决了人工构建基准的成本问题。大语言模型驱动的生成(Li et al., 2025)使用大语言模型同时构建问题和答案,但没有提供答案正确性的形式化保证。在多跳文本问答中,Min et al.(2019)表明名义上的多跳基准通常可以单跳回答,这激励了在结构上保证多跳必要性的生成流水线。2WikiMultiHopQA(Ho et al., 2020)通过类型化的图遍历将Wikidata三元组组合成问题,而MuSiQue(Trivedi et al., 2022)使用反事实检查来验证每个证据跳是否必要。然而,这些多跳文本问答工作仅在非结构化文本上操作:它们的图连接知识库中的实体,而非数据库表和规则文档;且验证目标是证据的必要性,而非计算答案的价值。后者对于分析性问题很重要,因为引用一个文档可能不会改变数值答案。尽管检索和文本转SQL方面的最新进展显著提升了单个能力,但智能体能否正确地将检索到的业务知识整合到下游分析计算中,仍然不明确。此外,企业部署依赖于特定组织的指标和业务逻辑,这些会随时间演变并在不同领域间存在显著差异。为一个公司构建的基准无法转移到另一个公司,即使在同一个公司内,随着定义的修订,基准也会过时。因此,部署智能体的团队需要从其自身的数据库和业务文档生成基准,并在指标和规则变化时更新基准,而不是重用静态的、通用的测试集。这促使了任何组织都可以应用于其自身领域的基准生成流水线。我们通过DI-Bench解决了这一差距,这是一个端到端的流水线,用于为同时操作关系数据库和非结构化业务知识的数据智能体生成可验证的基准。通过结合程序化执行、自动化验证和真实的企业制品,DI-Bench生成具有确定性真实答案的基准任务,同时减少了人工构建基准的努力。我们的贡献包括:1. DI-Bench,一个从结构化数据库和业务知识源生成数据智能基准的流水线。2. 在一个生成的基准上进行演示,该基准涵盖巴西电子商务和捷克零售银行业务,产出了731个经过验证的任务,涉及九种分析类型,需要检索、计算和业务规则推理。3. 对企业智能体进行实证分析。跨模型来看,DI-Bench揭示了在需要将检索到的业务规则与分析计算相结合的任务上,性能持续下降。 ## 2 问题设置 DI-Bench针对的是诸如第1节中的客户支持示例这类问题:“上个月有多少比例的客户支持工单满足了其解决时间承诺?”这个百分比仅靠工单时间戳无法正确计算。智能体必须查询工单历史和客户方案数据,检索适用的服务级别规则,并在聚合结果前应用这些规则。更一般地,DI-Bench研究的是回答业务问题既需要在关系数据上进行查询执行,又需要在包含计算相关规则的文档上进行检索增强生成(Lewis et al., 2020; Guu et al., 2020)的场景。我们假设两个输入: 1. 一个具有已知模式(包括表、列和外键)的关系数据库。在持续的示例中,数据库包含工单历史和服务方案。 2. 一个包含规则文档的知识库(KB),这些文档包含影响指标计算的业务定义、阈值和条件覆盖。在持续的示例中,适用的解决时间目标可能取决于客户服务计划和周末排除规则。KB还包括一个指标目录,其中包含公式和示例SQL模板。在我们的演示中,这些文档是基于数据库模式的大语言模型生成的增强内容(附录B.1)。关键特性是信息分散:没有单个制品包含正确回答问题所需的一切。例如,指标目录将客户满意度(CSAT)定义为评分4星或5星的评论占比,但一个单独的规则文档规定中性(3星)评论必须从分母中排除。如果不检索该规则,计算出的答案将偏差几个百分点,使得每个任务都真正具有区分度。 ## 3 方法论 参见图1说明:DI-Bench 流水线。从数据库和知识库开始,流水线(1)构建一个制品关联图,将指标连接到所需的表和管理的规则文档,采样子图作为任务骨架;(2)通过查询执行计算黄金答案;(3)从答案反向生成自然语言问题;(4)应用自动化验证过滤器来验证每个任务。 DI-Bench通过五个阶段生成基准任务:(1)构建一个图,将结构化数据与影响其解释的非结构化文档连接起来;(2)从图中采样子图作为任务骨架;(3)执行SQL和工具以计算黄金答案;(4)从这些答案反向生成自然语言问题;(5)验证质量。图1提供了概览。 ### 3.1 制品关联图 为了确保每个任务真正测试文档检索能力,文档和计算之间的依赖关系被形式化为一个类型化的*制品关联图*(ALG)。涉及文档检索和分析计算的任务在真实企业任务中很常见,但当前基准缺乏生成此类任务的可靠方法。该图立即显示了哪些非结构化文档映射到哪些结构化表和指标,使我们能够生成真正同时涉及这两种技能的任务。 #### 图结构 ALG包含四种节点类型:表、指标、规则和维度。六种边类型捕获结构化数据和业务知识之间的依赖关系(表2)。关键边是*规则→指标*,记录了一个文档如何修改指标的计算。 | 边类型 | 含义 | | :--------------- | :----------------------------------- | | 指标→表 | 指标公式使用来自表的列 | | 表→维度 | 表拥有可用作过滤/分组维度的列 | | 表→表 | 表可以连接 | | 规则→指标 | 规则文档更改此指标的计算答案 | | 指标→指标 | 复合指标使用另一个作为组成部分 | | 规则→维度 | 规则仅在维度取特定值时适用 | 表2:制品关联图中的边类型。规则→指标边是关键:它将非结构化文档与它们修改的结构化计算连接起来。 #### 构建 结构化制品之间的边直接从模式和指标定义中提取。与规则相关的边需要解释自然语言文档;我们使用大语言模型(DeepSeek V3.2)来识别文档修改了哪些指标,以及它是否条件性地适用于特定维度值。 #### 不完美的图提取 该流水线并不假设规则-指标提取是完美的。候选链接在基准生成过程中通过反事实检查进行评估。反事实检查评估包含该规则是否改变了SQL或答案。这些检查有助于过滤虚假的规则-指标关联并提高基准质量。因此,不完美的提取主要影响覆盖率而非正确性(附录H)。 #### 为什么用图? 该图捕获了业务文档与其影响的计算之间的依赖关系,从而能够系统地生成真正需要同时访问数据和业务知识的任务,而不是那些文档名义上附加但不影响答案的任务。因为规则→指标边是由规则对计算的因果影响而非字面相似性定义的,所以该图比语义相似性或随机配对更可靠地选择会改变答案的规则(见附录C的分析)。 ### 3.2 子图采样 流水线从ALG中采样连通子图。每个子图提供一个任务骨架,固定了指标、数据源、维度和业务规则,但未固定它们的具体值。每个骨架通过变化过滤器、时间窗口和分析类型,生成多个基准任务。 #### 枚举 从每个指标节点开始,流水线沿着图边扩展,收集所需的表、维度和修改规则文档。然后,根据数据集大小和目标任务数量,枚举或采样有效的连通子图,同时遵守规则适用性和指标依赖性。 #### 质量和多样性选择 从有效的候选子图池中,流水线选择将被实例化为任务的子图子集,旨在选择一个在覆盖的指标、规则和维度上具有多样性的集合,而不是重复相似的组合。选择使用最大边际相关性(此处内容截断)
相似文章
AgenticDataBench:面向数据代理的综合性基准测试
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。
dig.bench(网站)
dig.bench 是一个基准,用于评估 AI 模型在文本游戏中发现未知规则的能力,通过 70 个交互式游戏和一个比较前沿模型的排行榜来衡量科学发现能力。
DBA-Bench:面向基于LLM的数据库操作代理的生产保真度基准
DBA-Bench 是一个用于评估基于 LLM 的数据库代理的生产保真度基准,包含七个领域的 106 个场景,采用结果优先评估和可控可重复性。最佳自动化基线仅达到 17.9% 的安全通过率,而人类 DBA 为 93.4%。
DiG-bench:游戏中的发现
介绍 DiG-bench,一个包含70个游戏的基准测试,旨在通过主动实验测试 AI 智能体发现隐藏规则和目标的能力,具有七个难度等级。
DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
本文介绍了DSAgentBench,这是首个在真实计算机环境中评估自主智能体完成完整、多工具数据科学工作流的基准。结果表明,即使最强的智能体(Claude-4.6-Sonnet)的任务成功率也仅为56.70%,而开源智能体仍低于1%,揭示了巨大的能力差距。