通过数据到洞察发现代理迈向自主商业智能

arXiv cs.AI 论文

摘要

本文介绍了 AIDA,这是一个自主代理框架,旨在通过利用强化学习和专有的领域特定语言来执行 SQL,将碎片化的企业数据转化为可操作的商业洞察。

arXiv:2605.07202v1 公告类型:新文章 摘要:将碎片化的企业数据转化为可操作的洞察,对于大语言模型(LLM)而言仍是一项重大挑战,主要受限于复杂的数据库模式、动态 SQL 生成的局限性以及对深度多维度分析的需求。在本文中,我们提出了 AIDA(自主洞察发现代理),这是首个专为复杂商业环境中的自主探索而设计的全栈框架。我们建立了一个高度灵活的即时零售环境,涵盖 200 多个指标和 100 多个维度,并集成了一种专有领域特定语言(DSL),以桥接语义推理与精确的 SQL 执行。我们的强化学习系统随后将商业分析构建为一个由帕累托原则引导的累积推理过程。实验结果表明,AIDA 显著优于基于工作流的代理,广泛的评估进一步显示,AIDA 在环境感知方面表现更佳,并能从不同角度进行更深入的分析。我们的工作最终确立了自主智能在工业级商业智能系统中的变革潜力。
查看原文
查看缓存全文

缓存时间: 2026/05/11 07:14

# 通过数据到洞察的发现代理走向自主商业智能

来源:https://arxiv.org/html/2605.07202

###### 摘要

将碎片化的企业数据转化为可操作的洞察,对于大语言模型(LLMs)而言仍然是一个重大挑战,这主要受限于复杂的数据库模式、动态 SQL 生成的局限性以及对深度多维度分析的需求。在本文中,我们提出了 AIDA(自主洞察发现代理),这是第一个专为复杂商业环境中的自主探索而设计的端到端框架。我们建立了一个高度灵活的即时零售环境,包含 200+ 个指标和 100+ 个维度,并集成了一种专有的领域特定语言(DSL),以桥接语义推理与精确的 SQL 执行。随后,我们的强化学习系统将商业分析构建为一个受帕累托原理(二八定律)指导的累积推理过程。实验结果表明,AIDA 显著优于基于工作流的代理,广泛的评估进一步揭示,AIDA 实现了更优越的环境感知能力,并从不同角度进行了更深入的分析。我们的工作最终确立了自主智能在工业级商业智能系统中的变革潜力。

机器学习,ICML

## 1 引言

商业分析的本质在于将海量数据集深刻转化为有价值的洞察,如图 1(https://arxiv.org/html/2605.07202#S1.F1)所示(Zikopoulos and Eaton, 2011 (https://arxiv.org/html/2605.07202#bib.bib24); Whitney, 2012 (https://arxiv.org/html/2605.07202#bib.bib3); Chen et al., 2012 (https://arxiv.org/html/2605.07202#bib.bib23); Vera-Baquero et al., 2015 (https://arxiv.org/html/2605.07202#bib.bib19))。在大语言模型(LLMs)(OpenAI, 2025 (https://arxiv.org/html/2605.07202#bib.bib8); Google, 2025 (https://arxiv.org/html/2605.07202#bib.bib7); Yang et al., 2025 (https://arxiv.org/html/2605.07202#bib.bib21))兴起推动下,出现了多种利用 LLM 能力的分析框架(Guo et al., 2024 (https://arxiv.org/html/2605.07202#bib.bib15); Hong et al., 2025 (https://arxiv.org/html/2605.07202#bib.bib14); Wen et al., 2025 (https://arxiv.org/html/2605.07202#bib.bib13))。它们展示了从提供的数据库中挖掘和提取有价值洞察的复杂能力。值得注意的是,Pérez et al.(2025 (https://arxiv.org/html/2605.07202#bib.bib20)); Zhang et al.(2025 (https://arxiv.org/html/2605.07202#bib.bib28))引入了代理式方法,使 LLMs 能够通过程序化执行与外部数据库交互,利用脚本或查询来处理结构化数据。

**图 1 说明:** 用于根本原因洞察的专业商业分析工作流程。该轨迹说明了细化商业查询的迭代过程:从性能基准测试开始,进行多阶段漏斗分析以隔离损失过程,最后分支到关于用户结构、价格竞争力和物流效率的具体假设。该流程特征化了现实场景中数据驱动推理和多维度钻取的动态性质。

虽然端到端自主代理范式在网页搜索(Jin et al., 2025 (https://arxiv.org/html/2605.07202#bib.bib4); Zheng et al., 2025 (https://arxiv.org/html/2605.07202#bib.bib5); Moonshot AI, 2025 (https://arxiv.org/html/2605.07202#bib.bib6))和开放式游戏(Wang et al., 2023a (https://arxiv.org/html/2605.07202#bib.bib16))等专业环境中已展现出显著成功,但其在现实商业分析任务中的潜力仍未被挖掘。主要障碍在于 SQL 的语法波动性,其特征是查询结构冗余且多样,以及其语义碎片化,源于不同系统中指标定义的不一致,这往往模糊了企业环境中的自主推理。为了缩小这一差距,在本文中,我们提出了 AIDA,这是第一个旨在探索复杂商业环境的端到端代理框架。我们的主要贡献总结如下:

- 我们建立了一个高度灵活的即时零售环境,整合了 200+ 个指标和 100+ 个维度。结合专有的 DSL,该环境为代理提供了近乎无约束探索的广阔领域。
- 我们提出了一种用于现实商业分析任务的数据到洞察框架,系统性地编排环境设置、状态建模、轨迹合成和强化学习。
- 我们在 AIDA 框架中引入了一系列专门的增强措施:用于目标洞察发现的稳健奖励机制,以及两种掩码策略以缓解奖励黑客行为并稳定策略更新。

## 2 相关工作

### 2.1 数据到洞察

商业分析的核心目标是将大规模、复杂和多源数据转化为可感知的洞察和可操作的决策(Zikopoulos and Eaton, 2011 (https://arxiv.org/html/2605.07202#bib.bib24); Chen et al., 2012 (https://arxiv.org/html/2605.07202#bib.bib23))。LLM 时代催化了将结构化数据转化为洞察的各种策略。这些方法 increasingly 专注于导航复杂环境,从传统数据库和表格文件到复杂的数据科学工具包。代表性系统包括 AgentPoirot(Sahu et al., 2024 (https://arxiv.org/html/2605.07202#bib.bib12)),它从商业 CSV 文件中提取洞察,以及用于解决特定数据科学任务的 Data Interpreter(Hong et al., 2025 (https://arxiv.org/html/2605.07202#bib.bib14))和 DS-Agent(Guo et al., 2024 (https://arxiv.org/html/2605.07202#bib.bib15))。ReActInsight(Wen et al., 2025 (https://arxiv.org/html/2605.07202#bib.bib13))进一步将数据源扩展到多源异构数据,强调通过相关性分析进行跨源洞察发现。

**图 2 说明:** 提出的 AIDA 框架的整体架构。该流水线由四个集成阶段组成:(1)环境设置,建立双工具执行层:一个通过 DSL 与数据环境交互的数据检索工具,以及一个在安全沙箱中执行代码的 Python 工具;(2)状态建模,将任务状态形式化为由标识符元数据、目标查询、分析洞察、观察日志和结构化推理图组成的五元组;(3)轨迹合成,通过迭代计划-行动-状态循环生成高质量轨迹;(4)强化学习,其中代理 rollout 由奖励函数评估。该框架采用全局批量返回机制来计算所有样本的平均值以进行优势计算,随后采用掩码策略选择性地优化模型的策略。

### 2.2 开放式代理

开放式环境中的代理具有高不确定性和巨大的状态空间特征。这包括深度搜索代理(Jin et al., 2025 (https://arxiv.org/html/2605.07202#bib.bib4); Zheng et al., 2025 (https://arxiv.org/html/2605.07202#bib.bib5); Moonshot AI, 2025 (https://arxiv.org/html/2605.07202#bib.bib6); Hu et al., 2025 (https://arxiv.org/html/2605.07202#bib.bib9); Team et al., 2025 (https://arxiv.org/html/2605.07202#bib.bib10); Qiao et al., 2025 (https://arxiv.org/html/2605.07202#bib.bib11)),它们在广阔、嘈杂的网络环境中导航以进行多步搜索和信息整合,例如 WebResearcher(Qiao et al., 2025 (https://arxiv.org/html/2605.07202#bib.bib11)),它将洞察建模为马尔可夫决策过程(MDP)。另一个子集在模拟或游戏环境中运行(Wang et al., 2023a (https://arxiv.org/html/2605.07202#bib.bib16); Zhu et al., 2023 (https://arxiv.org/html/2605.07202#bib.bib17); Wang et al., 2023b (https://arxiv.org/html/2605.07202#bib.bib18)),例如 VOYAGER(Wang et al., 2023a (https://arxiv.org/html/2605.07202#bib.bib16)),它通过终身学习机制探索 Minecraft 中的物品合成。这些代理在提供近乎无限探索深度的环境中追求开放式目标,激发类似人类的洞察行为。

## 3 现实商业分析任务

在即时零售领域,商业分析任务被定义为需要深度广泛数据探索和推理的宏观层面战略查询。在实践中,这种推理过程是一个动态的假设检验旅程,可能需要分析师花费数小时甚至数天的努力才能解决。如图 1(https://arxiv.org/html/2605.07202#S1.F1)所示,专家分析师通过交叉检查各种指标和维度来审问数据,从而创建分析分支。分析师的目标是将这些开放式问题转化为累积的洞察。然而,此类任务通常被事实上正确但微不足道的洞察所过度确定。例如,在归因于商业区曝光量下降时,多个因素——从天气波动到竞争对手的促销——可能在事实上都是有效的。分析师的目标不是列出每个数据支持的事实,而是隔离那些产生最大影响的高杠杆因素。

为了缩小这一差距,我们将任务定义为在帕累托原理下识别最佳洞察集。帕累托原理指出:

> 对于许多结果,大约 80% 的后果来自 20% 的原因。

这一原则引导代理修剪次要观察结果,并关注最关键的变量。在这一原则下,成功被定义为能够从大量有效但边缘信息的搜索空间中提取最具影响力的洞察。

## 4 AIDA 框架

我们提出的框架如图 2(https://arxiv.org/html/2605.07202#S2.F2)所示,由环境设置(第 4.1 节 (https://arxiv.org/html/2605.07202#S4.SS1))、状态建模(第 4.2 节 (https://arxiv.org/html/2605.07202#S4.SS2))、状态转移(第 4.3 节 (https://arxiv.org/html/2605.07202#S4.SS3))、轨迹合成(第 4.4 节 (https://arxiv.org/html/2605.07202#S4.SS4))和强化学习(第 4.5 节 (https://arxiv.org/html/2605.07202#S4.SS5) 和第 4.6 节 (https://arxiv.org/html/2605.07202#S4.SS6))组成。

### 4.1 环境设置

AIDA 框架建立在专门化的工业环境之上,这是自主探索的基础。该基础设施旨在支持两种类型的操作:`Dsl2data` 和 `Python` 执行。具体而言,`Dsl2data` 允许代理通过自定义 DSL 执行灵活的数据查询,从而实现指标和维度的任意组合以进行深度探索。`Python` 执行允许代理通过运行 Python 脚本来执行复杂计算。为了支持指标和维度的自由组合和钻取,我们将传统的数据开发重塑为指标和维度的架构。这种解耦系统使代理能够执行无约束的即时查询(见附录 A (https://arxiv.org/html/2605.07202#A1))。

在此基础上,我们实施了一种标准化的 DSL 协议,允许代理以编程方式选择指标、维度和过滤条件以进行即时查询。(见附录 B (https://arxiv.org/html/2605.07202#A2))。`Python` 执行操作由一个安全、隔离的沙箱环境支持。虽然 `Dsl2data` 提供原始数据证据,但该基础设施使代理能够通过任意代码执行复杂计算和假设检验。

### 4.2 状态建模

我们将现实商业分析重新表述为如图 3(https://arxiv.org/html/2605.07202#S4.F3)所示的马尔可夫决策过程。

**图 3 说明:** 现实商业分析任务中状态 $s_t$ 的详细说明。Id 和 Question 提供分析的原始背景信息和问题。Insight 和 Observation Log 维护洞察和发现的存储库,特别突出 Proof 字段以支持现实数据,以及 Structure 元数据以实现数据可追溯性。Reasoning Graph 提供代理逻辑轨迹的全局视图,确保分析在探索过程中保持连贯。

形式上,在每个时间步 $t$,状态 $s_t$ 被定义为一个五元组:

$$ s_t = \langle id, q, c_t, d_t, g_t \rangle \quad (1) $$

其中:

- $id$ 代表一个标识符的复合集。例如,对于商户级分析,我们有店铺、大类和商业区的 ID;对于品牌级分析,我们有品牌、大类和城市的 ID。
- $q$ 代表目标问题,作为整个分析过程的目标锚点。
- $c_t$ 是洞察集,捕捉符合帕累托原理的全局洞察。为了跟踪代理理解力的演变,每个条目被分配四种状态之一:
  - **New(新)**:在当前步骤中发现的新洞察。
  - **Unchanged(未改变)**:没有任何变化的先前洞察。
  - **Reinforced(强化)**:现有洞察,现在有更多证据支持。
  - **Refuted(反驳)**:先前洞察,因为与新数据矛盾而被纠正。
  每个洞察还包括一个标题(core insight)和一个记录现实数据支持的 proof 字段。
- $d_t$ 代表观察日志,提供环境返回的结构化索引。每个条目包括数据类型(例如,CSV、TXT)、语义描述,以及一个 structure 元数据字段,明确记录查询的指标、维度和过滤条件。
- $g_t$ 是以 mermaid 格式序列化的推理图。它映射推理路径的拓扑结构,记录假设检验和逻辑分支。

通过这种状态建模,AIDA 框架有效地将代理的认知与嘈杂的对话历史解耦。这种建模为代理提供了强大的长期记忆,以在延长的分析周期中保留关键洞察,同时提供原生的自我修正机制,随着新证据的出现来细化或反驳洞察。这确保了分析过程既在逻辑上持久,又能适应复杂的现实数据。

### 4.3 状态转移

**图 4 说明:** 交互推理和状态转移过程概述。在每一步 $t$,模型执行推理以更新结构化状态并与环境交互。

从状态 $s_t$ 到 $s_{t+1}$ 的转移由结构化的推理-行动周期驱动。如图 4(https://arxiv.org/html/2605.07202#S4.F4)所示,在每个时间步 $t$,代理接收由当前状态 $s_t$、先前操作和最新观察组成的输入。代理输出定义为以下模块:

- **State Think & Update(状态思考与更新)**:代理首先进行推理以分析最新观察结果。然后,它生成一个作为状态更新的结构化文本块,该块指定了洞察($c_t$)、观察日志($d_t$)和推理图($g_t$)所需的更新。然后,这些更新合并到先前的状态中。
- **Action Think & Action(行动思考与行动)**:基于新更新的状态,代理进行推理并确定下一个操作 $a_t$,该操作随后在环境中执行,形成下一轮观察 $o_t$。

在实际部署中,代理探索直到用户定义的最大步数,之后后处理模块将最终状态转换为易于用户理解的报告。

### 4.4 轨迹合成

在 AIDA 的原子数据环境中,策略模型面临着由度量...(注:原文在此处截断)

相似文章

构建数据代理

Reddit r/AI_Agents

探讨从文本转SQL到自主数据代理的演变,比较了使用LangGraph自定义构建的代理与Snowflake Cortex Analyst、Databricks Genie和PowerBI Copilot等托管平台。

代理将成为发现层

Reddit r/AI_Agents

本文认为,AI 代理将从工作流自动化转变为发现层,为用户选择工具、供应商和来源,使得代理的可见性对创始人至关重要。作者介绍了 Rankpad 作为应对这一挑战的解决方案。

面向分析的AI

Reddit r/AI_Agents

一种将AI应用于分析的产品或服务,可能用于自动化数据洞察和商业智能。