用于自动化企业分析和洞察生成的多代理平台
摘要
本文提出了一种基于CrewAI构建的多代理框架,用于自动化对话式商业智能。该框架使用五个专门的AI代理来处理查询、检索数据并生成洞察。评估显示,在准确性和质量上较基线有显著提升。
arXiv:2608.18740v1 Announce Type: new
摘要:本文提出了一种基于CrewAI [1]构建的多代理框架,用于对话式商业智能。五个专门的AI代理以顺序管道方式运行,以处理自然语言查询、检索和分析数据、通过Model Context Protocol (MCP) [2]生成可视化,并交付可操作的洞察。该平台采用纵深防御安全架构实现多租户数据隔离,并配备查询参数化机制,可将对话式洞察转换为可复用的仪表板组件。在跨越合成和生产企业数据集的300个端到端测试用例中的评估显示,功能准确率为95.3%,平均响应延迟为24秒,LLM-as-a-Judge框架评估的响应质量评分为4.52/5.0,无幻觉率为93.0%,相比单代理基线准确率提升22.6个百分点,质量提升20.2%。跨四个LLM后端的交叉模型评估和人类专家验证证实了架构的可推广性和评估者的可靠性。消融研究证实,数据分析和报告聚合代理是输出质量的主要驱动因素。
查看缓存全文
缓存时间: 2026/08/20 10:20
# 用于自动化企业分析与洞察生成的多智能体平台
来源:https://arxiv.org/html/2608.18740
Manoj N M
单位:Rakuten India Enterprise Private Limited, 印度班加罗尔
\{manoj\.m, vijayakrishna\.s, manjunath\.s, rohit\.pahan\}@rakuten\.com
Vijayakrishna S
单位:Rakuten India Enterprise Private Limited, 印度班加罗尔
\{manoj\.m, vijayakrishna\.s, manjunath\.s, rohit\.pahan\}@rakuten\.com
Manjunath Srinivas
单位:Rakuten India Enterprise Private Limited, 印度班加罗尔
\{manoj\.m, vijayakrishna\.s, manjunath\.s, rohit\.pahan\}@rakuten\.com
Rohit Pahan
单位:Rakuten India Enterprise Private Limited, 印度班加罗尔
\{manoj\.m, vijayakrishna\.s, manjunath\.s, rohit\.pahan\}@rakuten\.com
###### 摘要
本文提出了一个基于 CrewAI\[1 (https://arxiv.org/html/2608.18740#bib.bib1)\]构建的多智能体框架,用于会话式商业智能。五个专用 AI 智能体在顺序流水线中运行,以处理自然语言查询、检索和分析数据、通过模型上下文协议 \(MCP\)\[2 (https://arxiv.org/html/2608.18740#bib.bib2)\]生成可视化,并提供可操作的洞察。该平台具有纵深防御安全架构,用于多租户数据隔离,以及查询参数化机制,用于将会话式洞察转化为可复用的仪表板组件。对涵盖合成和生产级企业数据集的 300 个端到端测试用例的评估显示,功能准确率为 95\.3%,平均响应延迟为 24 秒,响应质量评分为 4\.52/5\.0(由 LLM-as-a-Judge 框架评估),无幻觉率为 93\.0%,与单智能体基线相比,准确率提高了 22\.6 个百分点,质量提升了 20\.2%。跨四个 LLM 后端和人工专家验证的评估证实了架构的通用性和评估器的可靠性。一项消融研究证实,数据分析智能体和报告聚合智能体是输出质量的主要驱动因素。
关键词:生成式AI,大语言模型,多智能体系统,模型上下文协议,CrewAI,商业智能,会话式分析
## 1 引言
现代企业在各种异构存储系统中生成海量数据。传统分析方法需要手动编写 SQL 或使用如 Looker Studio 或 Tableau 等复杂的商业智能工具,使得生成可操作的洞察成为一个耗时且劳动密集的过程。
我们提出一个会话式多智能体平台,通过将复杂的用户查询分解为离散步骤(规划、数据检索、分析和洞察聚合)来实现自动化数据交互,每个步骤由具备领域特定工具的专用智能体处理。我们还引入了一个标准化的评估框架,结合自动化功能测试和基于 LLM 的质量评估,以验证多智能体分析解决方案的可靠性。
## 2 文献综述
大语言模型 \(LLMs\) 的最新进展推动了从单一智能体分析工具向能够进行复杂推理和自主任务执行的动态多智能体系统 \(MAS\) 的转变。我们将相关工作分为两个主题领域。
### 2\.1 多智能体系统与会话式商业智能
Yang 等人\[3 (https://arxiv.org/html/2608.18740#bib.bib3)\]将基于 LLM 的多智能体系统架构分为星型、环型、图型和总线型模式,强调了用于协作的标准化协议。Hong 等人\[4 (https://arxiv.org/html/2608.18740#bib.bib4)\]提出了 MetaGPT,将标准化操作流程编码到具有角色区分的智能体提示中,通过结构化的工作流减少幻觉。Zhang 等人\[5 (https://arxiv.org/html/2608.18740#bib.bib5)\]引入了 AgentOrchestra,一个使用工具-环境-智能体 \(TEA\) 协议的层级规划框架,性能优于扁平智能体基线。Becker\[6 (https://arxiv.org/html/2608.18740#bib.bib6)\]通过实证发现,具有专家角色的多智能体系统擅长复杂推理,但在自由对话中存在任务“漂移”的风险,我们的顺序流水线通过强制执行结构化工作流来规避此风险。
对于企业部署,Wang 等人\[7 (https://arxiv.org/html/2608.18740#bib.bib7)\]提出了一个四层框架,通过 RAG 和双层安全架构解决文本到 SQL 的挑战。Jiang 等人\[8 (https://arxiv.org/html/2608.18740#bib.bib8)\]介绍了 SiriusBI,通过在腾讯各业务部门部署的多轮对话精炼,实现了 93–96% 的 SQL 准确率。Ni 等人\[9 (https://arxiv.org/html/2608.18740#bib.bib9)\]通过思维链推理\[10 (https://arxiv.org/html/2608.18740#bib.bib10)\]和用于电力系统领域的 SQL 验证模块,增强了文本到 SQL 的可靠性。
### 2\.2 LLM 驱动的分析与可视化
Zhang 和 Elhamod\[11 (https://arxiv.org/html/2608.18740#bib.bib11)\]提出了一个数据到仪表板框架,使用具有迭代自我反思功能的模块化 LLM 智能体,生成基于领域的洞察和语义上有意义的可视化。Bai 等人\[12 (https://arxiv.org/html/2608.18740#bib.bib12)\]详细介绍了 Insight Agents,这是一个用于电子商务的已部署层级管理器-工作者系统,通过结合强大 LLM 和轻量级路由模型的混合方法,在准确性和低延迟要求之间取得平衡。
在可视化方面,Wang 等人\[13 (https://arxiv.org/html/2608.18740#bib.bib13)\]介绍了 LLM4Vis,一个基于 ChatGPT 的图表推荐系统,通过上下文学习匹配或超越传统机器学习推荐器。Goswami 等人\[14 (https://arxiv.org/html/2608.18740#bib.bib14)\]介绍了 PlotGen,通过具有多模态反馈循环的多智能体协作实现科学绘图自动化,用于迭代优化。我们的系统超越了推荐,实现了完整的图表生成,此外还管理数据访问、查询参数化和多租户安全。
## 3 系统架构
### 3\.1 架构概述
我们的平台实现了一个分层微服务架构,包含五个层级(图1 (https://arxiv.org/html/2608.18740#S3.F1)):用于会话交互的 UI 层;处理数据源管理、用户会话和查询路由的 API 层;由 CrewAI\[1 (https://arxiv.org/html/2608.18740#bib.bib1)\]驱动,用于多智能体编排的智能体层;提供对象存储、元数据存储、数据仓库连接和缓存的数据层;以及通过 Antvis/mcp\-server\-chart 集成实现可视化的 MCP 层\[2 (https://arxiv.org/html/2608.18740#bib.bib2)\]。
参见标题图 1:高级系统架构
### 3\.2 智能体团队组成
系统的核心是一个由五个智能体组成的顺序团队:
- • 数据检索智能体:将自然语言查询映射到数据源,生成具有模式感知能力的可执行 SQL,并对授权表强制执行只读访问。
- • 数据分析智能体:解释查询结果以识别模式、趋势和异常;根据数据特征通过 MCP 生成图表。
- • 报告聚合智能体:将先前的输出综合成连贯的 Markdown 响应,并进行语言检测和翻译以支持多语言部署。
- • 后续问题智能体:以会话语言生成上下文相关的后续建议,以引导更深入的探索。
- • 图表配置智能体:为交互式 UI 渲染生成可视化元数据(图表类型、轴映射、标签)。
### 3\.3 查询参数化
一个显著特点是查询参数化功能,它将临时分析查询转换为可复用的、仪表板就绪的组件。系统从 WHERE 子句中提取字面值到参数化过滤器,利用模式内省(分区列、聚类字段)进行智能化的参数化决策,对昂贵查询执行空运行成本估算并提供物化建议,并从 SELECT 和 GROUP BY 列中生成用于交互式过滤的下钻维度。
### 3\.4 模型上下文协议集成
该平台通过服务器适配器模式利用 MCP\[2 (https://arxiv.org/html/2608.18740#bib.bib2)\],其中 MCP 服务器作为独立微服务运行,公开图表生成工具(柱状图、折线图、饼图、散点图、漏斗图、树状图、桑基图等)。智能体在运行时发现可用的工具和模式,从而实现动态能力扩展。可视化工具生成图表并直接返回云存储 URL,简化了资产管线。
## 4 方法论
### 4\.1 架构范式选择
我们考虑了三种候选架构。单一智能体的单体方法会因模型同时优化相互竞争的目标而导致认知过载和错误隔离性差\[6 (https://arxiv.org/html/2608.18740#bib.bib6)\]。层级管理器-工作者架构\[12 (https://arxiv.org/html/2608.18740#bib.bib12)\]引入了不可预测性和通信开销。我们采用了顺序多智能体流水线,其中专用智能体按预定义顺序执行,这基于关注点分离、可预测的执行流程、独立的可测试性和优雅降级。
### 4\.2 智能体协调
该框架采用 CrewAI 的\[1 (https://arxiv.org/html/2608.18740#bib.bib1)\]顺序处理模式。执行过程包括:(1)初始化,包括输入验证和凭据验证;(2)数据检索,包括 SQL 生成和执行;(3)数据分析,包括模式提取和通过 MCP 生成图表;(4)报告聚合,包括语言翻译;(5)后续问题生成;(6)图表配置;以及(7)后处理,恢复缓存的查询结果并组装最终响应。图2 (https://arxiv.org/html/2608.18740#S4.F2)展示了此流程。
初始化和验证 -> 数据检索智能体 -> 数据分析智能体(通过 MCP) -> 报告聚合智能体 -> 后续问题智能体 -> 图表配置智能体 -> 后处理和组装
净化后的查询、模式、上下文 -> SQL 查询 + 缓存结果集 -> 模式、洞察、图表对象 -> 格式化的 Markdown 报告 -> 上下文相关的后续建议 -> UI 可视化元数据
用户自然语言查询 -> 结构化分析响应
图 2:顺序流水线执行流程。每个智能体通过上下文注入接收前序智能体的累积输出。虚线框代表非智能体处理阶段;实线框代表自主 LLM 智能体阶段。
### 4\.3 安全架构
我们实施纵深防御策略,包含四层:(1)输入验证,针对 SQL 注入模式进行查询净化并设置长度限制;(2)查询防护栏,阻止不安全操作(DROP、DELETE、INSERT、ALTER、CREATE、TRUNCATE)并强制执行表级访问控制;(3)多租户隔离,通过服务帐户模拟和特定于租户的凭据实现;(4)输出验证,包含敏感数据扫描和错误消息净化。
### 4\.4 提示工程
智能体提示通过迭代精炼开发:定义角色/目标,集成防护栏和防幻觉规则,处理边缘情况,以及指定语言/格式。
## 5 评估
我们从功能准确性、响应延迟和输出质量三个维度评估平台,使用 300 个测试用例,通过自动化功能测试、LLM-as-a-Judge 质量框架和人工专家验证进行评估。
### 5\.1 实验设置
#### 5\.1\.1 测试数据集和套件设计
评估在 Google BigQuery 上使用了两个互补的数据集。第一个是合成的电子商务数据集,包含四个关系表(customers、orders、order\_items、products),跨四个区域和五个产品类别共计 12,500 条记录。第二个是生产级的竞争性定价情报数据集,包含四个关系表,跨越两个电子商务平台:两个商品目录表,覆盖约 569,000 个重叠产品,属性包括标题、多级类别分类、品牌元数据和高达 68 列的定价信息;以及两个价格历史表,包含约 1\.17 万条不同的价格记录,捕获了总计 88 亿条观察中的时序定价动态。该企业数据集包含日语产品内容,引入了合成数据中不存在的多语言复杂性。
我们设计了 300 个测试用例,涵盖八个类别:简单聚合(65)、带过滤的聚合(35)、时间序列分析(40)、多表连接(35)、复杂分析(30)、边缘情况(30)、多轮对话(25)和安全防护栏(40)。每个分析测试用例都验证 SQL 生成、执行正确性、结果检索和结构化洞察的存在。在 260 个分析测试用例中,有 100 个由人工领域专家独立评分。
#### 5\.1\.2 LLM-as-a-Judge 方法论
我们采用 LLM-as-a-Judge 框架\[15 (https://arxiv.org/html/2608.18740#bib.bib15)\],使用 Claude Sonnet 4\.5 作为评估器。每个分析响应都根据五个维度(1–5 李克特量表)进行评估:事实准确性、相关性、完整性、可操作性和语言质量。评估器还通过将事实性声明与原始查询结果进行交叉引用,执行幻觉检测。为减轻评估器偏差,我们使用具有明确每维度评分标准的结构化评分表,并要求每个事实准确性评估都基于原始数据。
#### 5\.1\.3 基线、消融和跨模型配置
单智能体基线使用相同的 GPT-4\.1 模型和 BigQuery 工具,但将所有职责整合到单个提示中,省略了基于正则表达式的输入验证层。我们进行消融研究,有选择地移除单个智能体以量化其边际贡献。为评估架构通用性,我们在四个 LLM 后端上复制了完整的 300 项测试评估:GPT-4\.1、Claude Sonnet 4、Gemini 2\.5 Flash 和 Llama 3\.1 70B(自托管)。三位领域专家使用相同的五维度评分表,独立对 100 个随机抽样的分析响应进行评分,以验证 LLM-as-a-Judge 方法论与人工评估的一致性。
### 5\.2 结果
#### 5\.2\.1 端到端功能准确性
系统达到 95\.3% 的准确率(286/300 个测试),包括阻止所有 40 个对抗性输入(表1 (https://arxiv.org/html/2608.18740#S5.T1))。失败集中在复杂分析(在企业模式上产生语义不正确 SQL 的深度嵌套 CTE)和多轮对话(涉及大型结果集的跨轮次比较超出推理窗口)。
表 1:按类别分的端到端功能准确性
#### 5\.2\.2 延迟分析
整体平均延迟为 23\.8 秒,符合 120 秒的处理目标(表2 (https://arxiv.org/html/2608.18740#S5.T2))。复杂分析查询平均耗时 38\.6 秒,因为涉及企业模式上的窗口函数和 CTE,而多轮查询通过利用先前上下文表现出较低延迟(平均 16\.2 秒)。
表 2:按查询类别分的端到端延迟(秒)
#### 5\.2\.3 安全防护栏评估
所有 40 个对抗性攻击向量均被拦截(表3 (https://arxiv.org/html/2608.18740#S5.T3)),包括另外 34 个针对企业模式的向量。输入验证层以亚毫秒级响应处理已知的有害模式,而 LLM 防护栏层则捕获那些仅靠语法模式无法识别的复杂攻击。相似文章
通过数据到洞察发现代理迈向自主商业智能
本文介绍了 AIDA,这是一个自主代理框架,旨在通过利用强化学习和专有的领域特定语言来执行 SQL,将碎片化的企业数据转化为可操作的商业洞察。
实现对话代理的多维度评估:一个可扩展、受管控的管道,具备选择性重新评估与模型基准测试
本文介绍了GenAI Evaluation,一个受管控且配置驱动的管道,用于零售对话代理的可扩展多维度评估。它通过使用LLM作为评判员的评分与选择性重新评估实现了高精度,并经过人工标注数据验证。
多智能体AI如何用于自动化业务
解释了多智能体AI系统如何工作以自动化业务流程,涵盖了使用多个AI代理进行任务编排的架构和优势。
企业智能代理
一项与企业AI代理相关的新产品或更新,可能侧重于自动化和业务工作流程。
面向大规模企业AI的自主事件驱动多智能体编排
本文评估了多智能体编排架构(DAG Plan and Execute、ReAct)在企业规模下的表现,并引入了一个任务管理器以实现持续的事件驱动操作,展示了在延迟和正确性方面的改进。