SAFAARI:面向加速广告主响应智能的架构感知框架
摘要
本文提出了SAFAARI,一个多智能体框架,用于改善客户支持领域自然语言到SQL系统中的模式链接能力,取得了81.66%的SEAL分数,并将开发时间降低了8倍。
arXiv:2607.25042v1 公告类型:新论文
摘要:客户支持系统的进化正在随着智能聊天机器人快速发展,但这些系统在访问企业数据时面临显著限制,尤其是在没有预定义API端点的情况下。本文提出了SAFAARI(Schema-Aware Framework for Accelerated Advertiser Response Intelligence),一个多智能体框架,通过专门的内容、元数据和编排智能体,解决了自然语言到SQL(NL-to-SQL)系统中模式链接的关键瓶颈。我们还引入了SEAL(Schema Evaluation and Accuracy in Language-to-SQL),一种新颖的组合指标,在惩罚不一致结果的同时整体评估系统性能。通过使用五种特征配置的系统实验,SAFAARI达到了81.66%的SEAL分数(比基线提高了6.65%),在数据点准确性(提高5.51%)和模式链接精度(提高4.69%)方面取得了显著提升。该框架的有效性通过领域专家的人工参与评估得到验证,证明了其在不同支持领域的适应性。通过自动化劳动密集型的模式链接和查询生成过程,我们的框架在保持高准确性的同时,将开发时间减少了8倍。该解决方案简化了API开发并增强了自助服务能力,尤其有利于拥有复杂数据生态系统的客户支持企业。
查看缓存全文
缓存时间: 2026/07/29 09:53
# 面向加速广告主响应智能的Schema感知框架
来源:https://arxiv.org/html/2607.25042
###### 摘要
客户支持系统正随着智能聊天机器人的发展而快速演进,但这些系统在访问企业数据时面临显著限制——尤其当缺乏预定义API端点时。本文提出SAFAARI(面向加速广告主响应智能的Schema感知框架),这是一个多智能体框架,通过专门的内容、元数据和编排智能体,解决了自然语言转SQL(NL-to-SQL)系统中Schema链接这一关键瓶颈。我们还引入了SEAL(语言转SQL中的Schema评估与准确性),这是一个新颖的复合指标,能够全面评估系统性能,同时对不一致结果进行惩罚。通过五组特征配置的系统实验,SAFAARI取得了81.66%的SEAL分数(相比基线提升6.65%),在数据点准确性(5.51%)和Schema链接精确度(4.69%)方面均有显著提升。该框架的有效性通过领域专家参与的人机协同评估得到了验证,证明了其在不同支持领域的适应性。通过自动化Schema链接和查询生成这一劳动密集型过程,我们的框架在保持高准确性的同时,将开发时间减少了8倍。该解决方案简化了API开发,增强了自助服务能力,尤其有益于具有复杂数据生态的客户支持企业。
智能体AI、多智能体框架、大语言模型、文本转SQL、Schema链接、自定义评估、评估指标、虚拟助手、客户支持
## 1 引言
智能聊天机器人依赖三个核心组件:知识库、编排层和函数调用。然而,维护工具调用的API在多样化的领域(如广告)中面临重大挑战。NL-to-SQL系统通过无需预定API端点即可实现动态数据库访问,提供了一种解决方案。该方法包含三个关键过程:数据点识别、Schema链接和SQL生成。Schema链接将自然语言与数据库结构连接起来,由于人类查询与数据库术语之间的差距,这构成了关键挑战。我们的研究引入了先进的Schema链接技术,解决了当前系统中的根本性局限。
近期研究指出了Schema链接中几个需要改进的关键领域。对SPIDER和BIRD等著名基准的误差分析显示,Schema链接错误占所有错误的29%-49%,显著高于其他类别,如连接操作(21%-26%)和嵌套查询(低于20%)(Shi等人,2024 (https://arxiv.org/html/2607.25042#bib.bib1))。这一统计证据强调了Schema链接方法论创新的紧迫性。本文介绍了我们在推动文本转SQL系统中Schema链接方面的贡献,特别关注解决复杂Schema和基准不足的挑战。我们的工作旨在弥合学术研究与实际应用之间的差距,为在智能聊天机器人中实现NL-to-SQL能力提供更健壮、更高效的解决方案。通过聚焦Schema链接创新,我们力求提升文本转SQL系统的整体性能和可靠性,最终改善智能聊天机器人在实际应用中处理复杂数据库查询的能力。
## 2 相关工作
文本转SQL系统的演进可分为三个主要阶段。最初,基于规则和模板的方法主导了该领域(Zelle and Mooney,1996 (https://arxiv.org/html/2607.25042#bib.bib11))。随后,深度学习方法兴起,序列到序列模型成为主流解决方案,自动将自然语言输入映射到SQL输出,而无需语义解析等中间步骤(Shi等人,2024 (https://arxiv.org/html/2607.25042#bib.bib1))。在当前阶段,大语言模型(LLM)极大地改变了这一领域,展现出理解复杂自然语言问题并生成准确SQL语句的卓越能力(Zhang等人,2024 (https://arxiv.org/html/2607.25042#bib.bib4))。尽管取得了这些进步,但在处理复杂跨域查询方面仍存在重大挑战,尤其是面对真实世界的数据库Schema(Singh等人,2025 (https://arxiv.org/html/2607.25042#bib.bib5))。
过去的研究表明,Schema链接是文本转SQL系统中的基础组件,负责识别回答自然语言查询所需的数据库Schema的相关部分(Glass等人,2025 (https://arxiv.org/html/2607.25042#bib.bib6))。研究人员已确认,将整个Schema放入LLM的提示中在计算上可能过于昂贵,尤其对于令牌窗口较小的模型;即使技术上可行,这种做法仍然成本高昂且可能损害模型性能(Glass等人,2025 (https://arxiv.org/html/2607.25042#bib.bib6))。一项新颖的方法被引入,用于适配仅解码器的LLM进行Schema链接,该方法在计算效率和准确性上均优于生成式方法。Schema链接的关键作用被强调,指出“初始Schema链接的准确性显著影响后续SQL生成的性能”(Yuan等人,2025 (https://arxiv.org/html/2607.25042#bib.bib9))。此外,研究人员还强调了文本转SQL模型在基准测试与真实世界数据库之间的显著性能差距,特别是对于需要复杂过滤和连接的自然语言问题(Nascimento等人,2025 (https://arxiv.org/html/2607.25042#bib.bib8))。该工作提出了数据库关键词搜索(KwS)作为一种策略,以提升Schema链接的精确度和召回率,展示了将KwS平台的数据字典与动态少样本示例策略相结合如何显著增强Schema链接过程。NL-to-SQL系统的真实世界适用性被进一步强调,以说明自然语言理解如何应用于复杂的客户服务路由问题(Pi等人,2024 (https://arxiv.org/html/2607.25042#bib.bib10))。该工作强调了复杂语言处理系统在实际业务环境中的价值,在这些环境中,理解自然语言输入的复杂性对于适当的任务路由和成功解决至关重要。
与此同时,在探索不同智能体架构以解决Schema链接问题方面也有大量研究。MAC-SQL是一个新颖的基于LLM的多智能体协作框架,旨在解决大型数据库和复杂查询上的性能限制(Wang等人,2025 (https://arxiv.org/html/2607.25042#bib.bib2))。该框架包含一个核心分解智能体,用于通过思维链推理生成SQL,并配有两个辅助智能体,负责获取更小的子数据库并修正错误的SQL查询。这种方法强调了Schema管理在文本转SQL系统中的重要性,其中选择智能体专门将大型数据库分解为更小的子数据库,以减轻不相关信息的干扰。BASE-SQL是一种基于流水线的方法,使用开源模型微调,其第一步是Schema链接,随后是候选SQL生成、SQL修正和SQL合并修正(Sheng等人,2025 (https://arxiv.org/html/2607.25042#bib.bib7))。这种方法代表了解决Schema链接挑战的另一种架构范式,特别关注使用开源模型的成本效益实现,同时仍能达到与使用GPT-4o等闭源模型的方法相竞争的性能。在另一项工作中,提出了KaSLA(基于背包优化的Schema链接智能体),它使用分层链接策略和背包优化来选择最相关的Schema元素,同时最小化冗余(Yuan等人,2025 (https://arxiv.org/html/2607.25042#bib.bib9))。
Schema链接领域的另一个活跃研究领域是当前Schema链接评估指标(精确度和召回率)的显著问题,认为它们未能充分捕捉缺失相关Schema元素的影响。即使缺少一个相关的表或列,也可能大幅降低SQL生成的准确性,同时根据标准指标仍会产生人为的高性能分数。针对基于LLM的文本转SQL系统缺乏系统基准测试的问题,一个全面的测试框架被提出,包含五个不同的任务,以评估LLM在文本转SQL全过程上的能力(Zhang等人,2024 (https://arxiv.org/html/2607.25042#bib.bib4))。在(Yuan等人,2025 (https://arxiv.org/html/2607.25042#bib.bib9))中引入了一种增强的Schema链接指标,旨在准确捕捉缺失相关元素的影响,从而更好地反映实际链接性能及其与SQL生成准确性的对齐。总体而言,Schema链接是文本转SQL流水线中的关键组件,特别是随着数据库和自然语言查询复杂性的不断增加。在这项工作中,我们提出了一种新颖的方法来改进Schema链接,并展示了所提方法在客户支持领域的优越结果。我们将在方法论和实验部分详细讨论这一点。随着文本转SQL系统随着更复杂的LLM架构和多智能体框架而持续演进,有效的Schema链接的重要性很可能仍将是实现真实数据库环境中稳健性能的核心。
## 3 数据集
本研究使用了两个数据源:以聊天记录形式存在的广告主-客服人员对话数据,以及客服人员用于排查问题的标准操作程序(SOP)指南。这些SOP对所有客服人员开放,他们接受全面培训以确保有效利用。此外,我们还使用了面向广告主的自助服务指南,其中包含丰富的教育性和故障排除步骤,旨在供广告主直接使用。最后,为了增强智能体的Schema链接能力,我们纳入了从现有分析管道中提取的领域特定SQL查询。
所有数据在分析前都经过了彻底的预处理,以去除敏感信息,包括个人标识符、账户详情,并严格遵守隐私要求。虽然上述数据集来自亚马逊的专有数据库,但其结构遵循行业标准格式,与大多数公司维护的客户服务数据类似。因此,本文描述的方法可以很容易地适用于任何客户支持组织。
## 4 方法论
### 4.1 系统架构概述
我们方法的基础是一种新颖的多智能体架构,旨在克服客户支持系统中的根本限制。这种专门的职责划分消除了传统的手动数据源识别瓶颈,实现了企业级的自动化Schema链接。我们的多智能体架构包含以下三个智能体,详述如下:
- •内容智能体:从非结构化文档中提取结构化数据需求,包括支持记录、SOP和面向广告主的帮助内容。
- •元数据智能体:使用增强型知识库,维护对企业数据库结构、关系和使用模式的全面理解。
- •编排智能体:综合来自两个智能体的输入,生成动态Schema映射、SQL查询,并协调上述辅助智能体之间的工作流程。
### 4.2 数据点发现
如图1中数据点发现模块所示,我们采用了双管齐下的方法进行数据点识别。首先,我们使用了20,000份对话记录,并提示LLM(Claude Sonnet 3.5 V2)识别客服人员为解决广告主问题而查询的数据点。需要注意的是,在生产客户服务环境中,客服人员通常可以访问提供客户上下文的其他平台信号,而不仅仅依赖直接客户交互。考虑到记录数据中的这一限制,其次,我们实现了一个基于智能体的解决方案,将SOP和面向广告主的帮助文档作为知识库,并让智能体回答5000个分层抽样案例中广告主的初始问题。最后,我们合并了上述方法的结果,并保留了至少在1%案例中出现的数据点。该方法产生了一个包含数据点及其对应频率分布的全面词典。该方法的数学符号表示如下公式:
D_T = F_{LLM}(T_{conv}, P_{id}) (1)
D_A = F_{Agent}(Q_{init}, K_{SOP}, K_{help}) (2)
f_T^{norm}(d) = f_T(d) / |T_{conv}| (3)
f_A^{norm}(d) = f_A(d) / |Q_{init}| (4)
D_F = { d ∈ (D_T ∪ D_A) | f_T^{norm}(d) ≥ 0.01 ∧ f_A^{norm}(d) ≥ 0.01 } (5)
其中,D_T、D_A分别是来自记录和SOP分析的数据点;T_{conv}代表20,000份对话记录;Q_{init}包含5000个初始问题;K_{SOP}、K_{help}是知识库;P_{id}是用于数据点识别的提示;F_{LLM}和F_{Agent}分别是LLM和智能体执行的功能;f_T(d)和f_A(d)是原始频率计数;d代表单个数据点。

图1:系统架构与方法论
### 4.3 动态Schema链接
#### 4.3.1 列描述
仅凭列名和列数据类型不足以在Schema链接中获得高准确性。特别是在企业系统中,不同的表由不同团队拥有,列名和描述的标准化做法并不常见。用户模糊的自然语言查询进一步增加了复杂性。为每个元数据提供列描述显著有助于Schema链接。我们通过实现一个智能体来解决这一挑战,该智能体配备了内部数据湖文档的综合知识库。这些元数据文章通常来自各个数据湖团队,其文档的完整程度往往不一。通过将这些文章与第4.2节讨论的数据点集合合并,建立了一个全面的知识库。这种丰富的上下文使智能体能够生成更准确、更完整的详细列描述。
#### 4.3.2 高层Schema映射
在这一步骤中,相似文章
Schema(2分钟阅读)
Schema是一个框架,使前沿AI模型能够通过编写可执行程序来建模游戏环境、测试预测和规划,从而在ARC-AGI-3基准测试中达到99%的准确率。
ASMR:面向船舶维修报告编写的智能模式生成
本文提出了ASMR,一种智能框架,包含字段生成智能体和结构优化智能体,利用强化学习从历史船舶维修报告中自动生成紧凑且信息丰富的模式,旨在提高报告的完整性和一致性。
SchemaRAG: 面向LLM驱动的结构化信息提取的动态大规模模式简化
SchemaRAG是一个检索增强生成框架,能够动态缩减面向LLM驱动的结构化信息提取的输出模式空间,在医疗健康和电子商务数据集上实现了性能提升和效率优化。
在SAFi中构建和管理AI代理
作者介绍了SAFi,这是一个用于AI代理的开源运行时治理引擎,详细说明了其内存系统(伦理记忆、对话记忆、个人资料记忆、项目记忆)以及实际用例,例如由DeepSeek V4驱动的工作助手。
SAAG:结构化智能体评估与基础验证
SAAG提出了一种级联诊断框架,用于评估LLM智能体函数调用,通过将评估分解为注册一致性、结构完整性和参数基础验证三个阶段,实现可解释的诊断和迭代自我修复。在sub-4B模型上的实验表明,与单次评估相比,参数精度得到提升,值幻觉减少。