DualSQL:基于多智能体强化学习的文本到SQL技术
摘要
DualSQL 提出了一种用于文本到SQL的多智能体强化学习框架,利用单一共享模型联合优化模式链接和SQL生成,以更小的模型大小实现了最先进的准确性。
arXiv:2609.18135v1 公告类型:新
摘要:最先进的文本到SQL系统通常是围绕两个核心任务的多智能体流水线:模式链接和SQL生成。然而,现有工作为每个任务单独训练模型,未能充分利用这些相互关联任务间的协同效应。在本研究中,我们提出了DualSQL,一个由单一模型主干驱动的新型文本到SQL系统,包含两个智能体。智能体共享相同的模型权重和代理框架,通过稳健的多智能体强化学习(RL)框架实现联合优化。我们设计了三个数据库访问工具,以促进与数据库交互的有效多步推理。为改善训练并避免模型崩溃,我们引入了一系列滚动护栏机制来稳定多智能体RL训练,支持DualSQL在训练过程中持续提升性能。我们还提出了一个新的SQL正确性度量标准——稳健执行匹配(REX),以更准确地评估SQL正确性并分配奖励信号。仅在3755个示例上训练后,DualSQL-4B在BIRD开发集上取得了68.0%的执行准确率,与之前的7B模型相当。DualSQL-8B进一步提升至71.1%,超越了先前具有32B参数的最先进单模型解决方案。这些结果展示了联合多智能体强化学习在构建高性能文本到SQL流水线方面的强大能力。
查看缓存全文
缓存时间: 2026/09/17 09:08
# DualSQL:基于多智能体强化学习的文本转SQL系统 来源:https://arxiv.org/html/2609.18135 陈世杰††感谢:工作于陈世杰在谷歌实习期间完成。甘宇 隶属:谷歌有限责任公司 邮箱:[[email protected]](mailto:) 钟延旿 隶属:谷歌有限责任公司 张佳妮 隶属:谷歌有限责任公司 李全楠 隶属:谷歌有限责任公司 斯拉文·博达帕蒂 隶属:谷歌有限责任公司 科迪·格里尔 隶属:谷歌有限责任公司 苏宇 隶属:俄亥俄州立大学 法特玛·奥兹坎 隶属:谷歌有限责任公司 邮箱:[[email protected]](mailto:) ###### 摘要 最先进的文本转SQL系统通常是围绕两个核心任务构建的多智能体流水线:模式链接和SQL生成。然而,现有工作为每个任务训练独立模型,未能利用这些相互关联任务之间的协同效应。在此工作中,我们提出了**DualSQL**,一个由单一模型骨干驱动的双智能体文本转SQL系统。这两个智能体共享相同的模型权重和智能体框架,使得通过一个稳健的多智能体强化学习框架进行联合优化成为可能。我们设计了三种数据库访问工具,以促进基于数据库交互的有效多步推理。为改善训练并避免模型崩溃,我们引入了一套rollout护栏机制,以稳定多智能体强化学习训练,使**DualSQL**在训练过程中能持续改进。我们还引入了一个新的SQL正确性指标——稳健执行匹配,以更准确地判断SQL正确性并分配奖励信号。仅使用3755个样本进行训练,**DualSQL-4B**在BIRD开发集上达到了令人印象深刻的68.0%执行准确率,与之前的7B模型相当。**DualSQL-8B**进一步提升至71.1%,超越了之前具有320亿参数的最先进单模型解决方案。这些结果展示了联合多智能体强化学习在构建高性能文本转SQL流水线方面的强大能力。 ## 1 引言 文本转SQL是通过自然语言接口使非专家用户能够访问数据分析的关键技术(Li等,2024a;Luo等,2025)。然而,由于若干挑战,这项任务尤为困难。首先,由于长上下文中推理能力会显著下降(Du等,2025;Chung等,2025a;Ling等,2025)以及高昂的预填充成本,将大型数据库的整个模式和采样数据注入语言模型的上下文窗口是极其不切实际的。其次,SQL查询必须强烈基于数据库上下文,这需要精确的模式链接来识别相关表和列,导航复杂的模式关系以制定正确的连接,并全面理解数据库内容以选择准确的字面量(Zhang等,2025a;Su等,2024)。第三,文本转SQL任务固有的语义复杂性使得准确映射用户意图到有效的SQL变得复杂。这种复杂性源于模糊自然语言与严格SQL逻辑之间的语义鸿沟、领域知识的需求以及模式本身的歧义性。 最先进的基于LLM的系统通过围绕模式链接和SQL生成的模块化设计来应对这些挑战(Liu等,2025c;Pourreza和Rafiei,2023;Pourreza等,2025a)。在每个阶段中,已经探索了各种方法,包括监督微调(Li等,2025)、上下文学习(Talaei等,2024;Pourreza等,2025a)以及基于执行反馈的强化学习(Pourreza等,2025b;Yao等,2025)。然而,这些方法分别优化两个阶段,指出了端到端流水线联合优化的一个关键空白。我们认为,尽管任务表述不同,模式链接和SQL生成共享两个核心能力:对复杂关系模式的语义检索以及基于数据库上下文的推理。因此,与其构建独立的模型,不如将这些任务视为一个能够在数据库上操作、学习共享知识表示并转移推理技能的统一智能体的双重方面。 在此工作中,我们提出了**DualSQL**,一个将模式链接和SQL生成整合到一个统一智能体流水线的文本转SQL框架,由一个参数共享的开源LLM驱动。受人类数据库开发者迭代工作流的启发,我们为**DualSQL**配备了三种数据库访问工具:元数据剖析、全文搜索和SQL执行。**DualSQL**不依赖于僵化的预定义工作流,而是学习自主地与数据库交互,通过工具使用反馈动态验证和修正其推理。整个系统使用多智能体强化学习框架进行联合训练,并由一个异步rollout系统支持,该系统解耦了阶段之间的同步。我们发现,标准的稳定化技术,如重要性采样校正(Li,2025;Liu等,2025a;Zheng等,2025a),不足以防止我们在多智能体、多轮工具使用环境中的结构性退化。因此,我们引入了一套智能体rollout护栏,包括带有rollout截断的严格格式检查和错误聚焦的损失掩码。此外,为了提供比标准执行准确率(EX)更清晰的奖励信号——EX对良性的格式变化过于敏感,对重复项不敏感——我们引入了稳健执行匹配。REX可以确定性地计算以高效评估精确的执行等价性,防止在训练过程中强化假阳性。通过将这种稳定的智能体强化学习框架与统一的多智能体表述相结合,**DualSQL**证明了开源模型无需依赖海量参数或多模型集成即可实现强大的文本转SQL能力。在具有挑战性的BIRD基准测试上,**DualSQL-4B**取得了有竞争力的68.0% EX,而**DualSQL-8B**则以71.1% EX为单模型解决方案树立了新的最先进水平,堪比使用320亿参数的系统。 总结而言,我们的主要贡献是: - • 我们引入了一个由共享LLM骨干和三种数据库访问工具驱动的多智能体文本转SQL框架。 - • 我们引入了全面的智能体rollout护栏,成功稳定了多智能体强化学习训练,并引入了稳健执行匹配,提供了更准确的SQL评估。 - • 我们证明了联合多智能体优化显著提升了单模型流水线的性能上限,以小模型规模实现了极具竞争力的性能。 ## 2 相关工作 ### 2.1 基于LLM的文本转SQL 文本转SQL的最新进展已从简单的大语言模型提示工程发展到专门的多智能体系统(Biswal等,2026;Wang等,2025b;Deng等,2025)。最初的努力利用上下文学习来优化专有LLM(如GPT-4)的零样本和少样本性能(Gao等,2023;Pourreza和Rafiei,2023;Chung等,2025b)。随后的上下文工程策略(Chung等,2025b;Shkapenyuk等,2025)强调了通过增强元数据进行模式链接对于准确SQL生成的关键性。与依赖被动上下文工程的ICL方法不同,**DualSQL**学习使用工具进行迭代模式链接。为了处理查询复杂性,该领域转向多智能体协作(Wang等,2025a;Pourreza等,2025a)以进行任务分解和利用外部工具。为了减少API依赖并提高成本效益,出现了监督微调方法(Ma等,2025a),利用大规模合成数据集将开源模型与文本转SQL任务对齐(Li等,2024b;Li等,2025)。这一范式通过整合强化学习与执行反馈来优化推理链,并弥合与更大模型的性能差距,从而得到进一步完善(Ma等,2025b;Yao等,2025;Zhang等,2025c)。尽管最新的解决方案综合了智能体分解和强化学习(Liu等,2025b;Xu等,2025b;Yang等,2025b),但它们分别优化不同阶段的智能体,忽略了它们之间的协同效应。**DualSQL**通过(1)引入稳健执行匹配指标用于精确SQL正确性评估,(2)提供全面的数据库操作工具集,以及(3)建立一个稳健的多智能体强化学习框架用于文本转SQL流水线的联合优化,与现有工作区分开来。 ### 2.2 基于可验证奖励的强化学习 基于可验证奖励的强化学习已成为在数学(Shao等,2024)和编码(Guo等,2025)等具有可验证结果的领域中增强LLM推理的基石。为解决固有的训练不稳定性,最近的研究引入了从解耦裁剪和动态采样(Yu等,2025)到基于方差的rollout降采样(Xu等,2025a)的优化技术。在多轮智能体场景中,提出了基于熵的自适应分支(Dong等,2025)和空轮过滤(Xue等,2025)等方法来缓解分布偏移,而其他研究则探讨了高熵token的作用(Wang等,2025c)、推理能力与采样效率的边界,以及自主智能体的课程学习(Nguyen等,2025;Zheng等,2025b)。复杂且嘈杂的数据库环境对文本转SQL系统的智能体强化学习稳定性提出了新挑战。我们的工作贡献了一个高效的rollout实现和一套智能体rollout护栏,它们有效提升了多智能体强化学习的效率和稳定性,通过延长探索实现更好的性能。 参见说明 图1:**DualSQL**的多智能体训练框架。*sls*和*sql*分别表示模式链接和SQL生成任务。两个智能体由相同的LLM和工具驱动。 ## 3 DualSQL智能体系统 本节介绍**DualSQL**的智能体系统。我们为文本转SQL系统中的子智能体——模式链接器和SQL生成器——引入了一种统一的智能体表述。每个智能体都由相同的骨干LLM驱动,并配备了一组数据库访问工具,通过多轮交互来理解数据库上下文并对问题进行推理。 ### 3.1 数据库访问工具 受人类数据库开发者迭代工作流的启发,我们为智能体配备了三种数据库访问工具。实现细节,包括工具输出的JSON序列化和异步工具托管,见附录A。 **SQL执行器**。智能体与数据库之间的主要接口。智能体使用它来(i)获取执行反馈以验证语法和语义正确性,(ii)进行实体落地以检查字面量表示,以及(iii)通过`sqlite_master`或`PRAGMA`进行临时模式探索。内容感知的截断策略将标准检索保留在上下文限制内,同时保留完整的模式-查询响应。 **全文搜索**。为了将用户查询中的模糊或缩写提及桥接到字面数据库内容,该工具使用SQLite FTS5倒排索引对模式名称和单元格值进行模糊匹配。它返回匹配的模式元素以及每列最多五个匹配值。 **数据库剖析器**。此工具检索离线准备的数据库元数据。对于每个表和列,我们使用LLM生成总结语义意图的描述,并推断可能遗漏于DDL的外键关系。我们还预先计算列级统计信息(不同计数、类型、空值比率)。将此分析卸载到离线,使智能体在运行时能够专注于查询逻辑。 ### 3.2 DualSQL智能体 **DualSQL**具有一个多智能体流水线,由两个智能体组成,两者都由相同的骨干LLM驱动,并可以通过第3.1节介绍的工具与数据库进行多轮交互: **模式链接器**:给定自然语言问题*Q*和完整数据库模式*S={T,C}*,其中*T*和*C*是表和列的集合,模式链接器识别相关的数据库模式*S'⊆S*,以减少大型数据库中的干扰,并确保后续SQL生成器在聚焦的上下文窗口内操作。 **SQL生成器**:SQL生成器基于问题*Q*和链接的模式*S'*生成SQL查询*y'*。通过将模式链接和SQL生成建模为一个联合随机过程,我们鼓励生成的SQL基于正确的模式元素,从而减少无关表模式引起的幻觉。尽管简单,但这种统一设计被证明是有效的,并允许我们使用多智能体强化学习框架联合优化整个流水线。 ## 4 用于优化文本转SQL流水线的多智能体强化学习框架 统一的智能体设计使得通过训练单个LLM来联合优化两个智能体成为可能。在本节中,我们将介绍我们的多智能体强化学习方案,包括异步rollout系统、rollout护栏、奖励设计和训练目标。 ### 4.1 异步rollout系统 考虑到上述文本转SQL流水线的依赖结构以及智能体轨迹...
相似文章
SERL-SQL:面向Text-to-SQL强化智能体学习的选择性事后蒸馏
SERL-SQL提出了一种面向多轮Text-to-SQL智能体的选择性执行反馈强化学习框架,利用教师-学生似然差距对SQL动作token上的GRPO优势进行重新加权。该方法在BIRD和Spider基准上取得了强劲的结果。
学习检索:面向文本到SQL智能体的双层长期记忆
本文提出了MERIT,一种面向交互式文本到SQL智能体的动态多时域记忆检索框架,它使用情节级别和回合级别的记忆,并通过强化学习以及用于密集奖励的过程奖励模型优化的学习检索策略。在BIRD-Interact和Spider2-Snow上的实验表明,MERIT在成功率上优于静态和单时域动态基线,同时需要更少的交互轮次。
Progress-SQL:通过渐进式奖励改进文本到SQL的强化学习
Progress-SQL 提出了一种多轮强化学习框架,采用渐进式奖励用于文本到SQL,利用 Oracle 引导的诊断树提供密集的奖励信号,并在 BIRD 和 Spider 等基准上改进 SQL 查询生成。
SQuaD-SQL: 利用LLM引导的知识蒸馏实现小型语言模型的高效文本到SQL
SQuaD-SQL使用LLM引导的知识蒸馏训练小型语言模型进行Text-to-SQL,在WikiSQL上达到86.9%的执行准确率,同时提供更快的推理速度和更低的内存占用。
AgentNLQ:一种通用的自然语言到SQL代理
本文介绍了AgentNLQ,一个用于自然语言到SQL转换的多代理系统,通过模式增强和自校正编排器在BIRD基准测试上达到了78.1%的语义准确率。