SERL-SQL:面向Text-to-SQL强化智能体学习的选择性事后蒸馏

arXiv cs.CL 论文

摘要

SERL-SQL提出了一种面向多轮Text-to-SQL智能体的选择性执行反馈强化学习框架,利用教师-学生似然差距对SQL动作token上的GRPO优势进行重新加权。该方法在BIRD和Spider基准上取得了强劲的结果。

arXiv:2608.00485v1 公告类型:新 摘要:近年来的Text-to-SQL系统越来越依赖多轮交互、执行反馈和强化学习。然而,大多数现有方法仅将执行正确性作为轨迹级奖励,这对识别决定成功或失败的SQL操作提供的指导有限。我们提出了SERL-SQL,一种面向多轮Text-to-SQL智能体的选择性执行反馈强化学习框架。SERL-SQL采样on-policy SQL交互轨迹,并使用仅用于训练的教师模型结合执行反馈重新评分学生动作。由此产生的教师-学生似然差距被转换为有界、掩码权重,仅在SQL和工具动作token上对GRPO优势进行重新加权。这样,任务奖励保持优化方向,同时执行事后反馈提供了局部信用分配。在BIRD、Spider和跨领域基准上的实验表明,SERL-SQL取得了有竞争力的性能,在BIRD-Dev上达到76.56%的执行准确率,在Spider-Test上达到89.92%。此外,我们基于奖励的选择策略接近oracle Best-of-N上界,并且始终优于基于一致性的选择,表明SERL-SQL生成的高质量候选可以通过轻量级执行奖励可靠识别。我们的代码将在 https://github.com/Ffunkytao/SERL-SQL 发布。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:42

# SERL-SQL:面向文本到SQL强化学习智能体的选择性事后蒸馏

来源:https://arxiv.org/html/2608.00485
Tao Liu,1Tao Feng,1Xiangheng Li,2Jinwang Song,3Yifan Li,2Xiaoqing Cheng,2Dixuan Zhang,2Siquan Li,2Lin Lan,2Hongying Zan,2Kunli Zhang,2Chao Wu1\通讯作者

###### 摘要

近期的文本到SQL(Text-to-SQL)系统越来越依赖多轮交互、执行反馈和强化学习。然而,大多数现有方法仅将执行正确性作为轨迹级奖励,这为识别导致成功或失败的SQL决策提供了有限的指导。我们提出了SERL\-SQL,一种面向多轮文本到SQL智能体的选择性执行接地强化学习框架。SERL\-SQL采样在策略SQL交互轨迹,并使用仅训练阶段的教师模型在执行反馈下对学生动作重新评分。由此产生的师生似然差距被转换为有界、掩蔽的权重,仅在SQL和工具动作标记上重新加权GRPO优势。通过这种方式,任务奖励保持了优化方向,而执行事后信息提供了局部化的信用分配。在BIRD、Spider和跨领域基准上的实验表明,SERL\-SQL取得了具有竞争力的性能,在BIRD\-Dev上达到76.56%的执行准确率,在Spider\-Test上达到89.92%。此外,我们基于奖励的选择策略接近oracle Best\-of\-N上界,并始终优于基于一致性的选择,表明SERL\-SQL生成了能够被轻量级执行接地奖励可靠识别的高质量候选。

代码——https://github.com/Ffunkytao/SERL\-SQL

## 引言

文本到SQL将自然语言问题转换为可在关系数据库上执行的可执行SQL查询。近年来的文本到SQL研究已逐渐从上下文学习(Wang等人2023(https://arxiv.org/html/2608.00485#bib.bib38);Gao等人2024b(https://arxiv.org/html/2608.00485#bib.bib9);Pourreza和Rafiei2023(https://arxiv.org/html/2608.00485#bib.bib5);Gao等人2024a(https://arxiv.org/html/2608.00485#bib.bib32))生成转向智能体数据库交互。现代SQL智能体(Pourreza等人2024(https://arxiv.org/html/2608.00485#bib.bib17);Talaei等人2024(https://arxiv.org/html/2608.00485#bib.bib6);Li等人2025a(https://arxiv.org/html/2608.00485#bib.bib7))不再直接生成单个查询,而是将过程分解为模式接地、SQL生成、执行、验证、修订和选择,使模型能够在整个推理过程中使用数据库反馈。代表性系统如Agentar\-Scale\-SQL(Wang等人2025(https://arxiv.org/html/2608.00485#bib.bib19))、Arctic\-Text2SQL\-R1(Yao等人2026(https://arxiv.org/html/2608.00485#bib.bib25))和MARS\-SQL(Yang等人2025(https://arxiv.org/html/2608.00485#bib.bib8))进一步展示了扩展智能体交互和强化学习在稳健文本到SQL性能方面的有效性。这些进展表明,现实中的文本到SQL不再仅仅是序列生成问题,而是一个以执行为基础的交互式决策过程。

参见图注图1:SERL\-SQL使用执行事后信息将粗粒度的轨迹级GRPO奖励转换为针对SQL动作标记的选择性、奖励对齐的信用重新加权。现有智能体文本到SQL系统已经探索了几种通过执行感知训练改进SQL生成的方法。基于搜索和渐进式RL方法在策略优化期间改进候选探索或奖励塑形(Ma等人2025(https://arxiv.org/html/2608.00485#bib.bib21);Zhang等人2026(https://arxiv.org/html/2608.00485#bib.bib23)),而SQL\-Trail(Hua等人2026(https://arxiv.org/html/2608.00485#bib.bib41))使用交错执行反馈来指导迭代精化和轨迹评估。但它们缺乏与数据库的真实交互,此外许多工作(Guo等人2026(https://arxiv.org/html/2608.00485#bib.bib39);Dai等人2026b(https://arxiv.org/html/2608.00485#bib.bib40);Hua等人2026(https://arxiv.org/html/2608.00485#bib.bib41);Li等人2026b(https://arxiv.org/html/2608.00485#bib.bib42))利用数据库反馈进行纠正、验证或候选选择。而FineStep(Dai等人2026a(https://arxiv.org/html/2608.00485#bib.bib43))展示了信用分配的重要性,通过为工具集成文本到SQL在步骤级别分配信用来走向更精细的监督。然而,这些粗粒度信号无法定位导致错误的SQL决策,导致信用扩散到决定正确性的可执行动作之外。

我们的关键见解是不仅将执行反馈用作结果奖励,还用作训练时的事后信息以进行选择性信用分配。执行错误、空结果或不正确输出提供了关于哪些SQL决策可能导致失败的特权证据。SERL\-SQL不是将此类信息暴露给部署策略或统一蒸馏,而是使用同步教师模型在事后信息上下文下对学生策略的在策略动作重新评分。由此产生的教师-学生对数概率差距被转换为有界的GRPO重新加权因子(Shao等人2024(https://arxiv.org/html/2608.00485#bib.bib13)),通过选择性动作掩码仅应用于SQL相关和工具动作标记。这样,任务奖励保持优化方向,而执行事后信息控制更新的局部性和强度。在推理时,教师模型被移除,学习到的策略作为独立SQL智能体运行。

我们在BIRD(一个现实的大规模数据库接地文本到SQL基准(Li等人2023(https://arxiv.org/html/2608.00485#bib.bib2)))上评估了SERL\-SQL。我们当前的最佳模型在采样轨迹上通过基于奖励的选择达到76.56%的执行准确率,接近oracle best\-of\-N结果77.84%。这一小差距表明SERL\-SQL学习到的策略的成功轨迹可以通过轻量级执行接地信号识别。总之,我们的贡献如下:

- •我们为文本到SQL制定了执行接地的在策略蒸馏,其中数据库反馈被用作教师侧特权上下文,以对SQL相关和工具动作相关标记产生有界、选择性的优势重新加权。
- •我们在BIRD和Spider上验证了SERL\-SQL,在BIRD\-Dev上达到76.56%的执行准确率,在Spider\-Test上达到89.92%。此外,基于奖励的选择接近oracle Best\-of\-N上界,并优于基于一致性的选择,表明SERL\-SQL生成了可由执行接地奖励识别的高质量候选。

参见图注图2:SERL\-SQL流水线概述。(1)模式接地;(2)具有分层奖励验证的多轮SQL智能体rollout;(3)选择性执行事后信息重新评分;(4)事后信息引导的优势重新加权。

## 预备知识

### 问题定义

给定自然语言问题qq、数据库模式SS以及可选的外部知识ee(Shi等人2025(https://arxiv.org/html/2608.00485#bib.bib47);Liu等人2025(https://arxiv.org/html/2608.00485#bib.bib48)),智能体生成一个可执行SQL查询yy,其结果应与黄金答案匹配。我们将文本到SQL定义为多轮交互过程。在轮次tt,策略观察状态s\_\{t\},产生动作a\_\{t\},并接收数据库观察o\_\{t\}。轨迹定义为

τ=\(s\_\{0\},a\_\{0\},o\_\{0\},\ldots,s\_\{T\},a\_\{T\},o\_\{T\}\)。\(1\)最终SQL提取为y=\mathrm\{Etsql\}\(τ\),并通过执行准确率评估(Hong等人2025(https://arxiv.org/html/2608.00485#bib.bib49))。对于从当前策略π\_\{\theta\}采样的NN条轨迹,环境根据执行正确性返回轨迹级奖励\{R^\{n\}\}\_\{n=1\}^\{N\}。

### 组相对策略优化

GRPO优化一组在策略轨迹,而无需训练额外的价值模型(Shao等人2024(https://arxiv.org/html/2608.00485#bib.bib13))。对于给定输入,设\{\tau^\{n\}\}\_\{n=1\}^\{N\}为从旧策略π\_\{\theta\_\{\mathrm\{old\}\}\}采样的轨迹,奖励为\{R^\{n\}\}\_\{n=1\}^\{N\}。轨迹τ^\{n\}的组相对优势为

A^\{n\}=\frac\{R^\{n\}\-\operatorname\{mean\}\_\{m\}\(R^\{m\}\)\}\{\operatorname\{std\}\_\{m\}\(R^\{m\}\)\+\epsilon\_\{A\}\}。\(2\)在标准轨迹级GRPO中,该奖励派生的优势被分配给轨迹中的每个动作步骤,即A\_\{t\}=A^\{n\}。对于标记y\_\{t,i\},策略比为

r\_\{t,i\}\(\theta\)=\frac\{\pi\_\{\theta\}\(y\_\{t,i\}\mid h\_\{t\},y\_\{t,<i\}\)\}\{\pi\_\{\theta\_\{\mathrm\{old\}\}\}\(y\_\{t,i\}\mid h\_\{t\},y\_\{t,<i\}\)\},\(3\)其中h\_\{t\}表示动作a\_\{t\}之前的交互历史。对于任何标记级优势B\_\{t,i\},我们定义裁剪后的GRPO替代目标为

ℓ\_\{\mathrm\{GRPO\}\}\(\theta;B\_\{t,i\}\)=\min\Big(r\_\{t,i\}\(\theta\)B\_\{t,i\},\operatorname\{clip\}\!\left\(r\_\{t,i\}\(\theta\),1\-\epsilon\_\{p\},1\+\epsilon\_\{p\}\right\)B\_\{t,i\}\Big\)。\(4\)标准GRPO目标为

\mathcal\{L\}\_\{\mathrm\{GRPO\}\}\(\theta\)=\-\mathbb\{E\}\_\{\tau\}\left\[\sum\_\{t,i\}\ell\_\{\mathrm\{GRPO\}\}\(\theta;A\_\{t\}\)\right\]\+\beta\,\mathrm\{KL\}\!\left\(\pi\_\{\theta\}\|\pi\_\{\mathrm\{ref\}\}\right\)。\(5\)尽管该目标提供了稳定的奖励对齐更新方向,但其信用分配仍然粗糙:决定性SQL动作、推理标记和格式标记接收到相同的轨迹级优势。

### 在策略蒸馏

在策略蒸馏(Agarwal等人2024(https://arxiv.org/html/2608.00485#bib.bib27);Zhao等人2026(https://arxiv.org/html/2608.00485#bib.bib14))提供了互补的标记级训练信号。教师策略π\_\{T\}评估从当前学生策略采样的轨迹并提供密集监督:

\mathcal\{L\}\_\{\mathrm\{OPD\}\}=\sum\_\{t,i\}\mathrm\{KL\}\!\left\[\pi\_\{T\}\!\left\(\cdot\mid h\_\{t\},y\_\{t,<i\},c\_\{t\}^\{\mathrm\{ex\}\}\right\)\,\middle\|\,\pi\_\{\theta\}\!\left\(\cdot\mid h\_\{t\},y\_\{t,<i\}\right\)\right\],\(6\)其中c\_\{t\}^\{\mathrm\{ex\}\}表示仅教师可用的执行事后信息,如查询结果、运行时错误、解析错误或空输出。直接模仿这种事后信息条件下的教师可能引入信息泄漏、教师偏差和优化不稳定性。因此,SERL\-SQL仅将此信号用于SQL和工具动作标记上的有界、选择性信用重新加权。

## 方法

SERL\-SQL由四个阶段组成,如图2(https://arxiv.org/html/2608.00485#Sx1.F2)所示。它首先将完整模式接地为紧凑的数据库上下文,然后通过迭代生成、执行和修订采样多轮SQL轨迹。仅训练阶段的教师模型在执行事后信息下对学生策略的在策略动作重新评分,由此产生的师生似然差距用于在可执行动作标记上选择性重新加权GRPO优势。训练后,教师模型被移除,学生策略独立部署。

### 模式接地

给定自然语言问题qq和数据库模式SS,模式接地智能体识别包含回答该问题所需的表、列和数据库值的紧凑模式子集S^\{\\prime\}\subseteq S。如图2(https://arxiv.org/html/2608.00485#Sx1.F2)所示,接地过程包括离线值索引、问题感知值检索和混合模式链接。设S=\{(T\_\{j\},C\_\{j\})\}\_\{j=1\}^\{M\}表示完整模式,其中T\_\{j\}是表,C\_\{j\}是其列集合。在离线预处理期间,每列的代表性值由嵌入模型E\_\{\eta\}编码,并存储在列感知的向量索引中:

\mathcal\{I\}=\left\{(T\_\{j\},c,v,E\_\{\eta\}\(v\))\mid T\_\{j\}\in S,\;c\in C\_\{j\},\;v\in\mathcal\{V\}\_\{j,c\}\right\},\(7\)其中\mathcal\{V\}\_\{j,c\}表示与列cc关联的值。该索引为每个数据库构建一次,并跨不同问题重用。

在查询时,从问题中提取关键词和实体提及\mathcal\{K\}\_\{q\},并与向量索引匹配。排名最高的值及其源列形成检索到的值证据:

\mathcal\{V\}\_\{q\}=\operatorname\{TopK\}\_\{(T\_\{j\},c,v\)\in\mathcal\{I\}\}\max\_\{k\in\mathcal\{K\}\_\{q\}\}\operatorname\{sim\}\bigl(E\_\{\eta\}\(k\),E\_\{\eta\}\(v\)\bigr)。\(8\)此类证据将问题表达与具体数据库内容联系起来,尤其是当问题和存储值使用不同表面形式时。

然后我们结合基于推理的链接和基于值的链接。基于推理的链接识别问题语义结构所需的模式元素,如投影列、过滤条件、连接键和聚合属性。基于值的链接选择由检索到的数据库值支持的列。因此,接地模块产生:

S^\{\\prime\}=G\_\{\phi\}\(q,S,\mathcal\{V\}\_\{q\}\)=\left\{(T\_\{j\},C^\{\\prime\}\_\{j\})\mid T\_\{j\}\in S,\;C^\{\\prime\}\_\{j\}\subseteq C\_\{j\}\right\}。\(9\)
每个保留列都以其数据类型、键信息、描述和代表性值序列化。生成的接地模式提供了紧凑且值感知的数据库上下文,由所有后续策略rollout共享,在保留SQL生成所需证据的同时减少不相关的模式信息。

### 多轮SQL智能体Rollout

以问题qq、接地模式S^\{\\prime\}和可选外部知识ee为条件,学生策略π\_\{\theta\}通过迭代SQL生成、执行和修订与数据库交互。策略不是直接生成最终查询,而是遵循思考、行动和观察过程,使其能够检查执行反馈并修订先前的SQL决策。我们将此交互定义为过程\mathcal\{M\}=\(\mathcal\{S\}\_\{\mathrm\{int\}\},\mathcal\{A\},\mathcal\{P\},\mathcal\{R\}\)。

#### 状态空间。

在轮次tt,状态包含任务输入和完整交互历史,s\_\{t\}=\left(q,S^\{\\prime\},e,h\_\{t\}\right),h\_\{t\}=\(a\_\{0\},o\_\{0\},\ldots,a\_\{t-1\},o\_\{t-1\}\)。因此,策略可以在原始数据库上下文和所有先前执行反馈的基础上条件化其下一个决策。

#### 动作空间。

学生采样动作a\_\{t\}=\pi\_\{\theta\}\(\cdot\mid s\_\{t\}\)。每个动作包含一个推理片段,后跟一个中间SQL动作或终止解决方案。中间SQL动作可以构造新查询或修订先前查询。

相似文章

学习检索:面向文本到SQL智能体的双层长期记忆

arXiv cs.CL

本文提出了MERIT,一种面向交互式文本到SQL智能体的动态多时域记忆检索框架,它使用情节级别和回合级别的记忆,并通过强化学习以及用于密集奖励的过程奖励模型优化的学习检索策略。在BIRD-Interact和Spider2-Snow上的实验表明,MERIT在成功率上优于静态和单时域动态基线,同时需要更少的交互轮次。

Self-Distilled Agentic Reinforcement Learning

Hugging Face Daily Papers

SDAR通过将自蒸馏与Sigmoid门控相结合,有选择地增强正向令牌级引导,同时减轻负面教师拒绝的影响,从而增强多轮智能体训练,在多个基准测试中相较于GRPO取得了显著提升。