EvoSQL:面向Text-to-SQL的记忆增强评论器-生成器协同进化
摘要
EvoSQL是一个面向Text-to-SQL的协同进化框架,通过带有情景记忆的生成器-评论器对迭代改进SQL生成,在Spider和BIRD基准测试上取得了性能提升。
arXiv:2607.20489v1 Announce Type: new
摘要:随着大型语言模型的发展,Text-to-SQL技术取得了快速进步,但复杂数据库查询仍需超越一次性生成的推理能力,包括多步分解、基于执行的诊断以及针对性修正。我们提出EvoSQL,一个协同进化框架,将SQL综合过程形式化为生成器与评论器之间的迭代交互。EvoSQL维护一个上下文相关的候选内存,通过执行信号和基于LLM的评论验证SQL候选,并通过效用导向的聚合更新内存。为了增强底层生成器-评论器对,我们进一步引入了自蒸馏策略优化(SDPO)微调阶段,将执行感知监督注入现代编码LLM骨干中。在Spider和BIRD上的实验表明,EvoSQL在Maj@16基线上持续改进开源模型,在BIRD-Dev上尤其取得了显著提升,从Qwen3-4B的+1.37%到Qwen2.5-Coder-3B的+9.19%。SDPO初始化进一步提升了Spider-Test和BIRD-Dev上选定骨干模型的性能。这些结果表明,基于记忆的协同进化是向更可靠、更可泛化的Text-to-SQL系统迈进的有效途径。代码已开源:https://github.com/valleysprings/EvoSQL。
查看缓存全文
缓存时间: 2026/07/24 05:02
# EvoSQL: 面向文本到SQL的记忆增强评判器-生成器协同进化 来源: https://arxiv.org/html/2607.20489 周嘉伟¹, 王建伟²†††Corresponding Author\. Email:jianwei\.wang1@unsw\.edu\.au (https://arxiv.org/html/2607.20489v1/[email protected])\(Jianwei Wang\) andw\.kai@sjtu\.edu\.cn (https://arxiv.org/html/2607.20489v1/[email protected])\(Kai Wang\), 周晨宇¹, 石超剑³, 董明⁴, 王凯¹ ¹上海交通大学 ²新南威尔士大学 ³复旦大学 ⁴武汉理工大学 ###### 摘要 文本到SQL技术随着大型语言模型的发展取得了快速进步,但复杂的数据库查询仍然需要超越一次性生成的推理能力,包括多步分解、基于执行的诊断以及针对性修正。我们提出了EvoSQL,一个协同进化框架,它将SQL合成公式化为生成器与评判器之间的迭代交互。EvoSQL维护一个情境化的候选记忆,使用执行信号和基于LLM的评判来验证SQL候选,并通过效用导向的聚合来更新其记忆。为了增强底层的生成器-评判器对,我们进一步引入了一个自我蒸馏策略优化(SDPO)微调阶段,将执行感知监督注入到现代代码LLM骨干中。在Spider和BIRD上的实验表明,EvoSQL在Maj@16基线上持续改进了开源模型,在BIRD-Dev上取得了特别大的收益,从Qwen3-4B的+1.37%到Qwen2.5-Coder-3B的+9.19%。SDPO初始化进一步改进了Spider-Test和BIRD-Dev上选定的骨干模型。这些结果表明,基于记忆的协同进化是实现更可靠和更通用的文本到SQL系统的有效途径。代码可在 https://github.com/valleysprings/EvoSQL 获取。 # EvoSQL: 面向文本到SQL的记忆增强评判器-生成器协同进化 周嘉伟¹, 王建伟²†††Corresponding Author\. Email:jianwei\.wang1@unsw\.edu\.au (https://arxiv.org/html/2607.20489v1/[email protected])\(Jianwei Wang\) andw\.kai@sjtu\.edu\.cn (https://arxiv.org/html/2607.20489v1/[email protected])\(Kai Wang\), 周晨宇¹, 石超剑³, 董明⁴, 王凯¹ ¹上海交通大学 ²新南威尔士大学 ³复旦大学 ⁴武汉理工大学 ## 1 引言 文本到SQL(Text2SQL),也称为自然语言到SQL,使用户能够使用自然语言查询关系数据库,显著降低了数据访问和分析的门槛(Hong et al., 2024 (https://arxiv.org/html/2607.20489#bib.bib57))。随着大型语言模型(LLM)的兴起,现代Text2SQL系统已在多个方向上迅速发展,包括模式感知建模和模式链接(Li et al., 2023a (https://arxiv.org/html/2607.20489#bib.bib4); Cao et al., 2024 (https://arxiv.org/html/2607.20489#bib.bib58))、内容感知检索和模式选择(Talaei et al., 2024 (https://arxiv.org/html/2607.20489#bib.bib29)),以及测试时修正或多步提示流水线(Pourreza and Rafiei, 2023 (https://arxiv.org/html/2607.20489#bib.bib27))。 请参见图示 图 1:Text2SQL 的范式。(A) 自一致性:采样多个候选并通过多数/评判器选择。(B) 自我修正:迭代评判并修正单个候选。(C) 自我进化:通过跨代聚合候选来进化种群,然后投票。(D) 协同进化(我们的):多轮种群进化,带有情境化情景记忆(存储/加载),评判器提供可重用的诊断,聚合器执行定向更新,随后进行贪婪/Best-of-KK选择。 尽管取得了这些成功,现有的Text2SQL系统在处理复杂数据库场景(例如,多跳推理、嵌套查询)时仍面临显著瓶颈。当前的SOTA方法大致可分为两类:基于提示的推理时间方法和基于学习的优化方法。 ##### 基于提示的方法 基于提示的方法主要在推理时改进现成的LLM,而不显式更新底层模型。单智能体流水线通常依赖于上下文生成、自一致性或自我修正,即一个模型通过提示采样、评判和修正SQL候选(Gao et al., 2023 (https://arxiv.org/html/2607.20489#bib.bib1); Dong et al., 2023 (https://arxiv.org/html/2607.20489#bib.bib2); Pourreza and Rafiei, 2023 (https://arxiv.org/html/2607.20489#bib.bib27))。多智能体流水线进一步将Text2SQL分解为专门的角色,如规划、模式探索、生成和验证,或在多个推理路径上分配测试时计算,然后通过一致性或偏好选择(例如,MAC-SQL、ReFoRCE、CHASE-SQL)(Wang et al., 2024 (https://arxiv.org/html/2607.20489#bib.bib28); Deng et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib87); Pourreza et al., 2024 (https://arxiv.org/html/2607.20489#bib.bib47))。这些方法增加了结构多样性并实现了迭代修正,但它们的搜索过程通常由固定的提示模板、固定的候选预算或启发式的角色交互所控制。这在复杂模式上带来了两个挑战:首先,它们缺乏难度感知控制,在简单案例上浪费计算,而在困难案例上探索不足;其次,没有有效的情境化记忆,它们常常忘记先前的失败模式,重复相同的错误条件,或在表面上合理的SQL变体之间摇摆。结果,基于提示的多智能体方法在复杂场景中仍可能偏离目标,或将大量预算花费在不集中的修正上。 ##### 基于学习的方法 基于学习的方法通过更新模型参数或策略来改进Text2SQL模型。大多数现有的Text2SQL优化仍然是*单轮*的:监督微调从策划或合成的SQL数据中学习,例如OmniSQL(Li et al., 2025a (https://arxiv.org/html/2607.20489#bib.bib45));迭代自我训练将伪标签化的理由或高置信度解决方案蒸馏回模型中,例如STaR-SQL(He et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib79));而带有可验证奖励的强化学习(RLVR)直接优化基于执行的正确性,其中SQL-R1是一个代表性工作(Ma et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib80))。虽然有效,但这些方法优化的是在一次生成步骤中产生完整的SQL查询,只有有限的后期聚合,如自一致性。然而,对于困难查询,正确性通常需要局部语义指导、试错执行反馈以及评判驱动的修正,以确定候选条件是否有效。此外,RLVR可能进一步导致*多样性崩溃*(Chen et al., 2026 (https://arxiv.org/html/2607.20489#bib.bib90)),即策略收敛到在奖励下局部最优的狭窄SQL结构族,减少了其他有效推理路径的探索。 除了单轮学习,新兴的多轮优化范式(如递归自聚合)旨在通过跨代聚合候选来进化种群(Venkatraman et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib85))。然而,多轮优化在Text2SQL领域仍基本未被探索,且本质上具有挑战性,这是由于任务独特的复杂性,如紧密的模式基础、执行反馈和结构化的候选精炼。如何利用多轮经验进行有信息且持续改进的SQL生成仍然是一个开放挑战。 请参见图示 图 2:EvoSQL 的在线推理时工作流程。(A) 生成器从问题、模式、提示和来自记忆的M次候选(第1轮+)中引出并行的SQL候选。(B) 一个两阶段验证器将确定性执行反馈与基于LLM的评判相结合,对候选进行评分和诊断。(C) 生成的记忆存储已验证的候选和摘要,用于效用导向的有效载荷采样、聚合和最终SQL选择。 为了弥补这一差距,我们提出了EvoSQL,一个新颖的协同进化SQL生成框架,如图2 (https://arxiv.org/html/2607.20489#S1.F2) 所示。与仅提示的编排方法(Wang et al., 2024 (https://arxiv.org/html/2607.20489#bib.bib28); Deng et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib87); Pourreza et al., 2024 (https://arxiv.org/html/2607.20489#bib.bib47))或基于学习的单轮优化方法(Li et al., 2025a (https://arxiv.org/html/2607.20489#bib.bib45); He et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib79); Ma et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib80))不同,我们的方法将生成器和评判器耦合在一个多轮进化过程中,其中SQL候选首先经过两阶段验证,然后按效用排序进行选择,最后通过基于情境化记忆在选定候选上的聚合进行改进。具体来说,我们设计了一个协同进化机制,其中SQL候选首先通过执行信号和评判反馈进行验证,然后根据其效用进行选择,最后在得分经验的情景记忆支持下聚合成改进的候选。为了确保多样性和搜索稳定性,我们将执行信息整合到选择过程中,引导进化朝着逻辑一致且可执行的解决方案发展。对于LLM评判无法提供足够反馈以有效指导探索的困难样本,我们通过应用一个归纳导向的自我蒸馏策略优化(SDPO)阶段来进一步增强EvoSQL,该阶段作用于后训练骨干。此阶段侧重于加强SQL合成,使模型能够在推理时生成并修正更高质量的候选,以供后续的多轮进化和聚合。 主要贡献总结如下: - •我们提出了EvoSQL,一个协同进化的Text-to-SQL框架,引入了记忆增强的多轮候选进化用于SQL生成。 - •EvoSQL结合了执行反馈、评判导向的精炼、基于效用的选择、情景记忆和提前停止,以高效地探索和聚合多样化的SQL候选。 - •我们引入了一个归纳导向的SDPO阶段,将执行感知的偏好信号蒸馏到后训练骨干中,改进了对挑战性查询的SQL合成和修正。 - •在Spider和BIRD上的实验表明,在强大的Maj@16基线上有一致的改进,而消融和敏感性分析证实了所提出的协同进化机制的有效性和鲁棒性。 ## 2 相关工作 ##### 当前的文本到SQL范式 大型语言模型(LLM)的最新进展极大地推动了文本到SQL(或NL2SQL)系统的发展(Katsogiannis-Meimarakis and Koutrika, 2023 (https://arxiv.org/html/2607.20489#bib.bib39); Hong et al., 2024 (https://arxiv.org/html/2607.20489#bib.bib57))。现有方法通常改进Text-to-SQL管道的不同阶段。模式感知方法侧重于模式链接、模式剪枝和结构编码,以更好地将用户问题与表和列对齐(Li et al., 2023a (https://arxiv.org/html/2607.20489#bib.bib4));分解方法将复杂问题分解为更简单的子问题或中间表示(Gu et al., 2023a (https://arxiv.org/html/2607.20489#bib.bib21), b (https://arxiv.org/html/2607.20489#bib.bib22); Gan et al., 2021 (https://arxiv.org/html/2607.20489#bib.bib12); Wolfson et al., 2020 (https://arxiv.org/html/2607.20489#bib.bib23); Eyal et al., 2023 (https://arxiv.org/html/2607.20489#bib.bib24); Gao et al., 2022 (https://arxiv.org/html/2607.20489#bib.bib25); Li et al., 2024 (https://arxiv.org/html/2607.20489#bib.bib26));后处理方法使用执行反馈、自我修正或基于一致性的选择来修复或选择SQL候选(Liu et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib59); Pourreza and Rafiei, 2023 (https://arxiv.org/html/2607.20489#bib.bib27); Wang et al., 2024 (https://arxiv.org/html/2607.20489#bib.bib28); Gao et al., 2023 (https://arxiv.org/html/2607.20489#bib.bib1); Dong et al., 2023 (https://arxiv.org/html/2607.20489#bib.bib2); Li et al., 2025a (https://arxiv.org/html/2607.20489#bib.bib45))。 基于学习的Text-to-SQL系统进一步通过监督微调、合成数据构建或强化学习来适应LLM。基于SFT的方法可以提高领域内准确性,但它们通常依赖于静态的训练分布,并且可能对未见过的模式或数据库特定的推理模式泛化能力差(Pourreza and Rafiei, 2024 (https://arxiv.org/html/2607.20489#bib.bib3); Fu et al., 2023 (https://arxiv.org/html/2607.20489#bib.bib14); Wang et al., 2019 (https://arxiv.org/html/2607.20489#bib.bib31); Lei et al., 2024 (https://arxiv.org/html/2607.20489#bib.bib66))。最近,诸如SQL-R1(Ma et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib80))等RLVR风格方法使用执行正确性作为可验证奖励,使SQL模型能够获得比标准SFT更强的推理和错误恢复行为。然而,大多数现有的基于学习方法仍然优化的是单轮生成器:模型被训练为一次性生成完整的SQL查询,推理时的改进通常仅限于重采样、投票或浅层修正。结果,它们没有明确维护可重用的候选级别诊断,也没有将生成器和评判器耦合在多轮协同进化过程中。 ##### 面向代码智能体的多轮自我进化与自我蒸馏 除了文本到SQL,近期关于以代码为中心的推理的研究表明,可执行环境可以作为有效的反馈来源来改进LLM智能体。在自我进化和自我博弈范式中,模型迭代地提出解决方案,与环境交互,接收结果级别的反馈,并通过强化学习或轨迹级别的选择来改进其未来行为(Guo et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib50); Huang et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib89); Zhao et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib88))。这一系列工作对于代码任务尤其有效,因为编译器、解释器、单元测试和执行轨迹为正确性检查和错误诊断提供了客观信号。 一个相关的趋势研究多轮交互作为构建更健壮的智能体系统的一种机制。自我进化和递归聚合方法维护候选解决方案的种群,并通过多轮的选择、重组或自聚合来改进它们(Novikov et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib81); Lange et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib82); Venkatraman et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib85))。工具集成RL进一步训练智能体发现与外部工具或环境的稳定交互协议,改进长程推理和工具使用(Jiang et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib60); Jin et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib52); Li et al., 2025b (https://arxiv.org/html/2607.20489#bib.bib83); Wang et al., 2025 (https://arxiv.org/html/2607.20489#bib.bib84))。同时,自我蒸馏策略优化方法(Hübotter et al., 2026 (https://arxiv.org/html/2607.20489#bib.bib91); Zhao et al., 2026 (https://arxiv.org/html/2607.20489#bib.bib93))以及基于GRPO的变体(Li et al., 2026 (https://ar
相似文章
通过自增强微调在Text-to-SQL中整合推理与泛化
本文提出CoTE-SQL,一种面向text-to-SQL的自增强微调框架,它整合了自推理轨迹、结构化思维链提示和执行反馈,在Spider和Bird基准上取得了最先进的性能。
Progress-SQL:通过渐进式奖励改进文本到SQL的强化学习
Progress-SQL 提出了一种多轮强化学习框架,采用渐进式奖励用于文本到SQL,利用 Oracle 引导的诊断树提供密集的奖励信号,并在 BIRD 和 Spider 等基准上改进 SQL 查询生成。
DecoEvo: 文本空间中求解器与评分器生成技能的分数解耦协同进化
介绍了DecoEvo,一种用于文本空间中LLM优化的分数解耦协同进化方法,无需黄金评分标准即可同时提升求解器和评分器生成技能,在五个基准测试中相比基线实现了2.8%–5.0%的相对提升。
用于文本到SQL集成模型的残差技能优化
DivSkill-SQL是一个残差技能优化框架,无需模型微调即可构建互补的智能体文本到SQL集成模型,通过针对当前集成模型失败的示例进行优化,在Spider2-Lite上将选定准确率提升高达+11.1个百分点。
EvoOptiGraph:基于图结构生成的弱点驱动共同进化方法用于优化建模
EvoOptiGraph是一个框架,用于从自然语言自动进行优化建模,使用基于图的进化生成来创建多样化的训练数据,并通过弱点驱动的强化学习共同进化模型,在多个基准测试上取得了最先进的结果。