SQuaD-SQL: 利用LLM引导的知识蒸馏实现小型语言模型的高效文本到SQL
摘要
SQuaD-SQL使用LLM引导的知识蒸馏训练小型语言模型进行Text-to-SQL,在WikiSQL上达到86.9%的执行准确率,同时提供更快的推理速度和更低的内存占用。
arXiv:2607.08161v1 公告类型: new
摘要: Text-to-SQL是自然语言处理中的一项基础任务,使用户能够用自然语言与结构化数据库进行交互。尽管大型语言模型(LLMs)在此任务上表现出了显著性能,但其巨大的计算需求阻碍了在资源受限环境中的部署。在本文中,我们介绍了SQuaD-SQL(Small-Qualified and Distilled for SQL),一种新颖的方法,它通过知识蒸馏和合成数据生成,使小型语言模型(SLMs)在Text-to-SQL任务上接近LLMs的性能,同时显著提高效率。我们的方法包括三个关键组件:(1)基于LLM的合成数据生成,通过精心设计的提示策略从LLMs中提取结构化知识;(2)参数高效微调,使得可以在单块消费级GPU上进行完整模型训练;(3)领域自适应微调,其中领域特定的合成数据进一步提升了目标领域的性能。在WikiSQL数据集上的实验表明,SQuaD-SQL在测试集上达到了86.9%的执行准确率,接近LLMs的性能,同时提供更快的推理速度和更低的内存占用。这些结果表明,通过合适的训练策略,SLMs可以作为资源受限环境中Text-to-SQL应用的实用且高效的替代方案。
查看缓存全文
缓存时间: 2026/07/10 06:13
# SQuaD-SQL: 通过LLM引导的知识蒸馏实现高效的小语言模型Text-to-SQL 来源:https://arxiv.org/html/2607.08161 王宇武¹,⁵, 林晓健⁴, 傅蓉², 于在洋³, 陈旭航⁷, 余文军⁶, 陈振鸿⁵∗ ¹利物浦大学 ²澳门大学 ³中国科学院大学 ⁴清华大学 ⁵微软 ⁶上海对外经贸大学 ⁷惠州学院 ###### 摘要 Text-to-SQL 是自然语言处理中的基础任务,使用户能够通过自然语言与结构化数据库交互。尽管大型语言模型(LLM)在此任务上表现出色,但其巨大的计算需求阻碍了在资源受限环境中的部署。本文提出 SQuaD-SQL(Small-Qualified and Distilled for SQL),一种新颖方法,通过知识蒸馏和合成数据生成,使小语言模型(SLM)在 Text-to-SQL 任务上接近大语言模型性能,同时显著提升效率。我们的方法包含三个关键组件:(1) 基于 LLM 的合成数据生成,通过精心设计的提示策略从 LLM 中提取结构化知识;(2) 参数高效微调,实现在单张消费级 GPU 上进行完整模型训练;(3) 领域自适应微调,利用领域特定的合成数据进一步提升目标领域的性能。在 WikiSQL 数据集上的实验表明,SQuaD-SQL 在测试数据上达到了 86.9% 的执行准确率,接近大语言模型的性能,同时具备更快的推理速度和更低的内存占用。这些结果表明,通过适当的训练策略,SLM 可以作为资源受限环境中 Text-to-SQL 应用的实用且高效的替代方案。 ## I引言 Text-to-SQL 使用户能够通过自然语言查询结构化数据库,显著降低了数据库访问的门槛。早期基于规则或模板的系统缺乏可扩展性,而 Seq2SQL[40 (https://arxiv.org/html/2607.08161#bib.bib22)] 和 SQLNet[34 (https://arxiv.org/html/2607.08161#bib.bib23)] 等神经模型通过基于草图的解码和强化学习提升了性能。最近,自然语言接口与结构化数据(特别是 Text-to-SQL)的进展主要遵循一种规模驱动的范式。Text-to-SQL 使用户能够通过自然语言查询结构化数据库,显著降低了数据库访问的门槛。早期基于规则或模板的系统缺乏可扩展性,而 Seq2SQL[40 (https://arxiv.org/html/2607.08161#bib.bib22)] 和 SQLNet[34 (https://arxiv.org/html/2607.08161#bib.bib23)] 等神经模型通过基于草图的解码和强化学习提升了性能。后续工作引入了更复杂的数据集如 Spider[37 (https://arxiv.org/html/2607.08161#bib.bib24)] 以及结构感知架构如 RAT-SQL[28 (https://arxiv.org/html/2607.08161#bib.bib27)]。预训练表格模型,包括 TAPAS[13 (https://arxiv.org/html/2607.08161#bib.bib25)] 和 TaBERT[35 (https://arxiv.org/html/2607.08161#bib.bib26)],通过融入模式和表表示进一步提升了性能。 参见图注图 1:提出的师生学习框架概览。大语言模型提供结构化的指导信号,引导紧凑的学生模型内化 Text-to-SQL 推理模式,无需依赖人工标注。最近,大型语言模型(LLM)[5 (https://arxiv.org/html/2607.08161#bib.bib29),25 (https://arxiv.org/html/2607.08161#bib.bib28)] 在 Text-to-SQL 任务上展现了强大的推理能力,通常达到最先进的性能。然而,这些提升是以巨大的计算资源为代价的。基于 LLM 的系统[31 (https://arxiv.org/html/2607.08161#bib.bib5),32 (https://arxiv.org/html/2607.08161#bib.bib2),30 (https://arxiv.org/html/2607.08161#bib.bib4),6 (https://arxiv.org/html/2607.08161#bib.bib3)] 通常面临高推理延迟、昂贵的部署需求(涉及多个高端 GPU)以及资源密集的训练与微调过程。这些需求与人类学习中观察到的效率形成鲜明对比,严重限制了 Text-to-SQL 系统在实际资源受限环境中的部署。 这种对比从认知角度提出了一个基本问题:*紧凑模型能否在适当的指导信号(而非单纯规模)引导下,获得与大模型相当的结构化推理能力?* 小语言模型(SLM)在效率和可访问性上具有明显优势,但从头训练往往导致在 Text-to-SQL 等复杂推理任务上性能严重下降。弥合效率与推理能力之间的差距仍然是一个关键挑战。在这项工作中,我们提出 SQuaD-SQL,一种师生学习框架,使小语言模型能够在资源约束下内化结构化的 SQL 推理行为。受人类教学中指导式学习的启发,我们将大语言模型视为生成结构化监督信号的教师,而紧凑的学生模型则学习抽象和内化这些推理模式,在推理时无需教师参与。 具体而言,我们设计了针对 Text-to-SQL 任务定制的提示模板,从教师模型中引出高质量、结构化的指导信号。这些信号作为合成监督,引导学生模型学习组合式 SQL 推理。为确保效率,我们采用参数高效微调技术(如 LoRA),使整个训练过程可在单张消费级 GPU(如 RTX 4090)上完成。此外,我们通过为特定应用领域生成目标合成 SQL 示例来增强领域适应性,使学生模型能够在不同设置下更有效地泛化。 我们在 WikiSQL 基准上评估我们的方法。实验结果表明,一个 1.5B 参数的学生模型(Qwen-1.5B)在推理效率显著提升的同时,实现了与更大模型相当的执行准确率。这些发现表明,结构化推理可以在资源约束下有效学习,为复杂符号行为通过指导而非单纯规模产生提供了计算依据。 如图 1 (https://arxiv.org/html/2607.08161#S1.F1) 所示,我们的主要贡献总结如下: - •我们提出一种师生学习框架,通过将指导信号从大语言模型转移到紧凑学生模型,模拟了资源约束下结构化推理能力的获取过程。 - •我们提出 SQuaD-SQL,一种基于参数高效微调的轻量级高效 Text-to-SQL 训练方法,支持在有限计算资源下进行实际部署。 - •我们在 WikiSQL 上进行全面实验,证明我们的方法在取得强推理性能的同时,与基于 LLM 的基线相比保持了显著的效率优势。 ## II相关工作 ### II-A Text-to-SQL 任务 Text-to-SQL 是一项基础 NLP 任务,将自然语言问题转换为可执行的 SQL 查询,使非专家能够访问数据库。早期基于规则的方法[19 (https://arxiv.org/html/2607.08161#bib.bib1),16 (https://arxiv.org/html/2607.08161#bib.bib6)] 存在泛化能力有限的问题。随着深度学习的发展,神经网络模型如 Seq2SQL[40 (https://arxiv.org/html/2607.08161#bib.bib22)] 和 SQLNet[34 (https://arxiv.org/html/2607.08161#bib.bib23)] 通过注意力和基于草图的解码在 WikiSQL[40 (https://arxiv.org/html/2607.08161#bib.bib22)] 等基准上提升了准确率。 更复杂的数据集如 Spider[37 (https://arxiv.org/html/2607.08161#bib.bib24)] 要求模型能够泛化到未见过的模式。结构感知模型如 RAT-SQL[28 (https://arxiv.org/html/2607.08161#bib.bib27)] 使用关系感知注意力,而 IRNet 和 BRIDGE 增强了模式链接。预训练语言模型(PLM)进一步提升了性能:TAPAS[13 (https://arxiv.org/html/2607.08161#bib.bib25)] 和 TaBERT[35 (https://arxiv.org/html/2607.08161#bib.bib26)] 学习了表格-文本表示,PICARD[25 (https://arxiv.org/html/2607.08161#bib.bib28)] 通过约束解码强制语法有效性。 然而,最先进的方法依赖于大型模型(如 T5 或 Codex),这些模型计算开销大。我们的工作通过探索知识蒸馏和高效微调来解决这一问题,使小语言模型(SLM)适用于 Text-to-SQL。 参见图注图 2:方法概览:使用 LLM 生成合成数据,训练小语言模型,并执行领域自适应微调。 ### II-B 语言模型 随着 GPT-4o[5 (https://arxiv.org/html/2607.08161#bib.bib29)]、PaLM[8 (https://arxiv.org/html/2607.08161#bib.bib30)] 和 LLaMA[27 (https://arxiv.org/html/2607.08161#bib.bib31)] 等大语言模型的出现,Text-to-SQL 任务的性能得到进一步提升。这些模型通过大规模预训练获得了强大的语言理解和生成能力,能够直接从自然语言指令中理解用户意图并生成相应的 SQL 查询。 专门针对代码生成任务优化的大型模型,如 SQLCoder[9 (https://arxiv.org/html/2607.08161#bib.bib32)] 和 CodeLlama[23 (https://arxiv.org/html/2607.08161#bib.bib33)],在 Text-to-SQL 任务上表现尤为出色。通过在代码语料上进行预训练,它们对 SQL 语法和数据库操作有了深入理解。然而,这类大型模型通常需要数十亿甚至数千亿参数,导致高推理延迟和部署成本,难以在资源受限环境中使用。 为解决大型模型的资源需求,研究人员开始探索小语言模型的潜力。Qwen 系列[4 (https://arxiv.org/html/2607.08161#bib.bib34)]、Phi[11 (https://arxiv.org/html/2607.08161#bib.bib35)] 和 TinyLlama[38 (https://arxiv.org/html/2607.08161#bib.bib36)] 等模型采用精心设计的预训练策略,在参数显著减少的情况下保持了有竞争力的性能。 知识蒸馏,由 Hinton 等人[14 (https://arxiv.org/html/2607.08161#bib.bib37)] 首次提出,是提升小模型性能的有效方法。在 NLP 领域,DistilBERT[24 (https://arxiv.org/html/2607.08161#bib.bib38)] 和 TinyBERT[18 (https://arxiv.org/html/2607.08161#bib.bib39)] 等研究成功压缩了 BERT 模型,同时保留了大部分性能。最近,研究人员将蒸馏技术应用于大语言模型。Alpaca[26 (https://arxiv.org/html/2607.08161#bib.bib40)] 和 Vicuna[7 (https://arxiv.org/html/2607.08161#bib.bib41)] 等工作通过从大语言模型蒸馏知识,增强了小模型的指令遵循能力。 ### II-C 合成数据生成 合成数据生成是解决数据稀缺问题的有效方法。在 Text-to-SQL 领域,早期工作如[36 (https://arxiv.org/html/2607.08161#bib.bib42),12 (https://arxiv.org/html/2607.08161#bib.bib43)] 使用模板和规则生成合成查询用于数据增强。随着大语言模型的发展,研究人员开始探索利用这些模型生成高质量合成数据。Self-Instruct[29 (https://arxiv.org/html/2607.08161#bib.bib44)] 和 WizardLM[33 (https://arxiv.org/html/2607.08161#bib.bib45)] 等工作表明,大型模型可以通过自引导提示生成多样化的指令数据,进而用于训练较小模型。 在 Text-to-SQL 任务中,SQLGen[10 (https://arxiv.org/html/2607.08161#bib.bib46)] 和 DB-GPT[17 (https://arxiv.org/html/2607.08161#bib.bib47)] 等方法探索使用大型模型生成 SQL-自然语言对以增强泛化能力。然而,这些工作主要关注微调大型模型,对于如何有效使用合成数据训练资源高效的小模型探索有限。 我们的工作与上述研究相关,但专门聚焦于利用知识蒸馏和合成数据生成,使小语言模型(如 Qwen-1.5B)在 Text-to-SQL 任务上达到接近大模型的性能,同时保持显著的效率优势。我们的方法不仅强调模型性能,还注重训练和推理效率,使整个过程可以在单张消费级 GPU 上完成。 ## III方法 本节详细阐述我们提出的方法,该方法结合知识蒸馏和合成数据生成,使小语言模型在 Text-to-SQL 任务上达到接近大模型的性能,同时保持显著的效率优势。 ### III-A 概述 本工作的目标是让 SLM 在 Text-to-SQL 任务上表现出有竞争力的性能,同时保持适合在资源受限环境中部署的效率。为此,我们提出一个框架,利用大语言模型(LLM)进行合成数据生成,应用严格的数据质量控制以确保高质量训练样本,并采用轻量级训练策略(如 LoRA)高效微调 SLM。图 2 (https://arxiv.org/html/2607.08161#S2.F2) 提供了我们提出方法的概览,包含三个主要阶段:基于 LLM 的数据生成、高质量数据选择以及基于 LoRA 的 SLM 训练。 ### III-B 基于 LLM 的数据生成 为降低 Text-to-SQL 模型的训练成本同时保持性能,我们利用大语言模型(LLM)(如 GPT-4o)作为数据生成器,为小语言模型(SLM)生成 WikiSQL 格式的高质量监督。我们不依赖 LLM 进行推理,而是使用它们合成配对的自然语言问题和结构化 SQL 标签。 我们从 WikiSQL 数据集中提取模式信息,包括列名和可选的行样本,并利用这些信息构建指令风格的提示。这些提示引导 LLM 以一致且语法正确的格式生成结构化 SQL 输出。生成的数据通过变化模式上下文和查询类型,覆盖了广泛的问题复杂度和逻辑条件。 生成的合成对为下游微调提供了多样且稳健的训练信号。我们使用师生公式形式化数据生成过程: \(x_i, y_i\) ← f_LLM(prompt_i), (1) 其中 x_i 是生成的自然语言问题,y_i 是对应的 SQL 查询,由教师模型 f_LLM 根据输入提示 prompt_i 生成。 ### III-C 高质量选择 鉴于大语言模型(LLM)为 WikiSQL 数据集生成的合成 SQL 标签,确保只保留高质量样本用于训练小语言模型(SLM)至关重要。由于 LLM 有时可能生成不正确、不连贯的
相似文章
面向低资源开源Text-to-SQL模型的知识蒸馏
本文提出了一种知识感知的Text-to-SQL框架,利用知识蒸馏在低资源环境下通过构建任务特定的知识库并生成合成训练数据来提升性能。在七个基准上的实验表明,该方法带来了显著的改进,尤其是对于开源模型。
SERL-SQL:面向Text-to-SQL强化智能体学习的选择性事后蒸馏
SERL-SQL提出了一种面向多轮Text-to-SQL智能体的选择性执行反馈强化学习框架,利用教师-学生似然差距对SQL动作token上的GRPO优势进行重新加权。该方法在BIRD和Spider基准上取得了强劲的结果。
TQLite:多LLM评审团引导的蒸馏,用于实时MQM翻译质量评估
介绍了TQLite,一种利用多LRM评审团训练小型语言模型进行基于MQM的实时翻译质量评估的蒸馏框架,其性能远超现成的SLM,同时保持成本效益。
KDFlow:面向大语言模型的用户友好且高效的知识蒸馏框架
KDFlow是一种新颖的大语言模型知识蒸馏框架,采用解耦架构,使用SGLang进行教师推理,FSDP2进行学生训练,相比现有框架实现了1.44倍至6.36倍的加速。
CHS-SQL:一种基于置信度引导的启发式搜索模式链接过程的Text-to-SQL方法
CHS-SQL提出了一种基于置信度引导的启发式搜索模式链接过程,用于使用小语言模型进行Text-to-SQL,通过在模式选择中平衡精确率和召回率,取得了SOTA结果。