超越静态规则:Text-to-SQL 中潜在漏洞的自动发现
摘要
提出 SAGE 框架,通过生成漏洞假设并迭代验证,自动揭示基于 LLM 的 Text-to-SQL 生成中的潜在失效模式。实验表明,SAGE 揭示了模型的显著脆弱性,且发现的模式可在模型间迁移,初步微调显示出有前景的修复效果。
arXiv:2607.03833v1 Announce Type: new
摘要:虽然大型语言模型(LLMs)在 Text-to-SQL 任务中取得了显著成功,但它们在现实环境中的部署受到潜在可靠性问题的阻碍。识别这些潜在弱点对于构建可信的数据库接口至关重要,然而当前的诊断方法严重依赖静态的、专家定义的规则,缺乏系统化和自动化探索的能力。为弥补这一差距,我们提出 SAGE(Systematic Automated Guided Exploration),一个旨在自动揭示基于 LLM 的 Text-to-SQL 生成中潜在失效模式的新型框架。具体而言,SAGE 为给定样本生成漏洞假设,并参考不断演化的 Vulnerability Codex 来设计有针对性的扰动,从而迭代验证和记录潜在缺陷。在先进的开源 LLM 上进行的大量实验表明,SAGE 发现了大量失败案例,凸显了当前模型的显著脆弱性。此外,我们的分析显示 Vulnerability Codex 具有很强的跨模型迁移性,表明所发现的模式代表了通用的结构弱点。最后,我们探讨了 SAGE 的修复潜力。尽管初步的轻量级微调在生成的样本上产生了有希望的改进,但表明了未来工作中闭合可靠性循环的可扩展路径。
查看缓存全文
缓存时间: 2026/07/07 04:38
# Text-to-SQL 中潜在漏洞的自动发现
来源:https://arxiv.org/html/2607.03833
韩清旺¹\*,池永东¹,杨健²,杨磊³,赵洁慧³,陈云¹,陈冠华⁴
¹上海财经大学,²北京航空航天大学,³深演智能科技股份有限公司,⁴南方科技大学
###### 摘要
尽管大语言模型(LLMs)在 Text-to-SQL 任务上取得了显著成功,但其在实际部署中仍受到潜在可靠性问题的阻碍。识别这些潜在弱点对于构建可信的数据库接口至关重要,然而当前的诊断方法严重依赖静态的、专家定义的规则,缺乏系统化和自动化的探索能力。为填补这一空白,我们提出了 SAGE(系统性自动化引导探索,Systematic Automated Guided Exploration),这是一种新颖的框架,旨在自主揭示基于 LLM 的 Text-to-SQL 生成中的潜在故障模式。具体而言,SAGE 针对给定样本生成脆弱性假设,并参考一个持续演化的脆弱性法典(Vulnerability Codex)来设计有针对性的扰动,从而迭代验证并记录潜在的缺陷。在最新的开源 LLM 上进行的广泛实验表明,SAGE 发现了大量失败案例,凸显了当前模型的显著脆弱性。此外,我们的分析显示,脆弱性法典具有强大的跨模型迁移能力,表明所发现的模式代表了通用的结构性弱点。最后,我们探索了 SAGE 在修复方面的潜力。尽管是初步尝试,但在生成的样本上进行轻量级微调已经取得了有希望的改进,为在未来的工作中闭合可靠性循环提供了一条可扩展的路径。
---
超越静态规则:Text-to-SQL 中潜在漏洞的自动发现
韩清旺¹\*,池永东¹†††贡献相当,杨健²,杨磊³,赵洁慧³,陈云¹,陈冠华⁴†††通讯作者。
¹上海财经大学,²北京航空航天大学,³深演智能科技股份有限公司,⁴南方科技大学
## 1 引言
Text-to-SQL 系统(Androutsopoulos 等,1995 (https://arxiv.org/html/2607.03833#bib.bib22); Li and Jagadish, 2014 (https://arxiv.org/html/2607.03833#bib.bib23); Li 等,2024b (https://arxiv.org/html/2607.03833#bib.bib24); Yu 等,2018 (https://arxiv.org/html/2607.03833#bib.bib6))是自然语言与结构化数据之间的关键桥梁,通过让非技术用户直观地查询复杂数据库,使得数据访问更加民主化。随着大语言模型(LLMs)(Pourreza and Rafiei, 2023 (https://arxiv.org/html/2607.03833#bib.bib38); Xie 等,2025 (https://arxiv.org/html/2607.03833#bib.bib39); Li 等,2023a (https://arxiv.org/html/2607.03833#bib.bib35))的整合,该领域在语义理解和执行准确性方面经历了范式转变。
系统性地识别潜在故障模式是增强这种可靠性的前提。然而,当前的评估范式主要依赖静态基准(例如 Spider, Yu 等 (2018 (https://arxiv.org/html/2607.03833#bib.bib6));BIRD, Li 等 (2023b (https://arxiv.org/html/2607.03833#bib.bib77)))或人工错误分析(Chang 等 (2023a (https://arxiv.org/html/2607.03833#bib.bib32));Gan 等 (2021b (https://arxiv.org/html/2607.03833#bib.bib5), a (https://arxiv.org/html/2607.03833#bib.bib15));Patil 等 (2023 (https://arxiv.org/html/2607.03833#bib.bib12));Pi 等 (2022 (https://arxiv.org/html/2607.03833#bib.bib17)))。这些方法本质上受限于对人类先验知识的依赖:它们主要验证模型在预定义挑战面前的鲁棒性(Zhang 等 (2024 (https://arxiv.org/html/2607.03833#bib.bib8));Deng 等 (2021 (https://arxiv.org/html/2607.03833#bib.bib58));Bhaskar 等 (2023 (https://arxiv.org/html/2607.03833#bib.bib13))),但无法系统性地探索潜在的或之前未识别的漏洞¹。因此,某些故障模式(Saparina and Lapata (2024 (https://arxiv.org/html/2607.03833#bib.bib14));Sahitaj 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib64));Chang 等 (2023b (https://arxiv.org/html/2607.03833#bib.bib16)))可能仍未得到充分检查,并对 Text-to-SQL 生成的可靠性产生超出固定启发式规则所能捕捉的重大影响。因此,迫切需要一种能够主动探索模型故障边界的自动化框架。
¹本文中,“漏洞”指在保持语义的扰动下鲁棒性和可靠性的脆弱性,而非数据库安全漏洞(如 SQL 注入)。
为弥补这一差距,我们提出了 SAGE(系统性自动化引导探索,Systematic Automated Guided Exploration),这是一种旨在主动揭示基于 LLM 的 Text-to-SQL 生成中潜在漏洞的框架。与被动验证方法(Chang 等 (2023a (https://arxiv.org/html/2607.03833#bib.bib32));Gan 等 (2021b (https://arxiv.org/html/2607.03833#bib.bib5), a (https://arxiv.org/html/2607.03833#bib.bib15));Patil 等 (2023 (https://arxiv.org/html/2607.03833#bib.bib12));Pi 等 (2022 (https://arxiv.org/html/2607.03833#bib.bib17)))不同,SAGE 编排了一个主动发现过程。具体来说,它首先为目标样本制定特定的脆弱性假设,然后参考一个持续演化的脆弱性法典(Vulnerability Codex)——一个动态的通用错误原型库——来综合生成有针对性的扰动样本。这使得 SAGE 能够系统性地验证潜在弱点,并迭代优化其对模型故障边界的理解,从而将漏洞发现从静态的人工任务转变为自主、自我改进的循环。
我们的主要贡献如下:
- • 我们提出了 SAGE,一个能够自主演化脆弱性法典以指导探索的框架。它优于静态专家策划的基线方法,在不同模型上,BIRD 和 Spider 的平均 VER(脆弱性暴露率)边际分别达到 26.33% 和 18.66%。这些结果表明,与固定的手动启发式规则相比,我们的动态自动化策略是有效的。
- • 我们对 Text-to-SQL 中的 LLM 进行了系统性脆弱性评估。在 BIRD 和 Spider 上对多种模型的评估得出平均脆弱性暴露率(VER)分别为 76.98% 和 58.45%。这些数据为当前 Text-to-SQL 系统中潜在漏洞的普遍性提供了经验证据。
- • 除了检测,我们跨出了建立可靠性循环的第一步。在 1.5k 个样本上进行轻量级微调,部分缓解了模型的缺陷。这些发现虽属初步,但揭示了模型改进的可扩展路径,并验证了使用 SAGE 进行漏洞修复的潜力²。
²我们的代码可在 https://github.com/sustech-nlp/SAGE 获取。
## 2 相关工作
### 2.1 基于 LLM 的 Text-to-SQL 生成
随着 LLM 的快速发展,与传统的基于规则的系统(Mahmud 等 (2015 (https://arxiv.org/html/2607.03833#bib.bib27));Lyu 等 (2020 (https://arxiv.org/html/2607.03833#bib.bib28)))、神经模型(Choi 等 (2021 (https://arxiv.org/html/2607.03833#bib.bib33));Xu 等 (2017 (https://arxiv.org/html/2607.03833#bib.bib34)))以及预训练模型(Li 等 (2023a (https://arxiv.org/html/2607.03833#bib.bib35));Yin 等 (2020 (https://arxiv.org/html/2607.03833#bib.bib36)))相比,基于 LLM 的方法在迁移能力和推理能力上表现出显著提升,推动该领域进入新阶段(Hong 等 (2024 (https://arxiv.org/html/2607.03833#bib.bib79));Shi 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib37)))。当前方法主要遵循两种范式:提示工程和微调。提示工程方法通常使用闭源 LLM,通过任务分解(Pourreza and Rafiei (2023 (https://arxiv.org/html/2607.03833#bib.bib38));Xie 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib39));Chi 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib4)))、思维链(CoT)推理(Xu 等 (2024 (https://arxiv.org/html/2607.03833#bib.bib42));Liu 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib41)))以及多智能体协作(Xia 等 (2024 (https://arxiv.org/html/2607.03833#bib.bib43));Deng 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib44)))等技术来提升生成质量。相反,微调方法利用开源 LLM 来降低推理成本,同时提高隐私性、可控性和稳定性(Li 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib45));Qu 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib46));Guo 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib47));Li 等 (2024a (https://arxiv.org/html/2607.03833#bib.bib48));Sheng 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib49));Cheng 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib7)))。
尽管取得了成功,但这些工作的主要目标是最大化执行准确率,即优化生成正确 SQL 查询的概率。该领域内的一条特定研究路线——自动自我修正——通过识别和修复错误,与我们的工作表面相似(Shen 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib18));Gong 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib20));Askari 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib26)))。然而,它们的基本目标和机制存在显著差异。这些方法仅将修正作为提升特定样本性能的中间步骤,通常以临时方式处理错误,而不分析根本原因(Liu and Tan (2024 (https://arxiv.org/html/2607.03833#bib.bib25));Pourreza and Rafiei (2023 (https://arxiv.org/html/2607.03833#bib.bib38)))。相比之下,我们的工作将重点从提升性能转移到系统性漏洞发现。我们不仅限于修正单个实例,而是旨在抽象出高级故障模式,并诊断模型推理过程中的潜在缺陷,提供超越实例级修复的通用见解。
参见图注 图 1:提出的自动化漏洞发现框架 SAGE 的架构。该过程在两个阶段之间迭代:(1)发现阶段,系统利用中央脆弱性法典中的现有见解,生成并验证强对抗样本(步骤 1-5);(2)演化阶段,将识别出的失败抽象为通用原型,并通过语义压缩合并回法典(步骤 6-7)。这种闭环机制允许系统在后续迭代中持续更新其策略(步骤 8)。
### 2.2 基于 LLM 的 Text-to-SQL 生成中的鲁棒性和脆弱性
提示工程和微调策略不断提升了 Text-to-SQL 在基础基准(如 Spider(Yu 等 (2018 (https://arxiv.org/html/2607.03833#bib.bib6)))和 BIRD(Li 等 (2023b (https://arxiv.org/html/2607.03833#bib.bib77)))上的性能。
然而,现有的模型可靠性评估方法很大程度上局限于确认在特定条件下已知故障模式的存在。研究人员通过应用保持语义的扰动(Deng 等 (2021 (https://arxiv.org/html/2607.03833#bib.bib58));Gan 等 (2021b (https://arxiv.org/html/2607.03833#bib.bib5), a (https://arxiv.org/html/2607.03833#bib.bib15));Sahitaj 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib64)))或对模式和查询进行预定义规则更改(Chang 等 (2023b (https://arxiv.org/html/2607.03833#bib.bib16));Patil 等 (2023 (https://arxiv.org/html/2607.03833#bib.bib12)))来建立鲁棒性基准。虽然这些方法很有价值,但它们在人类专家定义的封闭范围内运行——它们仅仅验证 LLM 是否屈服于预期的错误类型,例如结构歧义(Ding 等 (2025 (https://arxiv.org/html/2607.03833#bib.bib19));Bhaskar 等 (2023 (https://arxiv.org/html/2607.03833#bib.bib13))),但未能探索这些启发式规则之外的模型“盲点”(Saparina and Lapata (2024 (https://arxiv.org/html/2607.03833#bib.bib14));Pi 等 (2022 (https://arxiv.org/html/2607.03833#bib.bib17));Zhang 等 (2024 (https://arxiv.org/html/2607.03833#bib.bib8)))。尽管最近的工作在其他 LLM 场景中追求自动化的偏差或故障发现(Lai 等 (2026 (https://arxiv.org/html/2607.03833#bib.bib3))),但 Text-to-SQL 的系统性漏洞探索仍然基本空白。
这凸显了对一个高效、自我演化且自动化的框架的需求,该框架能够发现潜在故障模式。与以往工作不同,我们的工作旨在系统性地揭示未知的缺陷模式,为 Text-to-SQL 系统的基础鲁棒性提供可操作的见解。
## 3 方法
为了系统性地揭示 Text-to-SQL 系统中的潜在漏洞,我们提出了 SAGE,一个旨在自主发现并演化漏洞见解的迭代框架。如图 1 (https://arxiv.org/html/2607.03833#S2.F1) 所示,SAGE 作为一个闭环系统运行,由两个互补模块构成:漏洞发现模块(第 3.2 节 (https://arxiv.org/html/2607.03833#S3.SS2))主动通过假设驱动的扰动探测目标模型;法典演化与管理模块(第 3.3 节 (https://arxiv.org/html/2607.03833#S3.SS3))将验证过的失败抽象化并整合到自我完善的脆弱性法典中。详细的算法流程见算法 1 (https://arxiv.org/html/2607.03833#alg1)。
### 3.1 问题形式化
我们将 Text-to-SQL 范式中的自动漏洞发现问题进行形式化。令 D = {(q_i, s_i, y_i^*)}_i=1^N 表示一个数据集,其中 q_i 是自然语言查询,s_i 是数据库模式,y_i^* 是真实执行结果。目标模型 M_t 在标准条件下对该数据集的样本正确执行,即 Exec(M_t(q_i, s_i)) = y_i^*。这种选择确保了我们的框架后续诱导的任何失败都反映了模型真正的盲点或脆弱性,而非固有的推理能力缺失。
我们的目标是构建并演化一个脆弱性法典 V,以系统性地捕捉 M_t 的潜在故障模式。我们将 SAGE 定义为一个由两个映射函数 ⟨Φ_disc, Φ_evol⟩ 控制的迭代过程,在迭代次数 t = 1, … , T 上运行。
设 V_{t-1} 表示上一迭代的法典状态。在每一步 t 中:
##### 发现 (Φ_disc):
系统综合假设并构建特定的扰动样本来探测 M_t,生成一组原始失败案例 F_t,其中 M_t 暴露了脆弱性:
F_t = Φ_disc(D, V_{t-1}) (1)
##### 演化 (Φ_evol):
这些原始失败被抽象化、压缩并整合到法典中,以生成更新后的状态 V_t:
V_t = Φ_evol(V_{t-1}, F_t) (2)相似文章
从执行结果自举文本到SQL的语义层
介绍GATE(从执行结果中测试后接地)方法,该方法从执行反馈中自举缺失的语义接地,以处理文本到SQL任务中未明确指定的用户短语,持续提升超越强基线。
SAGE:用于 LLM 知识评估的可扩展自动化鲁棒性增强
本文介绍了 SAGE,这是一个用于 LLM 知识评估基准测试的可扩展自动化鲁棒性增强框架。该框架使用经过强化学习微调的小模型,以低于现有方法的成本生成和验证问题变体。
SAGE:一种由LLM驱动的自我反思智能体框架用于欺诈检测
介绍了SAGE,首个端到端的LLM驱动的多智能体框架用于欺诈检测,它使用数据诊断树和具有自然语言梯度的马尔可夫决策过程,在类别不平衡下优化模型。实验表明,在五个数据集上,与基线相比F1有显著提升。
文本到SQL正确性的预测因素:一项选择性预测研究
本文研究了在选择性预测中哪些信号最能预测文本转SQL的正确性。研究发现,来自LLM判断器的基于验证的信号优于黑盒统计信号(如自一致性),并且双提供者集成模型实现了0.82的AUROC,同时具有良好校准的概率。
为什么 Codex Security 不包含 SAST 报告
OpenAI 解释了为什么 Codex Security 刻意避免从 SAST 报告开始,而是直接分析仓库架构并验证发现。该方法解决了核心挑战:最困难的漏洞涉及安全检查是否在整个转换链中实际起作用,而不仅仅是数据流跟踪。