文本到SQL正确性的预测因素:一项选择性预测研究
摘要
本文研究了在选择性预测中哪些信号最能预测文本转SQL的正确性。研究发现,来自LLM判断器的基于验证的信号优于黑盒统计信号(如自一致性),并且双提供者集成模型实现了0.82的AUROC,同时具有良好校准的概率。
arXiv:2607.06799v1 公告类型:新
摘要:评估AI生成的SQL查询的不确定性需要估计查询是否正确,这里的正确意味着它执行的结果与人类编写的参考结果相同。我们研究了哪些信号能够预测在困难的多表文本转SQL任务中的正确性,使用AUROC来衡量每个信号将正确查询排在错误查询之上的能力。在BIRD和Spider数据集上,黑盒信号(如字符串自一致性、结构自一致性、执行自一致性、模式相关性分数以及查询可执行性)的AUROC大约在0.61到0.68之间,其中字符串自一致性最强(0.675);白盒对数概率类似(0.67)。突破这一上限的信号是基于验证的:LLM判断器的得分从0.72(GPT-4o-mini)到0.78(Claude)。不同提供商的判断器会犯不同的错误,因此双提供者集成模型的AUROC达到0.82,概率校准良好(预期校准误差0.03),并支持有用的弃权边界(例如,在24%的选择性风险下回答27%的问题),而自一致性则无法提供有效的低风险子集。这一模式在两个基准、两个生成器和两个判断器提供商上保持一致。我们还研究了是否可以训练验证器。微调后的验证器(包括编码器和生成式)在分布内可达到约0.77至0.79的AUROC,但在未见过的模式上降至约0.66;扩展到7B参数、增加模式多样性、蒸馏强判断器的推理过程以及跨基准训练均未能缩小这一差距。跨模式迁移似乎更多地依赖于模型规模和推理能力,而非微调。在实践中,文本转SQL的正确性不确定性存在于基于推理的信号中:微调后的验证器是一个良好的域内工具,但目前能够跨模式泛化的验证器意味着需要使用一个大型冻结推理模型。
查看缓存全文
缓存时间: 2026/07/09 07:44
# 文本到SQL中正确性预测的奥秘?一项选择性预测研究 来源: https://arxiv.org/html/2607.06799 ###### 摘要 评估AI生成的SQL查询的不确定性,需要估计其正确性——这里的“正确”是指该查询执行后得到的结果与人类编写的参考查询一致。我们研究哪些信号能够预测复杂多表文本到SQL任务中正确查询的排序能力,使用AUROC来比较不同方法将正确查询排在错误查询之上的效果。基于BIRD和Spider SQL查询数据集,黑盒统计信号(如字符串、结构和执行自洽性)、模式相关性评分以及查询可执行性等信号的AUROC值大约在0.61到0.68之间,其中字符串自洽性最强,达到0.675。白盒对数概率也类似(0.67)。能够突破这一天花板的是基于验证的信号,LLM评判器的得分从0.72(GPT-4o-mini)到0.78(Claude)不等。来自不同提供商的评判器会犯不同的错误,因此双提供商集成方法的AUROC达到0.82,且概率校准良好(期望校准误差0.03),并支持有用的放弃边界(例如,在24%的选择性风险下回答27%的问题),而自洽性无法提供任何有效的低风险子集。该模式在两个基准(BIRD和Spider)、两个生成器以及两个评判器提供商上保持一致。我们还探讨了是否能够训练一个验证器。微调后的验证器(包括编码器和生成式)在分布内能达到约0.77–0.79的AUROC,但在未见过的模式上下降至约0.66;而扩展到7B参数、增加模式多样性、蒸馏强评判器的推理过程以及跨基准训练都未能弥合这一差距。跨模式迁移似乎更多地与模型规模和推理能力相关,而非微调。实际上,文本到SQL的正确性不确定性依赖于基于推理的信号,这意味着微调验证器是好的领域内工具,而能够跨模式泛化的验证器目前意味着一个大型冻结推理模型。 ## 1 引言 文本到SQL系统将自然语言问题转化为可在数据库上运行的SQL查询。这类系统越来越多地用于错误查询代价高昂的场景,因此系统不仅需要知道如何回答,还需要知道何时应该拒绝回答。知道何时拒绝需要系统对生成的每个查询估计其正确的可能性。我们使用标准基准意义上的“正确”:生成的查询在针对数据库执行后,返回与同一问题的人类编写参考查询相同的结果。预测正确性以便系统选择回答或放弃,这就是选择性预测问题,也是本文的重点。 大多数文本到SQL的不确定性量化(UQ)工作都是从模型自身输出的统计数据中读取信息,无需额外模型或标签。最明显的例子是自洽性:为同一问题生成多个查询,并测量它们的一致程度,前提是自信的模型会重复自己(Wang等人,2023)。相关信号包括样本含义的熵(Kuhn等人,2023;Farquhar等人,2024)以及特定查询结构出现的频率。我们称这些为“黑盒统计”信号,因为它们只关注样本间的一致性,而不关注查询的逻辑是否真正回答了问题。另一种方法是验证:将问题、模式和候选查询展示给另一个模型,并让其判断查询是否正确(也称为LLM作为评判器)。我们提出一个直接问题:在复杂的文本到SQL任务中,这些信号中哪一个真正预测了正确性,以及预测程度如何? 为了回答这个问题,我们通过每个信号对正确查询与错误查询的排序能力来评分,使用ROC曲线下面积(AUROC)来衡量,即随机选取的正确查询得分高于随机选取的错误查询的概率,其中0.5为随机水平,1.0为完美排序。我们为每个比较附加配对自助法置信区间,这样两个信号之间的差异可以被解读为显著或不显著。我们的贡献在于,这种基于执行结果的信号比较为实践者提供了可用信号,以及这对部署意味着什么。 1. 黑盒统计UQ的正确性天花板(大约0.61–0.68 AUROC),字符串、结构和执行自洽性、模式相关性评分以及(与最强信号相比后)白盒对数概率(模型为其生成的查询给出的自身概率)都处于这一范围。 2. 验证突破了这一天花板,其自助法区间排除零,并在两个基准、两个生成器和两个评判器提供商上保持一致。不同提供商的评判器会犯不同的错误,它们的集成是目前我们获得的最佳且校准最好的正确性信号(0.82 AUROC,0.03校准误差)。 3. 自洽性基线无法匹配的选择性预测边界。 4. 对训练验证器的研究,即在标记示例上微调。它们在训练中见过的数据库上表现良好,但无法迁移(在训练期间从未见过的数据库上继续有效),这区分了领域内验证器和通用验证器。 我们的范围是选择性预测而非生成。我们量化和校准正确性以决定是否回答或放弃;我们不会迭代改进查询,这与下面讨论的自纠正代理形成对比。 ## 2 相关工作 与我们在此尝试的目标相似的相关工作包括:自洽性和基于采样的UQ(Wang等人,2023)、通过含义聚类的语义熵(Kuhn等人,2023;Farquhar等人,2024)、语言化置信度、共形和选择性生成(Geifman & El-Yaniv, 2017;Angelopoulos等人, 2021, 2023)、子句Platt缩放(Ramachandran & Sarawagi, 2024)以及基于模式链接分支点的共形放弃(Somov等人, 2025)。模式链接也使用编码器端图模型进行了研究(Wang等人, 2020;Cao等人, 2021)。LLM作为评判器广泛用于开放式评估。这里我们专门评估其作为校准的正确性预测器用于SQL,对照黑盒基线,并测试评判是否可以被训练以及是否能够迁移。我们使用的数据来自Spider(Yu等人, 2018)和BIRD(Li等人, 2023)基准,并参考Spider 2.0(Lei等人, 2025)作为背景。 一个密切相关的工作是构建自纠正或代理式文本到SQL系统,其中模型生成查询,然后批评或执行它并重新生成,通常经过多轮(Shinn等人, 2023;Chen等人, 2024;Pourreza & Rafiei, 2023;Wang等人, 2024)。这项工作与我们有一个共同组件,因为这种循环中的批评者与我们研究的LLM评判器非常相似,但目标不同。自纠正代理使用批评者驱动迭代以获得更准确的查询,并报告最终任务准确率。我们不重新生成,而是研究信号预测正确性的程度,以便系统回答或放弃,我们报告校准和风险覆盖率而非准确率提升。这两者是互补的,因为即使系统自我纠正后,它仍然报告一个最终查询,该查询仍然需要一个校准的估计来判断是否可信。我们直接检查了这一点(第4.3节),发现一轮自纠正几乎不改变准确率,并产生严重失准的置信度,因此它不能替代校准验证器。典型的自纠正也依赖于执行反馈,而我们的验证器在不执行候选查询的情况下,基于问题、模式和SQL进行推理,我们发现可执行性本身对于正确性没有信息量。 ## 3 设置 基准与生成。我们使用BIRD(Li等人, 2023),它包含带有数据字典和外部知识“证据”的数据库。我们使用GPT-4o-mini(每个问题K=8个样本,温度0.7,提示中包含模式和证据)为固定切片生成SQL,该切片包含来自8个数据库的800个问题。切片在分析之前已固定,不依赖于模型输出。它按照基准顺序从我们本地保存的8个数据库文件中选取问题,每个数据库有上限,总计800个。我们针对真实数据库执行每个生成的样本,当查询的结果集与参考查询匹配时,标记为“正确”,这是这些基准的标准执行正确性标准。在整个过程中,我们评分的查询是模态查询,即一个问题的样本中最常产生的那个。模态查询执行准确率为0.451,这是一个困难的环境,为UQ提供了充足的空间。为了广度,我们还使用了第二个生成器GPT-4.1-mini(准确率0.522)和第二个基准Spider(Yu等人, 2018)的多表开发查询(490个问题,20个数据库),以相同方式生成和执行。 信号。黑盒统计信号包括:字符串自洽性(样本中相同查询的最大聚类大小)、结构自洽性(按规范查询结构聚类)、执行自洽性(按结果集聚类)、模式相关性评分(问题与查询使用的表和列之间的平均嵌入相似度)以及查询可执行性(查询是否运行并返回行)。逻辑感知信号包括模态查询的平均序列对数概率(白盒)和一个LLM验证器,它看到问题、证据、模式和候选SQL。验证器是GPT-4o-mini和GPT-4o,它们从YES/NO第一个令牌logits报告P(正确),以及Claude-Sonnet-4.6,一个独立提供商的评判器,它报告一个语言化的0-100概率(Anthropic不暴露令牌logprobs)。所有评判器看到相同的输入和相同的顺序;确切的提示在附录B中。 指标。我们报告用于正确性的抗并列AUROC,并附带2000样本配对自助法置信区间用于AUROC差异。我们还通过交叉拟合逻辑回归组合信号,这意味着组合器在一个划分上拟合,在另一个划分上评分,因此它从未见过自己的测试数据。对于校准,我们报告期望校准误差(ECE),即读取为概率的得分与该得分处经验正确比例之间的平均差距(Guo等人, 2017)。对于放弃,我们报告风险-覆盖率边界,即已回答问题中的选择性风险(错误率)作为覆盖率(已回答比例)的函数,使用经验边界和分布自由(网格上Bonferroni,δ=0.1)证书(Angelopoulos等人, 2021)。所有模型输出已缓存,API实验成本低廉。 ## 4 结果 ### 4.1 黑盒正确性天花板 表1显示了不需要额外模型的黑盒信号的结果。结果表明它们不足以高比率区分正确SQL和错误SQL。黑盒统计信号占据一个狭窄的波段,大约0.61–0.68 AUROC,其中字符串自洽性最强达到0.675。结构自洽性和执行自洽性较弱,可执行性本质上是随机水平:错误查询通常也能成功运行并返回行。 表1:BIRD切片上单个信号的正确性预测。基于采样和结构的信号低于第4.2节报告的验证器结果。在这个更困难的多表环境中,白盒对数概率也不足够。其AUROC为0.669,略低于字符串自洽性,配对差异小且不显著:-0.006,95% CI [-0.028, +0.017]。这是一个有用的负面结果。在早期的单表实验中,对数概率有助于分离自信错误的统一样本。在BIRD上,错误涉及更复杂的推理,对数概率提供的正确性信号并不比采样一致性更好。该结果表明,对于不直接推理SQL是否回答问题的信号存在一个天花板。 ### 4.2 验证突破天花板 接下来我们测试能够检查候选查询本身的信号。验证器被展示问题、证据、模式和生成的SQL,并被询问SQL是否正确回答了问题。与自洽性或对数概率不同,这个信号原则上可以评估查询的逻辑,决定聚合是否合适,过滤条件是否匹配问题的措辞,分组是否正确,以及查询是否计算了所需的数量。 表2显示验证是第一个明显突破黑盒天花板的信号。所有三个LLM验证器都超过了字符串自洽性,且配对自助法区间排除了零。GPT-4o-mini提供了适度的提升,而更强的GPT-4o和Claude评判器提供了更大的提升。 表2:执行正确性的验证器分数。配对差异比较每个单个信号与字符串自洽性。提升来自验证器本身,而非与自洽性的通用组合。使用GPT-4o加上字符串自洽性的交叉拟合逻辑模型达到0.754 AUROC,低于仅GPT-4o的0.770。换句话说,一旦有了强大的验证器,采样一致性信号贡献很小。 ### 4.3 鲁棒性:跨提供商评判器、第二个生成器和自纠正 一个自然的担忧是,与生成器来自同一模型家族的验证器可能只是共享生成器的偏差。为了测试这一点,我们增加了一个独立提供商的评判器。Claude-Sonnet-4.6评判GPT-4o-mini的SQL,在本实验中是最强的单个验证器,AUROC为0.776,而GPT-4o为0.770。更重要的是,GPT-4o和Claude的得分不是冗余的,它们的相关性仅为r=0.43,表明它们犯的错误不同。 这种模式并非特定于GPT-4o-mini作为生成器。我们用GPT-4.1-mini(在该任务上更强)重新生成相同的BIRD切片,并评判得到的模态查询。
相似文章
自我判断混淆下正确性探测的诊断
本文研究了神经网络探针在预测语言模型输出正确性时,是否真正捕捉了客观正确性还是模型自身的自我判断。通过构造两者不一致的冲突案例,作者发现可转移的方向主要保持了自我判断的极性,从而挑战了正确性读数的解释。
超越静态规则:Text-to-SQL 中潜在漏洞的自动发现
提出 SAGE 框架,通过生成漏洞假设并迭代验证,自动揭示基于 LLM 的 Text-to-SQL 生成中的潜在失效模式。实验表明,SAGE 揭示了模型的显著脆弱性,且发现的模式可在模型间迁移,初步微调显示出有前景的修复效果。
通过自增强微调在Text-to-SQL中整合推理与泛化
本文提出CoTE-SQL,一种面向text-to-SQL的自增强微调框架,它整合了自推理轨迹、结构化思维链提示和执行反馈,在Spider和Bird基准上取得了最先进的性能。
以部署为中心的评估:预测临床LLM系统中的查询级拒绝风险
本文对集成在电子健康记录中的LLM系统进行了以部署为中心的评估,训练了一个分类器,利用提供者类型和科室等响应前上下文来预测查询级拒绝风险,在4.5个月的反馈中实现了0.719的AUROC。
使用结果奖励模型进行Text-to-SQL的测试时验证
本文提出GradeSQL框架,使用结果奖励模型(ORM)进行Text-to-SQL的测试时验证,在BIRD和Spider基准上分别比基于执行的Best-of-N方法提升4.33%和2.10%。