使用结果奖励模型进行Text-to-SQL的测试时验证

arXiv cs.CL 论文

摘要

本文提出GradeSQL框架,使用结果奖励模型(ORM)进行Text-to-SQL的测试时验证,在BIRD和Spider基准上分别比基于执行的Best-of-N方法提升4.33%和2.10%。

arXiv:2606.30851v1 公告类型:新 摘要:在推理时提高大语言模型(LLM)的可靠性是结构化推理任务(如Text-to-SQL)中的核心挑战。常见的测试时推理策略,包括Best-of-N采样和多数投票法,依赖于执行成功或输出频率等启发式信号,这些信号对候选输出提供的语义区分能力有限。本文研究结果奖励模型(ORM)作为Text-to-SQL测试时验证的学到的语义评分函数。虽然ORM先前已被探索用于测试时扩展和对齐,但它们在结构化查询生成中的应用仍未得到充分探索。我们提出了GradeSQL,一个可扩展的框架,通过自动候选生成和基于执行的标注来训练特定任务的ORM,从而无需人工标注即可训练验证器。我们将ORM集成到验证驱动的Best-of-N流水线中,并在BIRD和Spider基准上对多个开源LLM家族进行了评估。基于ORM的选择始终优于基于执行的Best-of-N和多数投票法,在BIRD上最高提升+4.33%,在Spider上提升+2.10%。我们进一步表明,ORM可以有效扩展到更大的候选集,并在复杂查询上带来更强的改进。总体而言,我们的结果表明,基于ORM的验证为Text-to-SQL提供了一种简单、有效且可扩展的替代方案,替代了启发式的测试时选择策略。代码、数据集和模型均已公开。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:31

# 测试时验证:通过结果奖励模型实现Text-to-SQL
来源: https://arxiv.org/abs/2606.30851
查看 PDF (https://arxiv.org/pdf/2606.30851)

> 摘要:提高大型语言模型(LLMs)在推理时的可靠性,是Text-to-SQL等结构化推理任务中的核心挑战。常见的测试时推理策略,包括Best-of-N采样和多数投票法,依赖执行成功或输出频率等启发式信号,这些信号在候选输出之间提供的语义区分能力有限。在本工作中,我们研究了结果奖励模型(ORMs)作为Text-to-SQL测试时验证的语义评分函数。虽然ORMs此前已在测试时扩展和对齐方面得到探索,但它们应用于结构化查询生成仍研究不足。我们提出了GradeSQL,一个可扩展的框架,通过自动生成候选和执行标签来训练特定任务的ORMs,从而无需手动标注即可训练验证器。我们将ORMs集成到基于验证的Best-of-N流水线中,并在BIRD和Spider基准上评估了多个开源LLM系列。基于ORM的选择始终优于基于执行的Best-of-N和多数投票法,在BIRD上提升高达+4.33%,在Spider上提升高达+2.10%。我们进一步表明,ORMs在更大的候选集上能有效扩展,并在复杂查询上带来更强的改进。总体而言,我们的结果证明,基于ORM的验证为Text-to-SQL提供了一种简单、有效且可扩展的替代方案,可替代启发式的测试时选择策略。代码、数据集和模型均已公开。

## 提交历史

来自: Gaetano Rossiello [查看电子邮件 (https://arxiv.org/show-email/f1527b76/2606.30851)] **\[v1\]**2026年6月29日星期一 19:31:39 UTC (263 KB)

相似文章

R^3-SQL: Ranking Reward and Resampling for Text-to-SQL

Hugging Face Daily Papers

# Paper page - R^3-SQL: Ranking Reward and Resampling for Text-to-SQL Source: [https://huggingface.co/papers/2604.25325](https://huggingface.co/papers/2604.25325) ## Abstract R$^3$\-SQL addresses inconsistencies in scoring functionally equivalent SQL queries and improves candidate recall through unified reward ranking and agentic resampling techniques\. Modern[Text\-to\-SQL](https://huggingface.co/papers?q=Text-to-SQL)systems generate multiple candidate[SQL queries](https://huggingface.co/papers