使用结果奖励模型进行Text-to-SQL的测试时验证
摘要
本文提出GradeSQL框架,使用结果奖励模型(ORM)进行Text-to-SQL的测试时验证,在BIRD和Spider基准上分别比基于执行的Best-of-N方法提升4.33%和2.10%。
查看缓存全文
缓存时间: 2026/07/01 05:31
# 测试时验证:通过结果奖励模型实现Text-to-SQL 来源: https://arxiv.org/abs/2606.30851 查看 PDF (https://arxiv.org/pdf/2606.30851) > 摘要:提高大型语言模型(LLMs)在推理时的可靠性,是Text-to-SQL等结构化推理任务中的核心挑战。常见的测试时推理策略,包括Best-of-N采样和多数投票法,依赖执行成功或输出频率等启发式信号,这些信号在候选输出之间提供的语义区分能力有限。在本工作中,我们研究了结果奖励模型(ORMs)作为Text-to-SQL测试时验证的语义评分函数。虽然ORMs此前已在测试时扩展和对齐方面得到探索,但它们应用于结构化查询生成仍研究不足。我们提出了GradeSQL,一个可扩展的框架,通过自动生成候选和执行标签来训练特定任务的ORMs,从而无需手动标注即可训练验证器。我们将ORMs集成到基于验证的Best-of-N流水线中,并在BIRD和Spider基准上评估了多个开源LLM系列。基于ORM的选择始终优于基于执行的Best-of-N和多数投票法,在BIRD上提升高达+4.33%,在Spider上提升高达+2.10%。我们进一步表明,ORMs在更大的候选集上能有效扩展,并在复杂查询上带来更强的改进。总体而言,我们的结果证明,基于ORM的验证为Text-to-SQL提供了一种简单、有效且可扩展的替代方案,可替代启发式的测试时选择策略。代码、数据集和模型均已公开。 ## 提交历史 来自: Gaetano Rossiello [查看电子邮件 (https://arxiv.org/show-email/f1527b76/2606.30851)] **\[v1\]**2026年6月29日星期一 19:31:39 UTC (263 KB)
相似文章
Progress-SQL:通过渐进式奖励改进文本到SQL的强化学习
Progress-SQL 提出了一种多轮强化学习框架,采用渐进式奖励用于文本到SQL,利用 Oracle 引导的诊断树提供密集的奖励信号,并在 BIRD 和 Spider 等基准上改进 SQL 查询生成。
将任务专业知识融入强化学习,实现在text-to-SQL上的最佳性能(18分钟阅读)
本文描述了一种带有可验证奖励的强化学习方法,用于微调AI模型以进行text-to-SQL任务,在BIRD基准上达到了无需辅助结构的人类水平准确率。
通过自增强微调在Text-to-SQL中整合推理与泛化
本文提出CoTE-SQL,一种面向text-to-SQL的自增强微调框架,它整合了自推理轨迹、结构化思维链提示和执行反馈,在Spider和Bird基准上取得了最先进的性能。
TraceSQL:无参考文本到SQL验证的可追溯可回答性估计
该论文提出了TraceSQL,一个用于文本到SQL系统的轻量级可追溯验证模型,它使用显式诊断特征来估计无参考查询的可回答性,在BIRD基准测试上相比现有基线实现了性能提升。
R^3-SQL: Ranking Reward and Resampling for Text-to-SQL
# Paper page - R^3-SQL: Ranking Reward and Resampling for Text-to-SQL Source: [https://huggingface.co/papers/2604.25325](https://huggingface.co/papers/2604.25325) ## Abstract R$^3$\-SQL addresses inconsistencies in scoring functionally equivalent SQL queries and improves candidate recall through unified reward ranking and agentic resampling techniques\. Modern[Text\-to\-SQL](https://huggingface.co/papers?q=Text-to-SQL)systems generate multiple candidate[SQL queries](https://huggingface.co/papers