从测试时扩展到可复用记忆:衡量文本到SQL中的结晶化

arXiv cs.CL 论文

摘要

本文引入了“结晶化问题”,用于评估文本到SQL系统中的可复用记忆,表明将经过验证的修正查询存储在每个数据库的库中,可以将BIRD上留出集的首次尝试准确率提高4.34个百分点,捕获按需修复所提供的44.4%的提升空间。受控干预措施识别出数据库特定内容是主要驱动因素。

arXiv:2608.07213v1 公告类型:新 摘要:测试时扩展可以纠正困难的文本到SQL查询,但额外的计算通常在每次回答后被丢弃。系统越来越多地保留经过验证的修复片段,但评估仍然只报告一个端到端分数。这无法区分对重复问题的回放与对未见问题的帮助,也无法识别负责的记忆选择。我们将衡量这种未来价值称为结晶化问题。我们的受控评估保持单次求解器不变,每次只改变一个记忆选择。我们分别衡量回放、跨问题保留以及留出的同数据库迁移。在BIRD上,存储经过验证的修正查询将留出集上的首次尝试准确率提高了4.34个百分点。这一提升捕获了同一问题上按需修复所提供的准确率提升空间的44.4%。受控干预措施识别出数据库特定内容是主要的操作成分。可靠的验证和更广泛的检索覆盖能带来有支持的收益;更丰富的格式和精细的检索器则不能。开源代码、评估工件和复现说明可在 https://github.com/ai-jiaqian/text-to-sql-memory-crystallization 获得。
查看原文
查看缓存全文

缓存时间: 2026/08/10 08:05

# 从测试时扩展到可复用记忆:衡量Text-to-SQL中的结晶化

**来源:** https://arxiv.org/html/2608.07213 ,Yutao Qi Xidian University Xi’an, Shaanxi China, Wenjin Hou Xidian University Xi’an, Shaanxi China, Yuanxi Che Xidian University Xi’an, Shaanxi China and Muning Wen Shanghai Jiao Tong University School of Artificial Intelligence Shanghai China

###### 摘要

测试时扩展能够纠正困难的text-to-SQL查询,但额外的计算通常在每次回答后被丢弃。系统越来越多地保留经过验证的修复片段,然而评估仍然只报告一个端到端的分数。该分数无法区分记忆在重复问题上的回放与对未见问题上的帮助,也无法识别起作用的是哪种记忆选择。我们将对这种未来价值的衡量称为*结晶化问题*(crystallization problem)。我们的受控评估固定单一求解器,并每次只改变一种记忆选择。我们分别衡量回放、跨问题保留以及留出同库迁移。在BIRD上,存储经过验证的纠正查询将留出问题的首次尝试准确率提高了4.34个百分点。这一增益占到同一问题上按需修复所提供的准确率提升空间的44.4%。受控干预实验表明,数据库特定内容是主要的起作用成分。可靠的验证和更广泛的检索覆盖能够带来有支持的增益;而更丰富的格式和更复杂的检索器则不能。开源代码、评估工件和复现说明可在github.com/ai-jiaqian/text-to-sql-memory-crystallization (https://github.com/ai-jiaqian/text-to-sql-memory-crystallization)获取。  
text-to-SQL、测试时扩展、智能体记忆、经验复用、执行反馈、评估方法论  
††copyright:none

## 1. 引言

参见图注。两个并排面板。左侧标题为“Repair, then discard”(修复,然后丢弃):一个问题进入固定的LLM求解器,首次尝试不正确,执行引导的修复循环花费额外计算,纠正后的答案交付给用户,该轮经验被丢弃;淡化的重复显示每个失败的问题都要再次付出这一代价。右侧标题为“Repair, then crystallize”(修复,然后结晶):同一已验证片段被写入一个按数据库划分的记忆库,随后通过两条路径服务:回放(用存储的解决方案再次回答相同问题)和迁移(帮助同一数据库上的新问题在首次尝试时就成功,无需修复循环)。一个徽章报告迁移提升占按需修复提升空间的44.4%。

**图1. 从逐问题修复到可复用记忆。** 左侧:丢弃修复后的片段会让每个未来的失败再次付出修复成本。右侧:已验证片段进入数据库范围记忆库,用于精确查询*回放*和跨问题*迁移*。在BIRD上,迁移占留出按需修复提升空间的44.4%(第5节 (https://arxiv.org/html/2608.07213#S5))。

Text-to-SQL让用户能够用自然语言查询关系数据库(Yu and others,2018 (https://arxiv.org/html/2608.07213#bib.bib3); Li and others,2023b (https://arxiv.org/html/2608.07213#bib.bib2)),而大语言模型已将首次尝试准确率推至很高水平(Pourreza and Rafiei,2023 (https://arxiv.org/html/2608.07213#bib.bib6); Gao and others,2024 (https://arxiv.org/html/2608.07213#bib.bib7); Pourreza and others,2025a (https://arxiv.org/html/2608.07213#bib.bib11); Gao and others,2025 (https://arxiv.org/html/2608.07213#bib.bib16))。首次尝试失败并非终点。额外的推理时计算可以采样更多候选,通过自一致性进行聚合(Wang and others,2023 (https://arxiv.org/html/2608.07213#bib.bib37)),或根据执行反馈修复查询(Wang and others,2025a (https://arxiv.org/html/2608.07213#bib.bib8); Chen and others,2024 (https://arxiv.org/html/2608.07213#bib.bib41); Snellet al.,2024 (https://arxiv.org/html/2608.07213#bib.bib58); Zhang and others,2025b (https://arxiv.org/html/2608.07213#bib.bib59))。在BIRD上,带正确性信号的执行引导修复循环可在三轮修复内将强开源权重模型从约62%提升至约72%。问题在于,这种提升是每个失败问题分别购买的。计算只惠及其花费所对应的问题,修复过程中积累的经验在答案交付后即被丢弃。既然这些经验是用真实计算换来的,一个自然的想法是保留它。纠正一个问题时产生的信息就是一个测试时片段。一旦通过验证,它就变成一张卡片,存储在该数据库的记忆库中。后续问题可以检索相关卡片,而不是从零开始(图1 (https://arxiv.org/html/2608.07213#S1.F1))。这段记忆是否值得,取决于接下来发生的事情。如果同一个修复过的问题再次出现,其卡片可以提供存储的解决方案——*精确查询回放*。如果新问题出现,只有当经验能够跨越问题边界时记忆库才有帮助;我们在留出问题上将其衡量为*迁移*。在这两者之间,我们使用更严格的诊断:移除被修复问题自身的卡片,然后询问剩余卡片是否仍能帮助重新回答该问题。我们称之为*跨问题保留*。回放和迁移分别对应工作负载中的重复问题和新问题;保留则单独衡量跨问题复用经验的能力。重复/新问题的组合决定了构建记忆所花费的计算能否得到回报。

将测试时计算转化为记忆已经是一条实践路线。对于通用LLM智能体,这一思想是明确的:推理策略、解决方案与洞见、工作流和经验教训都从测试时轨迹中提炼为可复用记忆(Ouyang and others,2025 (https://arxiv.org/html/2608.07213#bib.bib56); Suzgun and others,2026 (https://arxiv.org/html/2608.07213#bib.bib50); Wang and others,2025b (https://arxiv.org/html/2608.07213#bib.bib49); Zhao and others,2024 (https://arxiv.org/html/2608.07213#bib.bib45))。自进化text-to-SQL系统可以视为同一路线在该任务上的实例化。它们保留纠正后的查询和范例(Yang et al.,2026 (https://arxiv.org/html/2608.07213#bib.bib17); Chu et al.,2024 (https://arxiv.org/html/2608.07213#bib.bib21))、自我纠正指南和优化提示(Askari and others,2025 (https://arxiv.org/html/2608.07213#bib.bib23); Chen et al.,2026 (https://arxiv.org/html/2608.07213#bib.bib19))、语义智能体记忆(Biswal and others,2026 (https://arxiv.org/html/2608.07213#bib.bib25); Wang and others,2026 (https://arxiv.org/html/2608.07213#bib.bib27))以及蒸馏得到的领域知识(Jiao and others,2025 (https://arxiv.org/html/2608.07213#bib.bib18); Baek and others,2025 (https://arxiv.org/html/2608.07213#bib.bib22)),并且一致报告端到端增益。记忆是否有用已不再是问题。仍然需要问的是它**如何**起作用,而现有评估对此几乎保持沉默。在这一研究路线中,循环几乎总是作为一个整体被评分,只给出一个端到端数字。该数字混淆了两件不同的事情。一是增益去向:一个重复问题被廉价地再次回答,与记忆帮助了一个从未见过的问题,二者无法区分。二是增益来源:片段的收集、验证、存储和检索方式往往与周边管线一起变化,因此无法将功劳归于任何单一选择。智能体记忆社区自己也警告,一个端到端分数掩盖了记忆的实际行为(Hu et al.,2025 (https://arxiv.org/html/2608.07213#bib.bib64); Gao and others,2026 (https://arxiv.org/html/2608.07213#bib.bib53); Shao and others,2026 (https://arxiv.org/html/2608.07213#bib.bib51)),而那里的归因往往依赖于相对较弱的信号,如基于LLM的判断。在实践中,运营者无法判断收集片段是否会对某个工作负载产生回报,研究者也无法判断哪个组件使其产生回报。这就是*结晶化问题*:经过验证的测试时片段如何为同一数据库上的未来问题创造价值?我们的受控评估将价值出现的位置与在固定求解器下产生该价值的记忆选择分离开来,沿用了那些隔离演示成分以分离观测增益的研究(Min et al.,2022 (https://arxiv.org/html/2608.07213#bib.bib43))。

我们提出三个问题。**RQ1** 衡量通过回放、跨问题保留和留出迁移分别出现多少价值,并将迁移与同一问题上的修复余量进行比较。**RQ2** 询问什么信息承载了迁移:通用示例、对齐的问题–SQL对,还是对目标数据库的暴露。**RQ3** 测试收集、验证、格式化和检索片段时的哪些选择会实质性地改变结果。执行引导修复在我们主要的实例化中提供片段。我们并不假设修复后的片段比其他片段迁移得更好;RQ3恰恰测试这种可能性。回放和保留在收集问题上评估,而迁移在来自同一数据库的留出问题上评估。**CR** 是留出迁移提升除以同一问题上的按需修复余量。它是一个描述性比率,而非概率。卡片写入器永远不会看到金标准SQL(第3.2节 (https://arxiv.org/html/2608.07213#S3.SS2))。主要比较使用三组配对种子,并考虑跨数据库和问题的变异。图2 (https://arxiv.org/html/2608.07213#S3.F2) 总结了该协议。

在BIRD上,一个经过验证、按数据库范围划分、逐字存储纠正后片段的记忆库在所有三种设定下都能产生价值。在经验证修复的收集问题中,它几乎可以回放所有存储的答案,并迁移到同一数据库上的新问题:留出首次尝试准确率提高了4.34个百分点,占同一问题上所测按需修复余量的44.4%。机制干预表明,迁移主要由看到过目标数据库来承载。局部卡片暴露了有用的标识符、值、连接和查询结构,即使它们的问题–SQL配对被打乱也是如此。可靠的验证和广泛的检索覆盖产生清晰增益。更丰富的卡片格式、更精巧的检索器和修复特定内容并未显示出统计上支持的优势。我们的贡献是:

- **将结晶化问题形式化**为一个可操作的度量问题。CR在相同求解器、数据划分和修复预算下比较留出记忆提升与按需修复余量。
- **分离度量未来价值**:精确查询回放、跨问题保留和留出同库迁移分别评估,因此报告的增益可对应到具体的未来使用场景。
- **受控归因**:在固定求解器和每次只改变一个选择的配对比较下,我们直接检验关于迁移的三种解释,而非比较捆绑式系统。

## 2. 相关工作

#### 基于LLM的Text-to-SQL与执行引导修复。

LLM管道推动了text-to-SQL基准的当前进展(Yu and others,2018 (https://arxiv.org/html/2608.07213#bib.bib3); Li and others,2023b (https://arxiv.org/html/2608.07213#bib.bib2)),其机制包括问题分解(Pourreza and Rafiei,2023 (https://arxiv.org/html/2608.07213#bib.bib6))、演示选择(Gao and others,2024 (https://arxiv.org/html/2608.07213#bib.bib7))、模式链接(Li and others,2023a (https://arxiv.org/html/2608.07213#bib.bib9); Talaei and others,2024 (https://arxiv.org/html/2608.07213#bib.bib12))和多候选选择(Ren and others,2024 (https://arxiv.org/html/2608.07213#bib.bib10); Li et al.,2025 (https://arxiv.org/html/2608.07213#bib.bib67))。最强的模型越来越多地放宽模式链接步骤(Maamari et al.,2024 (https://arxiv.org/html/2608.07213#bib.bib66))。由于候选查询可以执行,第二条研究路线将改进基于数据库本身:从执行错误中进行多智能体修复(Wang and others,2025a (https://arxiv.org/html/2608.07213#bib.bib8))、基于执行结果的自调试(Chen and others,2024 (https://arxiv.org/html/2608.07213#bib.bib41); Madaan and others,2023 (https://arxiv.org/html/2608.07213#bib.bib42))以及执行引导的模式细化(Wang et al.,2026 (https://arxiv.org/html/2608.07213#bib.bib1))。这些方法在(Snellet al.,2024 (https://arxiv.org/html/2608.07213#bib.bib58); Zhang and others,2025b (https://arxiv.org/html/2608.07213#bib.bib59))的意义上属于顺序测试时扩展。没有外部信号时,内在的自我纠正并不可靠(Huang et al.,2024 (https://arxiv.org/html/2608.07213#bib.bib60))。这一研究路线的共性是:计算按问题花费,修复过程中发现的证据在查询输出后被丢弃。我们的研究正是从这个丢弃点开始。

#### 自进化text-to-SQL

一个快速增长的路线保留推理过程中发现的内容,形式多种多样:纠正后的查询和范例(Yang et al.,2026 (https://arxiv.org/html/2608.07213#bib.bib17); Chu et al.,2024 (https://arxiv.org/html/2608.07213#bib.bib21))、自我纠正指南和优化提示(Askari and others,2025 (https://arxiv.org/html/2608.07213#bib.bib23); Chen et al.,2026 (https://arxiv.org/html/2608.07213#bib.bib19))、语义或双层智能体记忆(Biswal and others,2026 (https://arxiv.org/html/2608.07213#bib.bib25); Wang and others,2026 (https://arxiv.org/html/2608.07213#bib.bib27))以及蒸馏或精选的领域知识(Jiao and others,2025 (https://arxiv.org/html/2608.07213#bib.bib18); Baek and others,2025 (https://arxiv.org/html/2608.07213#bib.bib22); Yun and Lee,2025 (https://arxiv.org/html/2608.07213#bib.bib26); Hong and others,2024 (https://arxiv.org/html/2608.07213#bib.bib29); Agarwal et al.,2026 (https://arxiv.org/html/2608.07213#bib.bib57); Chen et al.,2025 (https://arxiv.org/html/2608.07213#bib.bib24))。其他系统持续从人类反馈中获取知识(Cook et al.,2025 (https://arxiv.org/html/2608.07213#bib.bib28))或运行自主进化循环(Borthwick and Ash,2026 (https://arxiv.org/html/2608.07213#bib.bib20))。这些系统积累经验并报告一致的端到端增益,这直接激发了我们的研究。然而,它们的评估将整个循环视为一个捆绑物:重复问题上的增益

相似文章

通过SFT和DPO学习Text-to-SQL的推理时机

arXiv cs.CL

提出了AutoThinkSQL,一个将自动思考机制集成到Text-to-SQL的SFT和DPO中的框架,使模型能够动态跳过简单查询的推理,并对复杂查询调用深度CoT,在Spider和BIRD基准测试上取得提升,同时将输出token减少24.6%,延迟减少17.1%。