学习检索:面向文本到SQL智能体的双层长期记忆

arXiv cs.CL 论文

摘要

本文提出了MERIT,一种面向交互式文本到SQL智能体的动态多时域记忆检索框架,它使用情节级别和回合级别的记忆,并通过强化学习以及用于密集奖励的过程奖励模型优化的学习检索策略。在BIRD-Interact和Spider2-Snow上的实验表明,MERIT在成功率上优于静态和单时域动态基线,同时需要更少的交互轮次。

arXiv:2606.00547v1 公告类型:新 摘要:交互式文本到SQL智能体通过多轮交互解决数据库任务,涉及模式探索、查询执行、反馈解释和决策修订。长期记忆帮助智能体重用过去的经验,但现有的检索方法仍然有限。静态方法依赖固定的相似性启发式,无法优化下游效用;而动态方法通常从稀疏的最终结果中学习,并在单一决策视野下检索记忆。当记忆的有用性在不同交互阶段发生变化时,这种方法是不够的,因为对于初始规划有用的记忆可能与局部、状态条件化执行所需的记忆不同。我们提出了MERIT,一种动态多时域记忆检索框架。MERIT维护情节级别的记忆以提供全局策略指导,以及回合级别的记忆以支持局部决策。两个级别都使用通过强化学习优化的学习检索策略。为了在缺乏中间监督的情况下训练回合级别检索,MERIT使用轻量级过程奖励模型为局部记忆选择提供密集的代理奖励。在BIRD-Interact上的实验表明,MERIT在成功率上优于无记忆、静态检索和动态检索基线,同时减少了平均交互轮次。在Spider2-Snow上的迁移结果进一步显示出积极的跨基准迁移,无需特定基准调优。这些结果表明,多时域检索改善了交互式文本到SQL智能体中的经验重用。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:37

# 面向Text-to-SQL智能体的双层长期记忆
来源:https://arxiv.org/html/2606.00547
Yibo Wang¹ Nikki Lijing Kuang² Philip S\. Yu¹ Zhewei Yao² Yuxiong He²  
¹伊利诺伊大学芝加哥分校  
²Snowflake AI Research  
\{ywang633, psyu\}@uic\.edu \{nikki\.kuang, zhewei\.yao, yuxiong\.he\}@snowflake\.com

###### 摘要

交互式Text-to-SQL智能体通过多轮交互(包括模式探索、查询执行、反馈解读和决策修正)来完成数据库任务。长期记忆有助于智能体重用过往经验,但现有检索方法仍有局限。静态方法依赖固定的相似性启发式规则,无法优化下游效用;动态方法通常从稀疏的最终结果中学习,并在单一决策层级上检索记忆。当记忆的有用性随交互阶段变化时(例如,对初始规划有用的记忆可能不同于对局部、状态依赖的执行所需的记忆),这种局限性尤为突出。本文提出MERIT,一个动态的多层级记忆检索框架。MERIT维护用于全局策略引导的回合级记忆和用于局部决策支持的轮次级记忆。两个层级均使用经过强化学习优化的学习型检索策略。为在有限中间监督下训练轮次检索,MERIT采用轻量级过程奖励模型(PRM)为局部记忆选择提供密集的代理奖励。在BIRD-Interact上的实验表明,MERIT在成功率上优于无记忆、静态检索和动态检索基线,同时减少了平均交互轮数。在Spider2-Snow上的迁移结果进一步显示,无需基准特定调优即可实现正面的跨基准迁移。这些结果表明,多层级检索能够提升交互式Text-to-SQL智能体的经验复用效率。

## 学习检索:面向Text-to-SQL智能体的双层长期记忆

Yibo Wang¹ Nikki Lijing Kuang² Philip S\. Yu¹ Zhewei Yao² Yuxiong He²  
¹伊利诺伊大学芝加哥分校  
²Snowflake AI Research  
\{ywang633, psyu\}@uic\.edu \{nikki\.kuang, zhewei\.yao, yuxiong\.he\}@snowflake\.com

## 1 引言

参考标题 (a) MERIT的概念概览。  
参考标题 (b) 与基线的性能比较。

图1: MERIT的概念概览与性能优势。(a) MERIT通过将记忆解耦为轮次级(全局策略)和轮次级(局部提示)实现层级感知的检索,并使用PRM为轮次级策略学习提供密集奖励。(b) MERIT在成功率上优于静态和单层级动态基线,同时需要更少的交互轮数。

大型语言模型(LLMs)越来越多地被部署为多步交互智能体,通过行动、观察和优化行为来解决复杂任务 [Li, 2025; Mohammadi et al., 2025; Xu et al., 2025; Yuan et al., 2025]。在Text-to-SQL中,这种转变将任务推向了单次语义解析之外。智能体不再是一步生成SQL,而是可能需要检查模式、执行候选SQL查询、提出澄清性问题、观察反馈并随时间修正计划。因此,成功不仅取决于生成有效的最终查询,还取决于在不断变化的上下文中做出可靠的中间决策 [Wang et al., 2025b; Shao et al., 2025]。

长期记忆为改进这类决策提供了自然的机制。交互式Text-to-SQL任务通常具有重复出现的结构和解决方案模式,包括连接模板、聚合逻辑、澄清策略和调试例程。复用这些经验可以帮助智能体避免冗余探索,并在新的交互中做出明智决策。然而,现有的记忆增强方法通常依赖于静态相似性启发规则 [Maharana et al., 2024; Sun et al., 2026; Salama et al., 2025; Yan et al., 2025; Kweon et al., 2025],例如密集嵌入相似度、词汇匹配或手工设计的模式启发规则。这些启发规则有助于找到相关候选,但并非直接优化检索到的记忆是否能改善下一步决策。

最近的动态框架通过从下游反馈中学习记忆选择来解决这一局限。例如,Memento [Zhou et al., 2025] 和 MemRL [Zhang et al., 2026] 基于最终结果更新检索策略或记忆效用。然而,这些方法主要在回合级进行检索,基于初始请求选择完整轨迹并从稀疏的终端奖励中学习。这与交互式Text-to-SQL不匹配,因为智能体的状态会随着模式探索、查询执行、观察和计划修正而演变。因此,检索应与决策层级匹配。例如,对初始规划有用的轨迹在发生SQL错误后可能不再有帮助,此时局部调试模式更为相关。此外,最终的成功或失败信号对于确定哪个记忆在特定中间轮次有用,提供的监督信号较弱。

因此,我们提出一个动态的多层级记忆检索框架,使用中间和终端奖励(MERIT)。MERIT将记忆检索形式化为跨两个决策层级的学习问题。如图1(a)所示,回合级检索器在交互开始前选择过去的轨迹,为规划提供全局策略指导。轮次级检索器在交互过程中选择紧凑的状态-动作-观察记忆,根据当前状态提供局部提示。这种双层设计将长程任务策略与短程执行支持分离开来。

MERIT在两个层级均采用两阶段检索流水线。嵌入检索器首先生成候选集,然后经过学习的选择器决定向智能体暴露哪些记忆。两个选择器均通过强化学习(RL)进行优化,根据下游任务效用(而非固定的相似度)来塑造检索。回合级选择器使用终端奖励进行训练,因为其检索决策影响整体轨迹。轮次级选择器需要更密集的监督,因为中间轮次没有可靠的直接结果标签 [Choudhury, 2025; Xi et al., 2025]。为了解决这个信用分配难题,MERIT引入了一个轻量级过程奖励模型(PRM),通过结构化评分标准评估检索到的轮次级记忆的效用。由此产生的密集奖励使得针对状态条件的轮次检索可以进行RL训练。

我们在交互式Text-to-SQL基准 [Huo et al., 2025] 上评估MERIT的域内交互性能,并在Spider2-Snow [Lei et al., 2025] 上评估跨基准迁移能力。如图1(b)所示,MERIT在域内设置中以更少的平均交互轮数实现了比无记忆、静态检索和动态检索基线更高的成功率。在Spider2-Snow上,MERIT在未经过基准特定训练或调优的情况下实现了正面的迁移增益,表明所学的检索策略捕获了可复用的记忆选择行为,这超出了源基准的范围。

我们的贡献总结如下:

- 我们提出了MERIT,通过回合级的全局指导和轮次级的状态条件局部支持,将记忆检索与决策层级对齐。
- 我们将记忆检索形式化为两个决策层级的学习策略,使得记忆选择能够通过下游任务效用(而非固定的相似度)进行优化。
- 我们引入了一个轻量级PRM,为轮次级检索提供密集的结构化奖励,缓解了稀疏终端结果导致的信用分配问题。
- 我们在域内和迁移设置中对MERIT进行了评估,展示了改进的成功率、交互效率以及正面的跨基准迁移。

## 2 相关工作

### 2.1 Text-to-SQL

早期的神经Text-to-SQL研究通常将任务形式化为从自然语言问题和数据库模式直接到SQL的单次语义解析 [Zhong et al., 2017; Xu et al., 2017; Yu et al., 2018; Lin et al., 2020]。最近的基于LLM的方法通过引入交互、工具使用和迭代优化,超越了单次生成 [Zhang et al., 2024; Tian et al., 2023; Xiong et al., 2024; Wang et al., 2025a]。这些研究表明,Text-to-SQL智能体能从中间反馈和自适应决策中受益。我们在此基础上,研究通过学习型长期记忆检索来复用经验。

### 2.2 LLM智能体中的记忆系统

长期记忆能够实现跨回合的经验复用 [Park et al., 2023; Lu et al., 2023],先前的工作探索了长期记忆的写入和组织,包括类操作系统记忆管理 [Packer et al., 2023]、语义压缩 [Liu et al., 2026]、基于图的记忆表示 [Chhikara et al., 2025]、轨迹蒸馏 [Fang et al., 2025; Yan et al., 2025] 以及结构化记忆表示 [Zeng et al., 2024]。这些研究改进了智能体经验的存储和表示。而MERIT专注于在交互式设置中检索已经存储的记忆。大多数记忆增强的智能体使用固定的启发规则进行检索,如密集嵌入相似度、词汇匹配、主题覆盖或预定义的结构关系 [Arslan et al., 2024; Kweon et al., 2025; Kagaya et al., 2024; Zeng et al., 2024]。这些方法在寻找相关候选方面有效,但其检索标准是固定的,且不直接优化下游效用。最近的动态方法从反馈中学习记忆效用。Memory-R1 [Yan et al., 2025] 联合优化了记忆管理、检索和下游智能体。MemRL [Zhang et al., 2026] 通过运行时学习更新记忆Q值,Memento [Zhou et al., 2025] 则在无需微调基础LLM的情况下学习了记忆选择策略。它们超越了静态相似度,但主要在回合级运作,并依赖稀疏的终端反馈。MERIT则将回合级检索(用于全局策略)与轮次级检索(用于局部支持)分离,并使用基于PRM的密集奖励来训练轮次级检索器。

## 3 预备知识

我们将交互式Text-to-SQL形式化为一个顺序决策过程。给定一个初始的自然语言请求 \(x\),智能体与数据库环境交互,并在必要时与用户模拟器交互。与单次语义解析不同,智能体在生成最终SQL查询之前可能采取多种行动,包括模式检查、知识检索、SQL执行、澄清以及最终提交。

在第 \(t\) 轮,智能体拥有交互历史

\(h_{t-1} = \big((a_1, o_1), (a_2, o_2), \ldots, (a_{t-1}, o_{t-1})\big),\)

其中 \(a_t\) 是智能体的行动,\(o_t\) 是相应的观察结果。智能体观察到状态

\(s_t = (x, h_{t-1}, b_t),\)

其中 \(b_t\) 是剩余的交互预算。在给定 \(s_t\) 的条件下,智能体选择行动 \(a_t\),接收观察 \(o_t\),并将 \((a_t, o_t)\) 追加到历史中。一个回合生成一条轨迹

\(\tau = (s_1, a_1, o_1, s_2, a_2, o_2, \ldots, s_T, a_T, o_T),\)

其中 \(T\) 是最终轮。回合在智能体提交最终SQL查询、耗尽交互预算或达到最大允许轮数时终止。最终查询通过与目标SQL语义的执行正确性进行评估。

## 4 数据增强

学习检索策略需要多样化的可执行SQL。由于高质量的交互式Text-to-SQL数据有限,我们通过一个基于执行基础的增强流水线构建额外的训练数据。我们并不直接扰动自然语言请求,而是首先从种子示例中合成可执行的SQL目标,然后基于这些目标生成用户请求。这种“SQL优先”的设计减少了语义漂移,并鼓励生成可执行SQL、忠实的SQL查询对齐以及结构多样性。

给定一个种子查询,我们采用受约束的SQL级扰动,包括兼容的列替换、数值字面量扰动、排序方向改变以及限制值修改。这些操作在保持可执行性的同时,使投影、分组、阈值、排序和结果大小多样化。对于每个增强后的SQL目标,一个LLM会生成一个完全指定的请求、一个有意未完全指定的请求,以及将未指定短语链接到相应SQL片段的元数据。我们丢弃那些生成的文本或元数据无法通过SQL逻辑验证的示例。因此,每个保留的示例都提供了一个可执行的text-to-SQL任务,包含对齐的SQL、请求和用于检索策略训练的元数据。更多细节和提示词在附录A中提供。

## 5 方法

参考标题  
图2: 提出的用于交互式Text-to-SQL的双层长期记忆框架概览。回合级记忆在回合开始时检索以提供全局策略指导,并在回合结束时更新;轮次级记忆每轮检索和更新,以提供状态条件的局部提示。两个层级均采用两阶段流水线:基于嵌入的候选生成,随后是经过RL训练的选择器。过程奖励模型(PRM)通过离线SFT和GRPO训练,为轮次级检索提供密集的在线奖励,而回合级检索则通过终端任务奖励进行优化。

我们通过首先介绍将全局策略指导与局部状态条件支持分离的双层记忆架构来呈现MERIT (§5.1)。

相似文章

Causal Episodic Memory for Feedback-Driven Agent Repair

arXiv cs.CL

This paper introduces MERIT, a training-free agent that uses causal episodic memory of past repair outcomes to improve subsequent Text-to-SQL generations, boosting execution accuracy on Spider and BIRD benchmarks.

面向偏好变化的记忆检索

arXiv cs.CL

本文提出了一种针对长上下文对话系统中记忆访问与选择的统一框架,利用贝叶斯因子量化历史轮次对建模变化用户偏好的效用。实验表明,在偏好密集型任务中,该框架优于基于嵌入的检索方法。