RAS:基于上下文学习的反思增强缩放方法用于可执行Cypher查询生成
摘要
本文介绍了反思增强缩放(RAS)方法,该方法利用失败Cypher查询的执行反馈,通过上下文学习迭代优化查询生成,在多个数据集和模型上将执行错误率降低了41-50%。
arXiv:2605.22937v1 公告类型:新
摘要:推理时缩放可以减少结构化查询生成中的错误,但如何为查询代码生成分配计算资源仍然研究不足。我们研究了Text2Cypher,即语言模型生成针对属性图数据库执行的Cypher查询。不可执行的查询构成了与语义不准确不同的语法失败:语法错误会触发数据库生成的系统错误信息。这些错误信息通常在推理时被丢弃,而不是通过上下文学习(ICL)加以利用。我们比较了两种推理方法:独立缩放(IS),它执行无记忆重采样;以及反思增强缩放(RAS),它通过ICL让每次新尝试都基于先前的执行反馈。在三个Neo4j数据集和五个代码专用语言模型上,RAS在n=5时将查询执行错误率降低了41-50%,优于IS的32-38%。执行错误不仅仅是应丢弃的失败,而是可操作的反馈;围绕它们组织推理时计算是比缩放独立样本更高效的可执行性提升路径。
查看缓存全文
缓存时间: 2026/05/25 08:55
# RAS: 基于反射增强的上下文学习缩放方法用于可执行Cypher查询生成
来源:https://arxiv.org/html/2605.22937
Minseok Jung1,∗, Abhas Ricky1, Muhammad Rameez Chatni1
1Cloudera 6220 America Center Dr. San Jose, CA 95002
{minseok.jung, abhas, mchatni}@cloudera.com
###### 摘要
推理时缩放可以减少结构化查询生成中的错误,但如何为查询代码生成分配计算资源仍是一个未被充分探索的问题。我们研究Text2Cypher任务,即语言模型生成针对属性图数据库执行的Cypher查询。不可执行的查询构成一种与语义不准确性不同的独特语法失败:语法错误会触发数据库系统生成的错误消息。这些错误消息通常在推理时被丢弃,而非通过上下文学习(ICL)加以利用。我们比较了两种推理方法:独立缩放(IS),即无记忆地重新采样;以及反射增强缩放(RAS),即通过ICL将每次新尝试基于先前的执行反馈进行调整。在三个Neo4j数据集和五个代码专用语言模型上,当n=5时,RAS将查询执行错误率降低了41–50%,优于IS的32–38%。执行错误不仅仅是要丢弃的失败,而是可操作的反馈,围绕它们组织推理时计算是比缩放独立样本更有效的实现可执行性的途径。
**关键词:** 图数据库,代码模型,Cypher,查询生成,知识图谱,Neo4j,推理缩放
## 1 引言
近期研究表明,在推理时分配额外计算资源可以显著提升语言模型在复杂推理和生成任务上的表现 (Snell et al., 2024; Brown et al., 2024)。诸如缩放自一致性 (Wang et al., 2023) 和重复采样 (Brown et al., 2024) 等技术,在不修改模型参数的情况下提高了产生更优输出的概率 (Wu 等人, 2024)。
为了实现高效缩放,一条互补的研究方向关注基于反馈的修正,即模型利用先前尝试的信号来改进输出。诸如Self-Refine (Madaan et al., 2023)、Reflexion (Shinn et al., 2023) 和自调试 (Chen et al., 2024) 等方法表明,自我批评或执行反馈可以引导模型生成更好的结果。
<figcaption>图 1:我们的方法迭代生成查询并针对数据库执行。当执行失败时,系统通过基于反射的上下文学习(ICL)整合执行反馈,以优化后续生成。增加推理规模会扩展反射上下文,并提高生成可执行查询的概率。</figcaption>
<figcaption>图 2:面向Text2Cypher的反射增强推理时缩放。语法错误和模式错误会作为执行失败暴露给用户,破坏交互式查询工作流,使其成为独特且用户可见的失败模式。左图:在单次前向传播生成中,生成的Cypher查询被针对图数据库执行;执行失败会通过上下文学习触发执行感知的反射。右图:随着推理规模增加,该框架通过基于先前失败反馈的条件生成,迭代地优化查询代码,以减少语法错误。</figcaption>
我们在结构化生成中研究这一问题,在这种生成中,输出必须满足严格的语法和模式约束。在查询代码生成中,模型由于模式不匹配和组合复杂性,经常生成无效代码 (Gao et al., 2024; Liang et al., 2021; Hains et al., 2023)。已有工作提出了缩放方法 (Shinn et al., 2023; Chen et al., 2024) 来克服这一局限,但它们并未聚焦于可执行性,而可执行性是准确性的前提。我们引入了 **反射增强缩放(RAS)**,它将每次新尝试基于先前失败的执行反馈进行条件生成,并比较了两种面向Text2Cypher的推理时策略:**独立缩放(IS)**,即无记忆地重复采样;以及 **RAS**。
在三个Neo4j数据集和五个代码专用语言模型上,在相同计算预算下,RAS始终优于IS。当n=5时,RAS的查询执行错误率(QER)降低了41–50%,而IS降低了32–38%。我们的结果表明,推理时缩放的有效性不仅取决于使用多少计算资源,还取决于如何整合推理策略。
<figcaption>图 3:推理时缩放下三个图数据集的查询错误率(QER)。Q@1表示基线单次前向传播错误(n=1),而IS@5和RAS@5报告了通过简单重新运行和反射增强策略缩放至n=5后的错误率。反射在QER的绝对降低上始终更大。数值为三种查询复杂度的平均值。</figcaption>
## 2 相关工作
#### SQL语义解析。
将自然语言翻译为可执行的数据库查询,长期以来一直是语义解析框架下的研究课题 (Berant et al., 2013; Yih et al., 2016)。在关系型场景中,Text2SQL任务受益于Spider这样的标准化基准 (Yu et al., 2018),使得基于神经网络和大语言模型的方法能够进行系统评估并取得快速进展 (Wang et al., 2020; Scholak et al., 2021; Gao et al., 2024; Pourreza and Rafiei, 2023)。近期工作进一步探索通过上下文学习和智能体工作流将语言模型用作结构化数据库的通用接口 (Dong et al., 2023)。尽管在关系模式上表现出色,但这些方法并不能直接迁移到图查询语言,后者施加了根本不同的结构约束。
#### Cypher语义解析。
面向图数据库的语义解析仍相对未被充分探索。诸如Cypher之类的图查询语言需要对异构节点和边属性、方向敏感的关系以及组合式的多跳遍历模式进行显式推理。与SQL相比,图查询引入了额外的结构约束,包括路径模式匹配和模式稀疏性,这增加了语法和执行错误的可能性。先前的研究通过SPARQL生成探索了对知识图谱的自然语言访问 (Lan et al., 2021),近期工作则探索了面向属性图数据库的图感知检索和微调方法 (Clemedtson 等人, 2025; Sivasubramaniam 等人, 2024)。然而,主流的推理范式仍然是单次前向传播生成,并未利用额外的推理时计算来从执行失败中恢复。
#### 通过独立重采样的推理时缩放。
改进单次前向传播生成的一种替代方案是通过重复采样分配额外的推理时计算。测试时计算缩放增加了有效推理预算,而不修改模型参数,近期研究表明这种策略可以在复杂推理任务上取得显著收益 (Snell et al., 2024; Brown et al., 2024; Wu 等人, 2024)。自一致性 (Wang et al., 2023) 表明,对多个推理路径进行采样并通过多数投票选择,其表现始终优于贪心解码。在结构化查询生成中,重复采样通过利用独立输出间的随机变异性降低了错误率。然而,独立重采样在输入问题和数据库模式上保持了固定的条件分布,并未纳入来自先前执行失败的证据。因此,重复采样往往重现类似的结构性错误模式——例如模式不匹配、关系方向不正确或无效的聚合结构——从而限制了仅通过缩放所能获得的收益。
#### 基于执行反馈的反射与迭代修正。
一种更具针对性的策略是将后续生成基于先前失败的反馈进行条件化,从而实现迭代纠正而非独立探索。Self-Refine (Madaan et al., 2023) 和 Reflexion (Shinn et al., 2023) 提出了自我修正循环,其中模型批评并修正自身输出,或在智能体推理场景中维护失败尝试的片段记忆。自调试 (Chen et al., 2024) 表明,程序执行反馈可以指导Text2SQL任务上的迭代修复,尤其是在较难查询上提升了性能。尽管这些方法凸显了反馈驱动推理的价值,但它们尚未在针对实时属性图数据库的模式约束型Cypher生成场景中得到系统研究。此外,先前工作并未在受控的推理时计算预算下直接比较独立重采样和反馈驱动修正。我们的工作通过形式化面向Text2Cypher生成的执行感知反射,并在多样化的属性图数据集和查询复杂度级别上对两种策略进行系统的经验比较,填补了这些空白。
## 3 问题形式化与建模
### 3.1 Text2Cypher作为结构化图查询生成
我们将Text2Cypher形式化为一个结构化语义解析任务,将自然语言问题映射到可执行的Cypher查询。设x∈X表示自然语言输入,S表示数据库模式。目标是生成查询q∈Q,其中Q表示能够在与S一致的数据库实例G上成功进行语法解析的Cypher查询空间。
我们将查询生成建模为条件结构化生成 (Scholak et al., 2021; Wang et al., 2020):
q ∼ p_θ(q | x, S), (1)
其中p_θ表示由自回归语言模型(参数为θ)诱导的条件分布,定义了表示候选Cypher程序的token序列上的概率度量。语法有效性和可执行性仅在完整解码后才进行评估。与无约束文本生成不同,Cypher查询必须满足图模式施加的严格结构约束;即使是很小的偏差——例如错误的关系方向或引用无效的节点属性——也会导致立即执行失败。
### 3.2 可执行性与准确性
可执行性和准确性衡量生成查询的两个概念上不同的方面。**可执行性**指查询能否被数据库引擎成功处理,而不引发语法或模式错误。相反,**准确性**衡量语义正确性——执行结果是否与真实答案匹配。
一个查询可能是可执行的但语义不正确(例如,由于缺少过滤器或错误的聚合)。然而,不可执行的查询不可能是准确的,因为它无法产生任何结果。这种结构上的不对称性促使我们将执行失败视为一种独特且可分离的错误源。
我们通过生成查询的两个二元随机变量来形式化这一区别:
E ∈ {0,1} (语法), A ∈ {0,1} (语义)
其中E=1表示成功执行的查询,E=0表示由于语法或模式违规(例如,未定义的节点标签、无效的关系类型或格式错误的路径语法)导致的执行失败;而A=1表示结果匹配真实答案,A=0表示语义错误。关键的是,E捕捉**结构有效性**,A捕捉**语义保真度**:一个查询可能满足E=1但未能满足A=1,但E=0保证了A=0,因为不会产生任何结果。
我们将联合概率定义为
P_ij = P(E=i, A=j),
总结于表1。由于不可执行的查询不可能是准确的,P_01未定义。因此执行失败概率为P(E=0)=P_00,这是用于触发算法2中反射循环的信号。RAS算法的目标是降低P_00,从而增加总的可执行概率质量P(E=1)=P_11+P_10。本文聚焦于降低执行失败,而非直接优化语义正确执行(P_11)与语义错误但可执行查询(P_10)之间的分配。
表1:可执行性(E)和语义准确性(A)的联合分布。单元格P_01未定义,因为不可执行的查询不可能产生正确结果。
### 3.3 查询执行错误
对于生成的查询q和固定的数据库实例G,执行是确定性的。我们写作
(r, m) = E(q, G), (2)
其中r是数据库引擎返回的查询结果,m是伴随的执行状态消息(例如,成功确认或结构化错误诊断)。准确性A通过r进行评估,而可执行性E由m决定:当且仅当m指示错误时查询失败(E=0),此时r未定义。
我们将**查询执行错误**(QEE)指标定义为
QEE(q, G) := 1[m ∈ M_error], (3)
其中M_error表示错误类状态消息的集合。给定关于x的输入分布D,**查询执行错误率**(QER)为
QER := E_{x∼D} E_{q∼p_θ(·|x,S)} [QEE(q, G)]. (4)
因此QER等于P(E=0),并通过所有输入中执行失败的查询比例进行经验估计。
从系统角度来看,可执行性对下游正确性构成了硬约束:当E=0时,不产生任何结果,并且RAG流水线中的检索阶段完全失败。因此,相似文章
R-APS:通过反思性对抗帕累托搜索实现约束设计的组合推理与上下文元学习
R-APS(反思性对抗帕累托搜索)是一种面向约束设计任务的新方法,通过跨三个时间尺度的推理模式分解,解决了基于LLM的智能体系统中的三类结构性缺陷——错误传播、鲁棒性评估与知识失效,且无需微调。在平面机构综合任务上的评估结果表明,与基线方法相比,R-APS实现了3.5倍更紧的鲁棒性证书、46%更快的首次准入迭代速度,以及2.1倍的Chamfer距离缩减。
通过反思增强自蒸馏在稀有成功但反馈丰富的场景中学习
本文介绍了反思增强自蒸馏(RESD)框架,该框架将失败反馈转化为对LLM的纠正性监督,从而实现从稀有成功中高效学习。该框架优于标准自蒸馏基线,并且相比GRPO,使用更少的样本实现了更快的早期改进。
ScalableRAG:零摄入成本的高质量RAG
本文介绍了ScalableRAG,一种检索增强生成方法,通过基于正则表达式的集合创建和聚合推理,在无需任何摄入成本(无需向量数据库或知识图谱)的情况下实现高准确率。它在多个数据集上优于基线方法,并提出了一个有限摄入变体以进一步提升准确率。
REVES: REVES:修订与验证增强的测试时扩展训练
提出REVES,一种两阶段迭代框架,交替进行数据增强与策略优化,通过利用中间修正步骤提升LLM推理能力,在编程基准测试和约束满足问题上取得更优性能。
上下文优化下的检索增强生成:从梯度下降视角
本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。