GGC:用于可靠文本到SPARQL生成的选择性查询纠正

arXiv cs.CL 论文

摘要

本文提出GGC,一种生成器-门控-纠正器框架,通过选择性纠正LLM生成的SPARQL查询来提高可靠性和准确性,在MCQA上达到98.33%的查询级准确率,同时将推理开销降低45%。

arXiv:2607.28082v1 公告类型:新 摘要:大型语言模型(LLMs)在结构化查询生成方面展现出强大能力,使其成为Text-to-SPARQL(将自然语言问题转换为知识图谱上可执行的SPARQL查询)的自然选择。然而,它们的初始输出仍不可靠:生成的查询可能可执行,但语义上与输入问题不一致,导致检索结果错误。为解决此问题,我们提出生成器-门控-纠正器(GGC)框架,用于可靠的基于LLM的Text-to-SPARQL生成。GGC首先使用生成器产生初始查询,然后应用门控预测是否需要纠正,最后仅对选中的高风险查询调用纠正器。这种选择性纠正机制避免了不必要的修改,并降低了使原本正确的查询退化的风险。在MCQA上的实验表明,与纠正所有生成的查询相比,GGC将查询级准确率从90.23%提升到98.33%,同时推理开销降低45%。消融研究表明,门控在不同阈值下具有鲁棒性,且纠正器训练数据组成影响纠正效果和稳定性。总体而言,结果表明选择性纠正提高了基于LLM的文本到SPARQL生成的准确性、可靠性和效率。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:03

# GGC:用于可靠文本到SPARQL生成的选择性查询修正

来源:https://arxiv.org/html/2607.28082

杨子怡1,Thanh\-Son Nguyen2,陈立辉1
1南洋理工大学,信息科学与系统中心
2高性能计算研究所,科学技术与研究局(A\*STAR),新加坡

杨子怡:zyang025@e\.ntu\.edu\.sg (https://arxiv.org/html/2607.28082v1/mailto:[email protected])
Thanh\-Son Nguyen:Nguyen\_Thanh\_Son@a\-star\.edu\.sg (https://arxiv.org/html/2607.28082v1/mailto:[email protected])
陈立辉:ELHCHEN@ntu\.edu\.sg (https://arxiv.org/html/2607.28082v1/mailto:[email protected])

杨子怡1,Thanh\-Son Nguyen2,Nguyen Tuan Anh1,陈立辉1
1南洋理工大学,信息科学与系统中心
2高性能计算研究所,科学技术与研究局(A\*STAR),新加坡

###### 摘要
大型语言模型(LLMs)在结构化查询生成方面展现出强大的能力,使其成为文本到SPARQL(将自然语言问题转换为可在知识图谱上执行的结构化查询)的自然选择。然而,它们的初始输出仍然不可靠:生成的查询可能是可执行的,但与输入问题在语义上不一致,从而导致错误的检索结果。为解决这一问题,我们提出了生成器-门控-修正器(Generator–Gate–Corrector,GGC)框架,用于实现可靠的基于LLM的文本到SPARQL生成。GGC首先使用生成器产生初始查询,然后应用门控预测是否需要修正,最后仅对选中的高风险查询调用修正器。这种选择性修正机制避免了不必要的修改,并降低了破坏原本正确查询的风险。在MCQA上的实验表明,与修正所有生成的查询相比,GGC将查询级准确率从90.23%提升至98.33%,同时推理开销降低了45%。消融研究表明,门控在不同阈值下具有鲁棒性,且修正器训练数据的组成会影响修正效果和稳定性。总体而言,实验结果证明,选择性修正能够提高基于LLM的文本到SPARQL生成的准确性、可靠性和效率。

GGC:用于可靠文本到SPARQL生成的选择性查询修正

杨子怡1,Thanh\-Son Nguyen2,Nguyen Tuan Anh1,陈立辉1††感谢:通讯作者:elhchen@ntu\.edu\.sg (https://arxiv.org/html/2607.28082v1/mailto:[email protected])。
1南洋理工大学,信息科学与系统中心
2高性能计算研究所,科学技术与研究局(A\*STAR),新加坡

## 1 引言

知识图谱问答(KGQA)旨在通过将自然语言问题(NLQs)与知识图谱(KGs)中的结构化事实进行关联来回答问题。现有的KGQA方法通常分为基于语义解析(SP)的方法和基于信息检索(IR)的方法(Lan et al. (https://arxiv.org/html/2607.28082#bib.bib6) 2023)。前者生成逻辑形式或查询结构,后者通过实体、关系或路径检索从图中获取答案。在基于RDF的(Kellogg et al. (https://arxiv.org/html/2607.28082#bib.bib5) 2026)知识图谱背景下,文本到SPARQL是实现KGQA的一种重要方法。基于RDF的知识图谱将知识表示为“主语-谓语-宾语”三元组,而SPARQL(Harris and Seaborne (https://arxiv.org/html/2607.28082#bib.bib16) 2013)是RDF数据的标准查询语言。因此,文本到SPARQL旨在将自然语言问题转换为可执行且语义一致的SPARQL查询。与直接生成自然语言答案相比,这种方法通过对外部知识图谱执行显式查询来获取答案,使中间查询和检索到的图事实可检查,从而促进更可验证和可解释的结果(Pan et al. (https://arxiv.org/html/2607.28082#bib.bib21) 2024)。近年来,大型语言模型(LLMs)在自然语言理解、生成和代码相关任务中展现出强大的能力(Brown et al. (https://arxiv.org/html/2607.28082#bib.bib4) 2020;Chen et al. (https://arxiv.org/html/2607.28082#bib.bib11) 2021)。这些能力使其成为文本到SPARQL的自然选择,因为模型必须理解用户问题并生成语义一致且可执行的结构化查询。然而,文本到SPARQL不仅仅是文本生成任务。生成的查询必须是可执行的,同时忠实编码自然语言问题中表达的实体、关系、约束、变量绑定和推理路径(Banerjee et al. (https://arxiv.org/html/2607.28082#bib.bib1) 2022)。由于可执行性本身并不保证语义正确性,基于LLM的文本到SPARQL需要机制来验证与原始问题的一致性,特别是当LLMs可能产生看似合理但不忠实的输出时(Xu et al. (https://arxiv.org/html/2607.28082#bib.bib7) 2023)。我们的实验进一步表明,这个问题在文本到SPARQL中尤为突出。虽然微调后的生成器实现了较高的查询级准确率,但其剩余错误中有很多是可执行但存在语义缺陷的查询。我们将生成器错误定义为生成器产生的、与黄金标准查询相比被判定为不正确的初始SPARQL查询。在Movie Complex Question Answering(MCQA)(Hoang et al. (https://arxiv.org/html/2607.28082#bib.bib20) 2024)数据集上,语义错误占生成器错误的77.70%,而语法错误仅占21.07%。这表明仅依赖执行失败来触发修正会遗漏许多语义错误。本文的关键见解是,在基于LLM的文本到SPARQL中,问题不仅在于如何生成查询,还在于何时进行修正。修正所有生成的结果可能会修复不正确的查询,但也会带来更高的推理开销,并可能使原本正确的查询退化。相比之下,选择性修正将计算集中在高风险样本上,在提高准确率的同时减少了不必要的重写。实验结果表明,提出的生成器-门控-修正器(GGC)框架将查询级准确率从90.23%提升到98.33%,相对于仅生成器的推理,仅增加了约10%的推理时间。与修正所有样本相比,选择性修正实现了更高的准确率,同时推理时间减少了约45%。总而言之,我们的贡献如下:

- •我们从可靠性角度分析了基于LLM的文本到SPARQL,并表明可执行但存在语义缺陷的查询是影响系统性能的重要错误来源。
- •我们提出了GGC框架,通过“先检测后修正”的策略执行选择性查询修正,并在准确率和推理效率之间取得了更好的平衡。
- •我们在MCQA上进行了系统实验和消融分析,考察了生成器、门控、修正器、KG执行反馈以及修正器训练数据组成的影响,为构建更可靠的文本到SPARQL系统提供了实证依据。附录D.2 (https://arxiv.org/html/2607.28082#A4.SS2)中报告的在SciQA(Auer et al. (https://arxiv.org/html/2607.28082#bib.bib27) 2023)上的额外结果进一步支持了这些发现。

## 2 相关工作

### 2.1 知识图谱问答

现有的KGQA方法大致可分为基于SP的方法和基于IR的方法。基于SP的方法将自然语言问题转换为可在知识图谱上执行以获取答案的逻辑形式、查询图或结构化查询(Lan et al. (https://arxiv.org/html/2607.28082#bib.bib6) 2023)。这些方法提供了相对明确的推理过程,但其性能在很大程度上取决于生成的中间结构的质量。相比之下,基于IR的方法从主题实体中检索相关实体、关系或子图,并通过路径搜索或神经推理获得答案。它们对多跳推理具有灵活性,但通常不如基于显式查询的方法可解释。查询图生成(QGG)(Lan and Jiang (https://arxiv.org/html/2607.28082#bib.bib2) 2020)和神经状态机混合模型(NSMh\mathrm{NSM}_{\mathrm{h}})(He et al. (https://arxiv.org/html/2607.28082#bib.bib3) 2021)分别是这两个方向的代表性方法。QGG构建包含实体、关系、约束和答案变量的查询图,而NSMh\mathrm{NSM}_{\mathrm{h}}通过学习中间监督信号改进多跳推理。与这些方法不同,我们关注基于LLM的文本到SPARQL生成的可靠性,特别是如何在生成后识别和修正高风险SPARQL查询。由于QGG和NSMh\mathrm{NSM}_{\mathrm{h}}是MCQA数据集上的重要参考基线,因此实验中将它们纳入比较。

### 2.2 文本到SPARQL与SPARQL语义解析

随着预训练语言模型的发展,文本到SPARQL已从基于规则、基于模板和特定任务的语义解析方法转向基于生成的方法(Lan et al. (https://arxiv.org/html/2607.28082#bib.bib6) 2023)。已有工作比较了BART、T5和指针生成器模型在LC-QuAD 1.0和LC-QuAD 2.0上的表现,表明预训练模型为SPARQL语义解析提供了强基线(Banerjee et al. (https://arxiv.org/html/2607.28082#bib.bib1) 2022)。最近的研究进一步将LLMs应用于Wikidata(Vrandečić and Krötzsch (https://arxiv.org/html/2607.28082#bib.bib25) 2014)上的SPARQL生成(Xu et al. (https://arxiv.org/html/2607.28082#bib.bib7) 2023;D’Abramo et al. (https://arxiv.org/html/2607.28082#bib.bib24) 2025)。这些方法通过将自然语言问题转换为可执行的SPARQL查询,借助显式查询执行过程从知识图谱中检索答案,与直接生成答案相比提高了可验证性。最近,FIRESPARQL引入了一个模块化的基于LLM的框架,用于在学术知识图谱上生成SPARQL(Pan et al. (https://arxiv.org/html/2607.28082#bib.bib26) 2025),结合了微调、可选的检索增强上下文和查询修正。这些研究展示了LLMs在SPARQL生成方面的潜力,但对生成查询的可靠性关注较少,尤其是可执行但存在语义缺陷的查询。相比之下,我们的工作聚焦于何时应触发生成后修正。提出的生成器-门控-修正器框架使用学习的门控仅将高风险查询选择性地路由到修正器,从而减少不必要的重写和推理开销。

### 2.3 结构化查询生成中的约束生成与错误修正

文本到SPARQL和文本到SQL都是自然语言到结构化查询的生成任务,要求输出既语法有效又语义正确。因此,文本到SQL中的约束解码和错误修正方法为文本到SPARQL提供了有益的参考。在约束解码方面,PICARD(Scholak et al. (https://arxiv.org/html/2607.28082#bib.bib8) 2021)通过增量解析约束自回归解码,并拒绝违反SQL语法的标记。在错误修正方面,文本到SQL的研究(Chen et al. (https://arxiv.org/html/2607.28082#bib.bib9) 2023;Shi et al. (https://arxiv.org/html/2607.28082#bib.bib28) 2025)表明,生成后修正可以提高语义解析准确率,并且结构化的子句级编辑通常比标记级编辑更适合查询修复。这些研究表明,改进结构化查询生成不仅依赖于更强的初始生成器,还可以受益于约束、验证和修正模块。

### 2.4 基于LLM的文本到SPARQL中选择性修正的动机

现有工作通过图推理、语义解析和结构化查询生成推动了KGQA的发展。然而,基于LLM的文本到SPARQL方法仍面临可靠性问题,可执行查询可能与原始问题在语义上不一致。受近期文本到SQL中后修正研究的启发,我们探索了基于LLM的文本到SPARQL的后修正。与先前主要关注查询生成的工作不同,我们的方法强调生成后的错误检测和选择性修正,以确定何时以及如何进行修正,从而提高语义一致性。

## 3 方法

我们提出了一个生成器-门控-修正器框架,以提高基于LLM的文本到SPARQL生成的可靠性。该框架并非修正所有生成的查询,而是首先判断初始SPARQL查询是否可能包含错误,然后仅对高风险查询触发修正。总体目标是提高查询准确率,同时减少不必要的修正和额外的推理开销。

### 3.1 任务形式化

给定一个自然语言问题,qq,文本到SPARQL的目标是生成一个可执行的SPARQL查询,ss。通过在知识图谱上执行查询,可以获取答案集。与一般文本生成任务相比,文本到SPARQL要求生成的查询满足以下要求:首先,查询必须符合SPARQL语法;其次,查询必须在语义上与原始问题一致。初始查询由生成器生成,记为s(0)s^{(0)}。如果判断该查询可能存在错误,则由修正器生成修正后的查询,记为s(c)s^{(c)}。最终输出的查询记为s^\hat{s}。因此,我们关注如何生成s(0)s^{(0)},以及如何判断它是否需要修正。

参见图注

图1:所提出的用于文本到SPARQL生成的生成器-门控-修正器框架。

### 3.2 生成器-门控-修正器框架

我们将文本到SPARQL过程分为三个阶段:初始生成、错误检测和选择性修正。总体过程如下:

g=Gate(q,s(0))g=Gate(q,s^{(0)})

s^={s(0),if g=0C(q,s(0)),if g=1\hat{s}=\begin{cases}
s^{(0)}, & \text{if } g=0\\
C(q,s^{(0)}), & \text{if } g=1
\end{cases}

其中G(⋅)G(\cdot)表示生成器,C(⋅)C(\cdot)表示修正器,g∈{0,1}g\in\{0,1\}是门控的二元输出。框架如图1 (https://arxiv.org/html/2607.28082#S3.F1)所示。由于并非所有初始SPARQL查询都需要修正,对所有查询触发修正器将显著增加推理开销,并可能破坏原本正确的查询。因此,框架中的门控扮演查询风险评估者的角色,确保修正器仅对高风险查询触发。

### 3.3 生成器

生成器的目标是将自然语言问题qq转换为初始SPARQL查询s(0)s^{(0)}。我们使用有监督微调的LLM作为生成器。训练时,输入为自然语言问题,目标输出为对应的黄金标准SPARQL查询。推理时,生成器根据输入问题生成初始查询s(0)s^{(0)}。生成器旨在尽可能生成准确的初始候选查询。然而,由于SPARQL对实体、关系、约束和变量绑定的严格要求,生成器的输出仍可能包含语法或语义错误。因此,初始查询不会直接作为最终结果,而是进一步传递给门控进行可靠性评估。

相似文章

基于外部子图生成的大语言模型逐步推理增强

arXiv cs.CL

本文提出了SGR框架,通过查询相关的子图生成将外部知识图谱与大语言模型相结合,融合基于Cypher的推理与协同推理集成,从而增强大语言模型的逐步推理能力。在CWQ、WebQSP、GrailQA和KQA Pro上的实验表明,该框架相比标准提示方法和知识增强基线具有更高的推理准确性。