面向知识图谱问答的研究者智能体
摘要
本文提出了一种自我改进的“研究者智能体”,用于知识图谱上的Text-to-SPARQL问答,该智能体能迭代优化自身的提示和工具。在DBpedia上进行评估,达到了0.22的准确率,并识别出谓词选择是主要瓶颈。
arXiv:2608.07700v1 公告类型:新
摘要:将自然语言问题转换为可在大型知识图谱上执行的SPARQL查询,需要解决词汇歧义、将表层术语锚定到目标本体中,并生成既语法有效又语义忠实的图模式。我们提出了一种智能体式Text-to-SPARQL系统,它比静态使用工具智能体更进一步:一个研究者智能体在验证集上进行每轮推理后,会提出并测试对自己提示、规则和工具编排代码的更改。我们在DBpedia上实例化该循环,由低成本的推理模型驱动进化出九个连续版本,并使用两个更强的骨干模型部署性能最佳的配置。该研究得出三点观察:(i)自我改进快速收敛,并在2025年DBpedia验证集上达到0.22的整体准确率;(ii)瓶颈始终在于基本图模式的谓词选择,而非SPARQL语法或修饰符;(iii)由于DBpedia中的属性歧义,若干基准项似乎会惩罚正确的查询,这表明未来的Text-to-SPARQL基准应结合机器翻译和信息检索指标进行评分。
查看缓存全文
缓存时间: 2026/08/11 08:03
# 面向知识图谱问答的研究型智能体 来源:https://arxiv.org/html/2608.07700 \\copyrightclause 版权所有归本文作者所有。允许在知识共享署名4.0国际许可协议(CC BY 4.0)下使用。 \\conference 第二届国际TEXT2SPARQL挑战赛,与ESWC26上的Text2KG联合举办,2026年5月10日,克罗地亚杜布罗夫尼克。 [[email protected]]\\cormark[1] [[email protected]] \\cortext [1]通讯作者。 (2026) ###### 摘要 将自然语言问题转换为可针对大型知识图谱执行的SPARQL查询,需要解决词汇歧义、将表面词项映射到目标本体,以及生成既语法有效又语义忠实的图模式。我们提出了一种智能体式text-to-SPARQL系统,它比静态工具使用智能体更进一步:一个*研究型智能体*(researcher agent),在验证集上每完成一轮推理后,会提出并测试对其自身提示、规则和工具编排代码的修改。我们在DBpedia上实例化了该循环,使用低成本的推理模型演化出九个连续版本的智能体,并使用两个更强的骨干模型部署了性能最佳的配置。该研究得出三点观察:(i)自我改进快速收敛,随后在2025年DBpedia验证集上达到0.22的总体准确率;(ii)瓶颈始终在于基本图模式的谓词选择,而非SPARQL语法或修饰符;(iii)由于DBpedia中的属性歧义,若干基准测试项似乎对正确查询进行了误判,这表明未来的Text-to-SPARQL基准应结合机器翻译和信息检索指标进行评分。 ###### 关键词: Text-to-SPARQL\sep知识图谱问答\sepLLM智能体\sep自改进智能体\sepDBpedia ## 1 引言 公共知识图谱,如DBpedia[doi:10.3233/SW-140134]、Wikidata[wikidata_article]和Freebase[bollacker2008freebase],暴露了数十亿条语义三元组,构成了世界上最大的公共结构化世界知识库之一。为了使这些知识对非专家用户可访问,知识图谱上的问答(QA)长期以来一直寻求用自然语言接口取代SPARQL等正式查询语言[SoruEtAl:SEMPDS2017,soru2018neural,rony2022sgpt]。Text-to-SPARQL任务仍然困难:系统必须消除表面词项的歧义,将其映射到特定本体,满足图结构约束,并生成语法有效且通常跨越多跳、聚合和过滤的查询[cao-etal-2022-kqa,Liang2021-vm,dubey2019lc,10.1145/3708326,app14041521]。 早期的Text-to-SPARQL流水线将解析后的问题与固定的SPARQL骨架对齐,如基于模板的链接数据问答(TBSL)框架[10.1145/2187836.2187923]和[sparql_from_template]的关键词驱动模板生成器。这类系统需要大量人工工作,并且在释义、未见本体和组合查询上迅速退化。半自动方法通过学习从数据中对模板进行排序或选择来减少编写工作量,如SPARQA中提出的带神经排序的骨架语法方法[Sun_Zhang_Cheng_Qu_2020],但仍然受限于有限的模板库。第一届国际TEXT2SPARQL挑战赛[text2sparql2025]表明,基于LLM的智能体(通常配备检索和知识图谱探索工具)现在在异构知识图谱上优于这些基于模板的流水线。 本文扩展了我们先前提交至第一届TEXT2SPARQL挑战赛的工作[ref:Soru2025](该工作在大规模合成语料上微调了自回归代码模型),将学习发生的层面进行了改变。我们不再微调模型权重,而是让智能体在评估轮次之间编辑自己的源代码。具体而言,我们的贡献是:(i)一种*研究型智能体*架构,其中LLM提出对下游Text-to-SPARQL智能体的提示、规则和工具编排的更改,并针对验证集进行测试;(ii)一项预评估,在2025年DBpedia验证集上比较了六个最近的LLM(开放和封闭),并论证了选择一种廉价模型进行自我改进以及两种更强模型用于最终挑战提交的理由;(iii)一项跨越九个连续智能体版本的特征构建研究,该研究分离出哪些规则和工具映射启发式方法真正提升了准确率。该智能体和轨迹作为开放工件发布在https://github.com/LiberAI/researcher-agents-for-kgqa。 本文其余部分结构如下。第2节(https://arxiv.org/html/2608.07700#S2)回顾相关工作。第3节(https://arxiv.org/html/2608.07700#S3)描述静态和自改进智能体循环以及我们构建的研究型智能体。第4节(https://arxiv.org/html/2608.07700#S4)报告预评估、特征构建研究以及对基准本身的检查。第5节(https://arxiv.org/html/2608.07700#S5)进行总结。 ## 2 相关工作 #### 神经Text-to-SPARQL。 大量近期工作将Text-to-SPARQL视为神经序列生成问题。诸如T5和BART之类的预训练序列到序列模型,几乎不需要任务特定的机制就能将实体和关系安排成格式良好的SPARQL查询[banerjee2022modern]。SGPT[rony2022sgpt]在GPT-2解码器之上堆叠Transformer编码器,但往往错误处理多跳模式。将相关子图注入模型上下文的基于提示的方法(如SPARQLGEN[kovriguina2023sparqlgen])仍然表现出系统性的排序错误。在[app14041521]中提出了一种针对T5的三元组顺序敏感预训练方案以缓解该问题。这些方法通常依赖昂贵的微调和专门的解码策略,这使它们在不同知识图谱之间迁移时代价高昂[kovriguina2023sparqlgen,app14041521]。 #### 基于DBpedia的端到端系统。 若干端到端模型已在以DBpedia为中心的基准上进行了评估。SPARKLE[lee2025sparkle]将知识图谱结构集成到解码器中,并在LC-QuAD 1.0上报告了最先进的F1。一种结合CNN和自注意力的混合多头卷积编码器[chen2024integrating]在QALD-9和LC-QuAD 1.0上获得了强BLEU和F1。一种将问题理解视为序列生成的通用知识图谱问答模型[omar2023universal]在LC-QuAD 1.0和QALD-9上具有竞争力。一种两阶段本体引导提示框架首先预测SPARQL骨架,然后填充知识图谱特定信息,在LC-QuAD 1.0上达到79.1%的F1[jiang2025ontology]。早期工作引入了一种基于轮廓的两步架构,将粗粒度查询生成与图搜索相结合[purkayastha2022deep]。 #### 基准和合成数据集。 大规模问答基准推动了这一进展的很大部分。LC-QuAD 2.0包含约3万个复杂自然语言问题,并配有DBpedia和Wikidata上的SPARQL查询[dubey2019lc],而QALD系列提供了较小规模的多语言基准;QALD-9-Plus用高质量的DBpedia翻译扩展了QALD-9,涵盖八种语言以及五种代表性不足的语言,包括乌克兰语、亚美尼亚语、立陶宛语、巴什基尔语和白俄罗斯语[perevalov2022qald]。DBpedia神经问答(DBNQA)语料库通过模板化生成提供约894,499个英语问题-SPARQL对[hartmann2018generating]。 #### 第一届TEXT2SPARQL挑战赛。 第一届TEXT2SPARQL挑战赛[text2sparql2025]的提交作品探索了广泛的策略谱系。Wardenga和Käfer[ref:Wardenga2025]利用LLM上下文中的数据形状来约束公共和私有知识图谱上的生成。我们之前的提交[ref:Soru2025]在大规模合成语料上微调自回归代码模型。Dorsch等人[ref:Dorsch2025]构建了一个组织知识图谱问答智能体。ARUQULA[ref:Brei2025]将LLM与ReAct式推理[yao2023react]和知识图谱探索工具相结合。AIRI团队[ref:Berezin2025]提出了一种将生成与执行解耦的Text-to-SPARQL执行器。Perevalov和Both[ref:Perevalov2025]以人类启发式推理推进多语言前沿。 #### 智能体和自改进LLM系统。 在Text-to-SPARQL之外,近期关于智能体LLM系统的工作表明,将推理与工具使用交错进行可以改善映射并减少幻觉。ReAct[yao2023react]在问答和决策基准上展示了这种协同作用,而Toolformer[schick2023toolformer]表明LLM可以在自监督方式下调用外部API。Schluntz和Zhang面向从业者的综述[schluntz2024building]从推理循环和工具使用两个维度区分了工作流和智能体。自我改进增加了一个第二循环,在该循环中,智能体编辑自己的脚手架而不仅仅是其草稿本;我们的研究型智能体正是这一模式的实例,专门针对Text-to-SPARQL。 ## 3 提案 ### 3.1 从静态到自改进智能体 静态Text-to-SPARQL智能体实现单个*推理循环*:给定用户请求,LLM发出一个动作(工具调用或SPARQL草稿),环境(查找索引、SPARQL端点)返回反馈,然后LLM要么发出进一步动作,要么返回最终查询。脚手架——提示、规则、工具连接——在各查询之间是固定的。 自改进智能体增加了第二个外部循环。在验证集上每完成一轮推理后,一个编排LLM观察智能体的失败和成功,并*提出对智能体源代码的更改*。该更改应用于工作副本,新智能体在同一验证集上进行测试,循环继续,人类逐渐退出设计路径。我们使用*研究型智能体*一词来强调编排者的角色更接近于运行特征构建研究的机器学习研究人员,而非链式思维推理器。 ### 3.2 用于Text-to-SPARQL的研究型智能体 下游Text-to-SPARQL智能体消费自然语言问题和目标SPARQL端点,并向LLM暴露三个工具:(i)*表面形式查找*,将问题的片段映射到候选DBpedia实体;(ii)*本体查找*,枚举候选实体周围的类和谓词;(iii)*测试SPARQL*工具,针对端点执行草稿查询并返回答案或错误消息。该智能体迭代计划/映射/草稿/验证步骤,直到查询返回与预期答案形状匹配的非空结果,或迭代预算耗尽。 研究型智能体包装此Text-to-SPARQL智能体,并在评估轮次之间编辑其提示、少量硬规则(例如,"优先使用dbo:而非dbp:")、上下文示例数量以及工具编排代码的小片段。每次编辑产生一个新的智能体版本v_i;研究型智能体记录每个版本、其差异及其分数。在我们的研究中,智能体演化了九次,根据规则是提高了整体准确率还是仅提高了特定SPARQL子组件,交替移除和恢复规则。 ## 4 实验评估 ### 4.1 数据集 我们使用第一届国际TEXT2SPARQL挑战赛的DBpedia验证集(以下简称DB25)进行LLM预评估和特征构建研究,并将最佳智能体配置以两个更强的骨干模型提交至第二届国际TEXT2SPARQL挑战赛。 ### 4.2 实验设置 Text-to-SPARQL智能体在开源智能体框架之上用Python实现。研究型智能体使用相同的框架。评估期间的所有工具调用均针对官方挑战SPARQL端点发出。对于每个智能体版本,我们报告官方挑战指标,分为四个族:基本图模式(BGP)节点(实体映射)、BGP谓词(关系映射)、内部运算符(修饰符,如DISTINCT或COUNT)和外部运算符(整体查询结构)。 ### 4.3 LLM预评估 我们首先在DB25上使用六个跨越成本/能力前沿的近期LLM运行了初始智能体(v1):Gemini 3 Flash、Claude Sonnet 4.6、GPT-5.4 Mini、DeepSeek v3.2、Qwen 3.5 122B和Gemma 3 27B。总体准确率集中在0.16到0.23之间,其中Qwen 3.5 122B在开放权重类别中领先,Claude Sonnet 4.6在封闭类别中领先。我们选择DeepSeek v3.2作为特征构建研究中最便宜的启用推理模型,并使用Claude Sonnet 4.6和Qwen 3.5 122B进行最终挑战提交。 ### 4.4 特征构建研究 表1(https://arxiv.org/html/2608.07700#S4.T1)总结了研究型智能体在DeepSeek v3.2上产生的九个智能体版本。每列对应一个版本;每行对应一个由研究型智能体切换的二元特征。底行报告DB25上的总体准确率。 表1:使用启用推理的DeepSeek v3.2在DB25验证集上的特征构建研究。特征v1v2v3v4v5v6v7v8v9dbo:优先规则✓–✓–✓✓✓✓✓SELECT DISTINCT––✓✓✓✓✓✓✓上下文中分组的dbo/dbp对––––✓✓✓✓✓上下文中显示三元组计数–––✓–✓✓✓✓三元组计数用于选择–––✓–––––Unicode实体链接回退–––––✓✓✓✓rdf:type约束规则–––––✓✓✓✓多跳rdf:type异常––––––––✓COUNT格式(无AS别名)–––––✓✓✓✓三元组方向规则––––––––✓编号/结构化规则––––––✓––示例数量(N-shot)333355766总体准确率0.200.060.180.120.180.220.170.220.21表2(https://arxiv.org/html/2608.07700#S4.T2)报告了按部分的细分。内部运算符准确率在v1中已经很高(0.84),并始终保持在0.79–0.86区间内,这表明LLM能够可靠地处理SPARQL修饰符。随着SELECT DISTINCT、COUNT格式修复和rdf:type约束规则的引入,外部运算符准确率从0.75上升到0.86。BGP节点准确率是最不稳定的族,一旦将三元组计数提示添加到上下文中,就从v1的0.25跃升至v4的0.67,然后在这些提示保留在上下文中但不再直接用于选择后稳定在0.59左右。BGP谓词在整个研究中仍然是瓶颈,在0.20和0.31之间波动。总体指标从v6开始达到0.22,研究型智能体的编辑不再转化为增益。 表2:使用DeepSeek v3.2在DB25上的按部分准确率细分。智能体BGP节点BGP谓词内部运算符外部运算符总体v10.250.250.840.750.20v20.570.260.810.520.06v30.610.260.790.760.18v40.670.200.850.740.12v50.550.280.850.770.18v60.590.290.860.860.22v70.610.220.850.840.17v80.590.310.820.810.22v90.590.270.850.840.21我们选择v6作为为第二届TEXT2SPARQL挑战赛部署的智能体配置,理由是它在总体准确率上并列最高,同时在两个运算符族上也领先,而v8只是将v7回退到v6。性能指标的差距是由于LLM中的非确定性造成的。 ### 4.5 检查基准 0.22的结果远低于人们对具有映射工具的现代推理LLM的预期,这引发了一个自然的问题:剩余的错误真的是智能体的失败,还是基准的失败?对v6遗漏的问题进行人工检查后发现,DBpedia中存在反复出现的属性歧义模式。例如,问题*"How many unique authors have written science fiction novels?"*(有多少位独特作者写过科幻小说?)的预期查询为 SELECT DISTI
相似文章
SelfGraphRAG:通过合成QA生成弥合基于图的RAG中的监督缺口
SelfGraphRAG引入了一个框架,该框架从知识图谱生成合成问答对,以解决基于图的检索增强生成中的监督缺口,提升检索精度和推理性能。
@itarutomy: 一篇从头重建AI Agent研究"知识基础设施"的论文 (https://arxiv[.]org/html…
本文介绍了Agents-K1,一个基于246万篇论文构建的知识图谱系统,通过整合文本、图形、表格和方程式,以及五级引用分类,提升了AI Agent研究。它显著提高了Gemini-3和GPT-5.2等顶级模型在基准测试中的表现,表明优化知识结构比扩大模型规模更有效。
SABET-QA:时序知识图谱问答
SABET-QA 提出了一个用于时序知识图谱问答的迭代框架,通过双向实体-时序评分和上下文化增强了多跳推理,并在 CronQuestions 和 TimeQuestions 等基准测试中显示出相对于基线的一致改进。
@hxiao: 我不是知识图谱的粉丝,但最近出于一个令人惊讶的原因开始更频繁地使用它们:构建非平凡的…
作者描述使用基于Qwen模型构建的知识图谱提取器来生成具有挑战性的多跳问答对,用于评估智能体搜索系统。
先修复再增强:面向多跳问答的上下文增强知识图谱推理
本文提出了一种上下文增强的多跳问答训练框架,表明结合上下文图与知识图谱并使用强化学习可以提高生物医学领域的性能。