SABET-QA:时序知识图谱问答
摘要
SABET-QA 提出了一个用于时序知识图谱问答的迭代框架,通过双向实体-时序评分和上下文化增强了多跳推理,并在 CronQuestions 和 TimeQuestions 等基准测试中显示出相对于基线的一致改进。
arXiv:2608.20083v1 公告类型:新
摘要:时序知识图谱上的问答(TKGQA)需要对时间敏感的事实进行推理,但现有的基于嵌入的方法由于单次推理管道而在多步查询上存在困难。我们提出 SABET-QA,一个通过双向实体-时序评分机制和槽感知上下文化模块迭代优化多跳推理状态的框架,该模块将问题语义与时序知识图谱嵌入对齐。可微分的工作记忆实现渐进假设细化,而辅助时序边界在可用时作为粗监督。在 CronQuestions、Complex-CronQuestions、MultiTQ 和 TimeQuestions 上的实验表明,与强基线相比,有持续改进,特别是在复杂的多步时序查询上。
查看缓存全文
缓存时间: 2026/08/21 10:17
# SABET-QA:时序知识图谱问答 来源:https://arxiv.org/html/2608.20083 Brahim Touayouch 附属机构:巴黎-萨克雷高等师范学校,法国巴黎综合理工学院 \[0.4em\] 联系方式:[email protected] Dmitry Akulov\[0.6em\] QuickSort Research,法国巴黎 ###### 摘要 时序知识图谱问答(TKGQA)需要对时间敏感的事实进行推理,但现有的基于嵌入的方法由于采用单次推理流程,难以处理多跳查询。我们提出SABET-QA框架,通过双向实体-时序评分机制和槽位感知上下文化模块,在多个跳步间迭代式优化推理状态,使问题语义与时序KG嵌入对齐。可微分工作记忆支持逐步假设优化,而辅助的时序边界在可用时可提供粗监督信号。在CronQuestions、Complex-CronQuestions、MultiTQ和TimeQuestions上的实验表明,本方法相比强基线持续提升性能,尤其在复杂多跳时序查询上表现突出。 ††\*研究在法国巴黎QuickSort Research完成 (https://www.quicksort.fr/). 通讯作者:[email protected] 或个人邮箱.## 1引言 大规模知识图谱(KG)如Wikidata(Vrandečić and Krötzsch 2014 (https://arxiv.org/html/2608.20083#bib.bib36))、Freebase(Bollacker et al. 2008 (https://arxiv.org/html/2608.20083#bib.bib4))和YAGO(Suchanek et al. 2007 (https://arxiv.org/html/2608.20083#bib.bib32))的普及,使知识图谱问答(KGQA)成为访问结构化知识的关键接口。然而现实世界中的事实随时间演变,催生了时序知识图谱(TKG),其中事实被表示为五元组\(s,r,o,[ts,te]\)(\(s,r,o,[t_{s},t_{e}]\))。时序KGQA(TKGQA)作为在此类动态图上回答问题的任务,对于推理变化世界至关重要。 尽管静态KGQA已取得进展(Jiang et al. 2023 (https://arxiv.org/html/2608.20083#bib.bib18);Saxena et al. 2020 (https://arxiv.org/html/2608.20083#bib.bib30)),TKGQA仍面临独特挑战。自然语言问题包含显式时间约束(如“2008年谁是总统?”)或隐式组合约束(如“奥巴马之后谁是总统?”)。基于嵌入的方法(如CronKGQA(Saxena et al. 2021 (https://arxiv.org/html/2608.20083#bib.bib29)))将简单查询转化为链接预测,但难以处理复杂推理。后续工作如TempoQR(Mavromatis et al. 2021 (https://arxiv.org/html/2608.20083#bib.bib25))通过上下文化时间和实体信息丰富问题表示,但这些方法仍仅进行单次前向传播,缺乏迭代优化和有效聚合分布式时序证据的能力。 我们发现现有TKGQA方法存在三个具体差距: 1. 1\.单次推理:复杂问题需要序列推导(如先找到实体,再定位其任期,最后确定继任者)。单次传播模型无法回溯或修正中间错误。 2. 2\.方向模糊性:问题提及实体但未指定其在关系中的语法角色(头或尾)。现有模型常假设固定方向,导致评分错误。 3. 3\.上下文依赖歧义:如“华盛顿”可能指代人物、城市或州,具体取决于语境。当同一表述承载不同含义时,词汇匹配或固定实体链接会失效。 为解决这些差距,我们提出SABET-QA——一个结合槽位感知上下文化、双向实体-时序评分和迭代多跳推理的时序KGQA框架。当存在粗略时间提示时,SABET-QA将其作为额外监督信号利用。完整架构描述见第3.3节 (https://arxiv.org/html/2608.20083#S3.SS3)。 我们的贡献总结如下: - •提出SABET-QA,一个通过基于工作记忆的多跳推理过程逐步优化预测的迭代式时序KGQA框架。 - •引入双向实体-时序评分以解决头尾歧义,并改进对具有隐式方向结构问题的推理。 - •实证证明SABET-QA在CronQuestions(Saxena et al. 2021 (https://arxiv.org/html/2608.20083#bib.bib29))、Complex-CronQuestions(Chen et al. 2022 (https://arxiv.org/html/2608.20083#bib.bib11))、MultiTQ(Chen et al. 2023 (https://arxiv.org/html/2608.20083#bib.bib10))和TimeQuestions(Jia et al. 2021 (https://arxiv.org/html/2608.20083#bib.bib17))上超越强基线,在复杂问题上提升尤为显著。 ## 2相关工作 我们的工作涉及两个领域:时序知识图谱表示与(时序)知识图谱问答。 ### 2\.1时序知识图谱表示 基于嵌入的TKGQA建立在时序知识图谱嵌入(TKGE)方法之上。早期方法如TTransE(Leblay and Chekol 2018 (https://arxiv.org/html/2608.20083#bib.bib22))通过向评分函数添加时间嵌入,扩展了静态翻译模型(Bordes et al. 2013 (https://arxiv.org/html/2608.20083#bib.bib5))。近年来,张量分解方法日益突出(Cai et al. 2023 (https://arxiv.org/html/2608.20083#bib.bib6))。TComplEx(Lacroix et al. 2020 (https://arxiv.org/html/2608.20083#bib.bib21))将ComplEx(Trouillon et al. 2016 (https://arxiv.org/html/2608.20083#bib.bib34))扩展到四阶张量,并证明正则化分解能有效捕捉时间动态。这些结构化嵌入空间为TKG(Cai et al. 2024 (https://arxiv.org/html/2608.20083#bib.bib7))提供了紧凑的潜在表示,使下游模型能够以连续向量形式而非显式图遍历来推理关系和时间依赖。 ### 2\.2知识图谱问答 知识图谱问答(KGQA)沿三个主要方向演进:*语义解析*、*神经表示学习*和*基于大语言模型*的方法(Su et al. 2026 (https://arxiv.org/html/2608.20083#bib.bib31))。 语义解析方法(Berant et al. 2013 (https://arxiv.org/html/2608.20083#bib.bib3);Chen et al. 2024a (https://arxiv.org/html/2608.20083#bib.bib8);Yao and Van Durme 2014 (https://arxiv.org/html/2608.20083#bib.bib37);Bao et al. 2016 (https://arxiv.org/html/2608.20083#bib.bib2))将自然语言问题转化为形式逻辑或可执行结构化查询。它们提供显式推理轨迹和高可解释性,但依赖手工语法、模式特定算子或大量标注监督,限制了在复杂问题类型上的可扩展性。 神经表示学习方法将问题和图元素嵌入共享潜在空间。早期工作如KEQA(Huang et al. 2019 (https://arxiv.org/html/2608.20083#bib.bib14))和EmbedKGQA(Saxena et al. 2020 (https://arxiv.org/html/2608.20083#bib.bib30))将问答视为KG嵌入排序,避免了显式查询构建。后续方法结合图神经网络、注意力机制和多跳推理来建模结构依赖和组合问题(Sun et al. 2018 (https://arxiv.org/html/2608.20083#bib.bib33);Jia et al. 2021 (https://arxiv.org/html/2608.20083#bib.bib17);Liu et al. 2023 (https://arxiv.org/html/2608.20083#bib.bib24);Jiao et al. 2022 (https://arxiv.org/html/2608.20083#bib.bib19))。这些模型比语义解析器更具扩展性,能容忍噪声或不完整图,但为静态KG开发,未建模时间有效性。 基于大语言模型的方法通过生成可执行查询、对检索证据推理或结合检索与生成,将KGQA扩展到固定模板之外(Qian et al. 2024 (https://arxiv.org/html/2608.20083#bib.bib27);Jia et al. 2024 (https://arxiv.org/html/2608.20083#bib.bib16);Gao et al. 2024 (https://arxiv.org/html/2608.20083#bib.bib13);Chen et al. 2024b (https://arxiv.org/html/2608.20083#bib.bib9))。它们减少了人工设计的逻辑,提升了语言灵活性,但仍对检索质量、基础错误和幻觉敏感,且在非时序场景中最为成熟。 在时序KGQA中,这些局限被放大,因为答案取决于事实成立的时间。因此,该领域已从直接检索转向对时间敏感约束的多步推理。CronKGQA(Saxena et al. 2021 (https://arxiv.org/html/2608.20083#bib.bib29))将问题转化为时序嵌入空间中的*虚拟关系*,实现链接预测式回答。这对简单问题有效,但对序列推导或头尾歧义存在困难。TempoQR(Mavromatis et al. 2021 (https://arxiv.org/html/2608.20083#bib.bib25))通过上下文化时间和实体信息丰富问题表示,在复杂问题上取得更强性能,但其推理仍基本为单次传播,限制了修正中间假设的能力。SubGTR(Chen et al. 2022 (https://arxiv.org/html/2608.20083#bib.bib11))引入带逻辑约束的基于子图的时序推理,并指出CronQuestions中的伪时序问题。虽然在子图提取可靠时有效,但它严重依赖提取结构,在不完整或噪声图上,或跨数据集迁移时稳健性不足。 相比之下,SABET-QA遵循基于嵌入的虚拟关系范式,但增加了带可微分工作记忆的迭代多跳推理。在每个跳步,模型优化潜在推理状态,构建跳步特定关系表示,并为实体和时间戳计算中间分数。为解决头尾歧义,它采用双向实体评分,通过学习门控结合前向和后向信号。与依赖显式子图提取或数据集特定后处理的方法不同,SABET-QA直接基于预训练时序KG嵌入和自然语言问题操作,使其在基准测试间广泛适用,同时设计简洁。 近期工作也探索了基于大语言模型的自主智能体用于TKGQA,但这引入了显著的推理延迟、计算开销和对非确定性外部API的依赖。SABET-QA严格基于稠密嵌入范式运行,提供低延迟、确定性且可本地部署的推理。因此,我们将基于嵌入的基线作为合适参考类别进行比较。 ## 3时序知识图谱问答方法 ### 3\.1时序KG嵌入 我们使用TComplEx(Lacroix et al. 2020 (https://arxiv.org/html/2608.20083#bib.bib21))训练模型中使用的时序知识图谱嵌入。TComplEx用复数值嵌入表示实体、关系和时间戳,并通过多线性复数积对时序事实\(s,r,o,t\)进行评分: φ(s,r,o,t)=R(⟨us,vr,ūo,wt⟩),\\phi(s,r,o,t)=\\Re\\left(\\langle\\mathbf{u}_{s},\\mathbf{v}_{r},\\overline{\\mathbf{u}}_{o},\\mathbf{w}_{t}\\rangle\\right), 其中us(\\mathbf{u}_{s})、uo(\\mathbf{u}_{o})、vr(\\mathbf{v}_{r})和wt(\\mathbf{w}_{t})分别表示主语、宾语、关系和时间戳嵌入。 习得的实体和时间表示用于初始化所有QA模型的共享嵌入表(本文研究数据集使用的嵌入已在补充材料中提供。为促进未来工作,我们标准化了所有数据集的嵌入结构。部分嵌入从头训练,其余从先前工作初始化)。更多实现和训练细节见附录A (https://arxiv.org/html/2608.20083#A1)。 ### 3\.2基线方法 本节总结实验中使用的主要对比基线。 #### 3\.2\.1LM\_TKGQA:语言模型基线 LM\_TKGQA使用预训练语言模型(如BERT(Devlin et al. 2019 (https://arxiv.org/html/2608.20083#bib.bib12))或RoBERTa(Liu et al. 2019 (https://arxiv.org/html/2608.20083#bib.bib23)))编码问题,并将其投影到时序知识图谱嵌入空间。然后通过轻量级预测头对候选实体和时间戳排序,但未显式建模时序结构。 #### 3\.2\.2EmbedKGQA:基于嵌入的KGQA EmbedKGQA将问题表示为软关系,通过匹配知识图谱嵌入检索答案(Saxena et al. 2020 (https://arxiv.org/html/2608.20083#bib.bib30))。虽然对多跳推理有效,但未显式建模时序约束。 #### 3\.2\.3CRONKGQA:时序推理模型 CRONKGQA通过联合使用时序知识图谱嵌入预测实体和时间戳,扩展了基于嵌入的KGQA(Saxena et al. 2021 (https://arxiv.org/html/2608.20083#bib.bib29))。这实现了对时序排序和时间敏感事实的推理。 #### 3\.2\.4TempoQR:上下文化时序推理 TempoQR结合预训练语言模型、时序知识图谱嵌入和基于Transformer的融合模块(Mavromatis et al. 2021 (https://arxiv.org/html/2608.20083#bib.bib25))。这在显式融入时序信息的同时,提升了上下文理解。 #### 3\.2\.5SubGTR:基于子图的时序推理 SubGTR(Chen et al. 2022 (https://arxiv.org/html/2608.20083#bib.bib11))在围绕查询及其时序上下文提取的任务相关子图上进行推理。将推理限制在该邻域提高了效率,同时利用了局部图结构。 ##### 关于后处理和数据集依赖性。 某些基线(如SubGTR)依赖于针对特定数据集的额外后处理(如子图提取)。相比之下,我们的模型设计为无需任务特定处理即可跨数据集操作,便于在基准测试间迁移。 ### 3\.3所提方法:SABET-QA 图1:推理跳步数在Complex-CronQuestions上的影响。左:不同问题类别的Hits@1。右:整体测试集Hits@1和Hits@10。 模型 实体上下文化 双向实体&时序评分 强监督 复杂-CronQuestions Hits@1 Hits@10 SABET-QA-硬 ✓ ✓ ✓ 0.807 0.962 ✗ ✓ ✓ 0.707 0.946 ✓ ✗ ✓ 0.659 0.849 ✓ ✓ ✗ 0.524 0.896 表1:SABET-QA-硬在Complex-CronQuestions测试集上的消融研究。移除任何组件都会导致性能下降,其中禁用双向实体和时序评分时下降最大。 模型 冻结LM 冻结TKE Complex-CronQuestions CronQuestions Hits@1 Hits@10 Hits@1 Hits@10 SABET-QA ✓ ✓ 0.524 0.896 0.843 0.969 ✓ ✗ 0.446 0.871 0.773 0.950 ✗ ✓ 0.547 0.892 0.836 0.968 ✗ ✗ 0.476 0.882 0.784 0.946 SABET-QA-硬 ✓ ✓ 0.807 0.962 0.954 0.989 ✓ ✗ 0.759 0.958 0.925 0.983 ✗ ✓ 0.803 0.964 0.949 0.988 ✗ ✗ 0.769 0.959 0.902 0.974 表2:在无监督(SABET-QA)和强监督(SABET-QA-硬)两种情况下,冻结语言模型(LM)和时序知识图谱嵌入(TKE)模块影响的消融研究。该对比分离了每个组件的贡献,并展示了参数解冻对整体推理性能的影响。 SABET-QA通过K跳的迭代式潜在状态优化来回答时序问题。在每个跳步,模型生成双向实体和时间分数,然后更新可微分工作记忆以逐步精炼其假设。该架构将
相似文章
AdaTKG:用于时序知识图谱推理的自适应记忆
本文提出了 AdaTKG,一种用于时序知识图谱推理的方法,它利用自适应记忆随着新交互的发生动态优化实体表示,从而在性能上优于静态基线。
TRACE: 基于时间证据图的对话数据状态感知查询处理
本文提出 TRACE,一种查询处理框架,将对话数据建模为时间证据图,以支持对不断演进的用户状态进行状态感知推理,从而提高长对话问答中的时间推理和多跳推理能力。
AMATA:面向知识密集型问答的自适应多智能体轨迹对齐框架
提出AMATA,一种用于知识密集型问答的多智能体轨迹对齐框架,通过引入轨迹内偏好学习和智能体间依赖学习,提升事实依据和可解释性,在五个基准测试中优于基线方法。
面向知识图谱问答的研究者智能体
本文提出了一种自我改进的“研究者智能体”,用于知识图谱上的Text-to-SPARQL问答,该智能体能迭代优化自身的提示和工具。在DBpedia上进行评估,达到了0.22的准确率,并识别出谓词选择是主要瓶颈。
从教训中进化:面向操作级表格问答的技能增强表格图推理
本文提出了一种新的任务——操作级表格问答(Operation-wise TableQA),具有细粒度的问题分类,并提出了SkillTGR,一种技能增强的表格图推理框架,该框架利用图遍历和分层技能库实现自进化推理,取得了优越的性能和效率。