使用逻辑规则的知识编辑基准测试
摘要
介绍了一个基准测试,用于评估知识编辑方法如何处理事实编辑的逻辑后果,揭示了像ROME和FT这样的现有方法能准确插入直接断言,但未能传播蕴含知识,性能差距高达24%。
arXiv:2606.10554v1 Announce Type: new
摘要:大型语言模型(LLMs)越来越多地部署在需要访问最新知识的实际应用中。然而,重新训练LLMs的计算成本很高。因此,知识编辑技术对于维护预训练模型中的当前信息和纠正错误断言至关重要。当前的知识编辑基准测试主要关注回忆编辑过的事实,往往忽略其逻辑后果。为解决这一局限性,我们引入了一个新的基准测试,旨在评估知识编辑方法如何处理单次事实编辑的逻辑后果。我们的基准测试从知识图谱中提取给定编辑的相关逻辑规则,然后基于这些规则生成多跳问题,以评估对逻辑后果的影响。我们的研究结果表明,尽管现有的知识编辑方法能够准确地将直接断言插入LLMs,但它们通常无法注入蕴含知识。具体来说,使用像ROME和FT等流行方法的实验显示,在直接编辑的知识评估与蕴含知识评估之间存在高达24%的显著性能差距。这凸显了在知识编辑中需要语义感知评估框架的迫切性。
查看缓存全文
缓存时间: 2026/06/10 06:11
# 使用逻辑规则基准测试知识编辑
来源:https://arxiv.org/html/2606.10554
11institutetext:数据科学小组,海因茨·尼克斯多夫研究所,帕德博恩大学
11email:tatiana\.moteu@upb\.de, jean\.kouagou@upb\.de, hamada\.zahera@upb\.de, axel\.ngonga@upb\.de###### 摘要
大型语言模型(LLMs)日益被部署在需要访问最新知识的现实世界应用中。然而,重新训练LLMs计算成本高昂。因此,知识编辑技术对于在预训练模型中维护当前信息和纠正错误断言至关重要。当前的知识编辑基准主要集中在回忆已编辑的事实,通常忽略了它们的逻辑后果。为了解决这一局限性,我们引入了一个新的基准,旨在评估知识编辑方法如何处理单个事实编辑的逻辑后果。我们的基准从知识图谱中为给定的编辑提取相关的逻辑规则。然后,它基于这些规则生成多跳问题,以评估对逻辑后果的影响。我们的研究结果表明,虽然现有的知识编辑方法能够准确地将直接断言插入LLMs,但它们常常无法注入蕴含的知识。具体来说,使用流行的ROME和FT等方法的实验显示,在直接编辑知识和蕴含知识的评估之间存在高达24%的巨大性能差距。这突显了在知识编辑中迫切需要语义感知的评估框架。
## 1 引言
大型语言模型(LLMs)中的知识编辑(KE)旨在更新过时或不正确的信息,而无需重新训练整个模型。这项任务至关重要,因为当前的LLMs无法自动适应新信息,且重新训练它们的计算成本高昂[14 (https://arxiv.org/html/2606.10554#bib.bib22),12 (https://arxiv.org/html/2606.10554#bib.bib24)]。现有研究主要集中在两种知识编辑方法上:(i) 基于参数的方法(例如,ROME[7 (https://arxiv.org/html/2606.10554#bib.bib3)],MEMIT[8 (https://arxiv.org/html/2606.10554#bib.bib11)]),这些方法定位与LLMs中特定知识相关的参数并更新它们以纳入新信息,以及(ii) 基于记忆的方法(例如,MeLLo[23 (https://arxiv.org/html/2606.10554#bib.bib8)],PokeMQA[6 (https://arxiv.org/html/2606.10554#bib.bib9)]),这些方法使用外部存储器存储新的知识进行编辑,而不修改预训练权重,从而保留LLM中已有的知识。虽然当前针对KE方法的基准主要评估直接编辑[20 (https://arxiv.org/html/2606.10554#bib.bib39)],但一个显著的挑战仍然存在:评估编辑一条知识如何影响相关信息。这通常被称为关联知识或多跳知识[18 (https://arxiv.org/html/2606.10554#bib.bib32),15 (https://arxiv.org/html/2606.10554#bib.bib33)]。例如,考虑使用“唐纳德·特朗普是美国现任总统”这一信息更新语言模型。虽然这个直接编辑确保了模型能正确回答“美国总统是谁?”为“唐纳德·特朗普”,但模型对相关查询的响应能否反映此编辑也同样至关重要。例如,像“美国总统的配偶是谁?”这样的问题现在应该得出“梅拉尼娅·特朗普”,而“美国副总统是谁?”应该给出与特朗普政府相对应的答案。这些例子强调了评估编辑是否能在模型中跨相互关联的事实连贯传播的必要性。不同的研究表明,当前的KE方法能够准确回忆已编辑的断言[22 (https://arxiv.org/html/2606.10554#bib.bib40)]。然而,它们常常无法在相关信息之间保持一致性[11 (https://arxiv.org/html/2606.10554#bib.bib26),3 (https://arxiv.org/html/2606.10554#bib.bib27)],这凸显了对更全面评估框架的需求。MQuAKE[23 (https://arxiv.org/html/2606.10554#bib.bib8)]基准通过评估模型在多跳问题上的表现来解决这一局限性,这些问题需要对受单个编辑影响的事实链进行推理。然而,MQuAKE依赖于人工策划的多跳问题,这限制了其在跨领域知识编辑上的可扩展性和覆盖范围。
参见图注图 1:一个带有相关知识的单次编辑示例。在本文中,我们提出了一个新的基准,它不仅评估直接编辑断言的保留情况,还评估模型对这些编辑逻辑蕴含的知识进行推理和推断的能力。与需要昂贵的人工策划且难以跨领域或数据集迁移的特定领域基准不同,我们的方法基于逻辑规则为任何领域自动生成测试用例,确保了可扩展性和适应性。具体来说,我们的方法使用AMIE3[5 (https://arxiv.org/html/2606.10554#bib.bib19)]——一个用于知识图谱的规则挖掘系统——来自动提取逻辑关系并生成测试用例。这些规则引导LLM(例如,GPT-4)生成多跳问题作为测试用例,以验证对基本断言的编辑是否传播到关联知识。图1 (https://arxiv.org/html/2606.10554#S1.F1)说明了这个过程:编辑一个断言(例如,将Valerie Hobson的国籍从英国更新为澳大利亚)需要通过逻辑规则对关联断言(例如,Valerie Hobson配偶的国籍)进行相应的更新。当直接断言被修改时,我们的基准通过使用挖掘出的逻辑关系(例如,配偶通常共享国籍)生成多跳问题(例如,Valerie Hobson的配偶是哪个国籍?)来评估KE方法是否将此更改传播到依赖知识。我们的评估结果显示,在直接知识和关联知识的评估之间,KE的有效性存在显著差异,特别是在对关联知识进行推理时。通过自动化测试用例生成,我们实现了对KE方法如何处理推理链的低成本且稳健的评估,揭示了在断言相互依赖的现实场景中的弱点。本文的主要贡献总结如下:
- •我们提出了一种新的KE基准方法,利用逻辑规则在KE基准测试中增强关联知识。我们还使用两个现有数据集对现有KE方法进行了评估。
- •我们进行了多项实验,以评估不同的KE方法在基于逻辑规则生成的测试用例上的表现。
- •我们将基准框架作为开源代码发布在GitHub仓库中111https://github.com/dice-group/Benchmarking-KE,用于复现我们的实验并支持知识编辑领域的进一步研究。
## 2 相关工作
### 2.1 知识编辑方法概述
近期知识编辑领域的进展专注于更新预训练的LLMs,而无需重新训练整个模型。这些方法大致可分为以下几类:
#### 基于模型的编辑。
这些方法包括直接修改模型权重的参数中心技术。例如,ROME(Rank-One Model Editing)[7 (https://arxiv.org/html/2606.10554#bib.bib3)]将transformer中的多层感知器(MLP)模块视为键值存储,并对MLP权重应用秩一更新以实现精确的事实更新。该方法允许进行目标编辑,同时保持模型内部知识的完整性。类似地,MEMIT(Mass-Editing Memory in a Transformer)[8 (https://arxiv.org/html/2606.10554#bib.bib11)]通过同时更新多个记忆并识别用于记忆存储的关键层次来扩展这个过程。尽管这种方法在局部编辑方面表现出色,但它常常难以在相互关联的事实之间保持一致性。
#### 外部记忆集成。
诸如MeLLo(Memory-Based Language Model Editing)[23 (https://arxiv.org/html/2606.10554#bib.bib8)]之类的方法通过将编辑后的事实外部化,将知识存储与模型参数解耦。通过迭代提示LLM使其输出与这些存储的事实对齐,MeLLo在多跳推理任务中实现了鲁棒性。然而,对外部记忆的依赖引入了延迟和可扩展性方面的挑战。
#### 模块化推理框架。
像PokeMQA(Programmable Knowledge Editing for Multi-hop QA)[6 (https://arxiv.org/html/2606.10554#bib.bib9)]这样的系统将编辑分解为子任务,例如使用专门模块进行问题分解和冲突检查。这种模块化设计提高了可解释性,但需要大量的特定任务工程。
### 2.2 知识编辑基准
知识编辑的评估框架分为两种范式:
#### 逻辑无关基准。
这些框架优先考虑事实准确性和编辑局部性,而非推理约束。例如,Chen等人[1 (https://arxiv.org/html/2606.10554#bib.bib1)]通过可靠性(编辑后正确性)、泛化性(释义处理)和局部性(无关事实保留)来评估编辑。多跳基准[23 (https://arxiv.org/html/2606.10554#bib.bib8)]评估编辑通过知识链的传播,而可编程基准[6 (https://arxiv.org/html/2606.10554#bib.bib9)]模拟动态场景。然而,它们的合成性质限制了其现实世界的适用性。
#### 逻辑感知基准。
这些框架融入了结构化的推理约束。例如,RULE-KE框架[2 (https://arxiv.org/html/2606.10554#bib.bib7)]通过利用逻辑规则在相关事实间传播编辑来强制执行一致性。Ou等人[9 (https://arxiv.org/html/2606.10554#bib.bib38)]使用基于电路的分析来定位逻辑推理,而本体驱动的方法[21 (https://arxiv.org/html/2606.10554#bib.bib12)]通过知识图谱验证层次一致性。Wu等人[17 (https://arxiv.org/html/2606.10554#bib.bib13)]将其扩展到用于动态知识的时序逻辑。然而,这些基准需要费力的规则形式化,并且在可扩展性方面面临挑战。
#### 基于文档的基准。
这些框架测试模型如何在包含推理和泛化需求的长文本中整合知识编辑。例如,Wu等人[19 (https://arxiv.org/html/2606.10554#bib.bib41)]引入了一个新的基准和评估框架,用于测试语言模型如何在基于文档的设置中保留和应用编辑后的知识,而不仅仅是在孤立的事实编辑中。然而,其推理仍然有限且缺乏符号可追溯性。此外,该框架没有明确测试逻辑一致性或规则违反情况。
参见图注图 2:我们用于评估知识编辑方法的基准工作流程。
数据:
DD;
//基准数据集
1
结果:
G\\mathcal\{G\};
//构建的KG(三元组集合)
2
G←\{\}\\mathcal\{G\}\\leftarrow\\\{\\\};
//初始化三元组集合
3**for each*questioninDD*do**
E←spaCy\(question\)E\\leftarrow\\text\{spaCy\}\(\\texttt\{question\}\);
//从问题中提取实体
4
5**for each*e∈Ee\\in E*do**
6
e\_uri←find\_DBpedia\_uri\(e\)e\\\_uri\\leftarrow find\\\_\\text\{DBpedia\}\\\_uri\(e\);
7**if*e\_urie\\\_uriis valid*then**
8
Striples←query\_DBpedia\_SPARQL\_endpoint\(e\_uri\)S\_\{triples\}\\leftarrow query\\\_DBpedia\\\_\\text\{SPARQL\}\\\_endpoint\(e\\\_uri\);
9
G←G∪Striples\\mathcal\{G\}\\leftarrow\\mathcal\{G\}\\cup S\_\{triples\};
10
11**else**
12跳过与
e\_urie\\\_uri相关的三元组;
13
14
15
16
17**return**
G\\mathcal\{G\};
算法 1构建G\\mathcal\{G\}
## 3 方法论
### 3.1 任务定义:在LLM中对知识编辑进行基准测试
知识编辑更新语言模型(LLMs)中的断言知识,同时保留其推理能力。我们通过对直接编辑及其关联影响进行评估来形式化此任务。令G⊆E×R×E\\mathcal\{G\}\\subseteq\\mathcal\{E\}\\times\\mathcal\{R\}\\times\\mathcal\{E\}表示一个知识图谱,包含实体E\\mathcal\{E\}和关系R\\mathcal\{R\}。一个编辑集X=\{\(ai,ai′\)\}i=1n\\mathcal\{X\}=\\\{\(a\_\{i\},a^\{\\prime\}\_\{i\}\)\\\}\_\{i=1\}^\{n\}包含断言对,其中ai=\(si,ri,oi\)a\_\{i\}=\(s\_\{i\},r\_\{i\},o\_\{i\}\)是原始三元组,ai′=\(si,ri,oi′\)a^\{\\prime\}\_\{i\}=\(s\_\{i\},r\_\{i\},o^\{\\prime\}\_\{i\}\)是其更新。给定一个LLMLL和编辑方法M\\mathcal\{M\},我们使用两个标准评估编辑后的模型L∗=M\(L,X\)L^\{\*\}=\\mathcal\{M\}\(L,\\mathcal\{X\}\):
1. 1.**编辑成功**。该指标衡量直接更新的效果:EditSucc\(ai,ai′\)=I\[PL∗\(oi′∣q\(si,ri\)\)\>PL\(oi∣q\(si,ri\)\)\],\\text\{EditSucc\}\(a\_\{i\},a^\{\\prime\}\_\{i\}\)=\\mathbb\{I\}\\left\[P\_\{L^\{\*\}\}\(o^\{\\prime\}\_\{i\}\\mid q\(s\_\{i\},r\_\{i\}\)\)\>P\_\{L\}\(o\_\{i\}\\mid q\(s\_\{i\},r\_\{i\}\)\)\\right\],\(1\)其中q\(si,ri\)q\(s\_\{i\},r\_\{i\}\)查询关于sis\_\{i\}的rir\_\{i\},PL\(oi∣q\)P\_\{L\}\(o\_\{i\}\\mid q\)是LL对于答案oio\_\{i\}的基准概率。
2. 2.**逻辑一致性**。这确保编辑通过逻辑依赖关系传播。对于每个\(ai,ai′\)\(a\_\{i\},a^\{\\prime\}\_\{i\}\),令Ri=\{φj\}j=1kR\_\{i\}=\\\{\\phi\_\{j\}\\\}\_\{j=1\}^\{k\}表示由AMIE3[5 (https://arxiv.org/html/2606.10554#bib.bib19)]挖掘出的规则,这些规则链接到相关断言\{ac\(j\)=\(sc\(j\),rc\(j\),oc\(j\)\)\}\\\{a^\{\(j\)\}\_\{c\}=\(s^\{\(j\)\}\_\{c\},r^\{\(j\)\}\_\{c\},o^\{\(j\)\}\_\{c\)\)\\\}。我们计算:
Consistency\(ai,ai′\)=1k∑j=1kI\[PL∗\(o^c\(j\)∣qc\(j\)\)\>PL\(oc\(j\)∣qc\(j\)\)\],\\text\{Consistency\}\(a\_\{i\},a^\{\\prime\}\_\{i\}\)=\\frac\{1\}\{k\}\\sum\_\{j=1\}^\{k\}\\mathbb\{I\}\\left\[P\_\{L^\{\*\}\}\(\\hat\{o\}^\{\(j\)\}\_\{c\}\\mid q^\{\(j\)\}\_\{c\}\)\>P\_\{L\}\(o^\{\(j\)\}\_\{c\}\\mid q^\{\(j\)\}\_\{c\}\)\\right\],\(2\)其中I\\mathbb\{I\}是一个指示函数,如果条件为真则返回1,否则返回0。o^c\(j\)\\hat\{o\}^\{\(j\)\}\_\{c\}是将规则φj\\phi\_\{j\}应用于ai′a^\{\\prime\}\_\{i\}后续期的答案,而qc\(j\)=q\(sc\(j\),rc\(j\)\)q^\{\(j\)\}\_\{c\}=q\(s^\{\(j\)\}\_\{c\},r^\{\(j\)\}\_\{c\}\)。例如,编辑Valerie Hobson的国籍\(aia\_\{i\}\)会通过规则φj:spouse\(X,Y\)∧citizenship\(X,Z\)⇒nationality\(Y,Z\)\\phi\_\{j\}:\\text\{spouse\}\(X,Y\)\\land\\text\{citizenship\}\(X,Z\)\\Rightarrow\\text\{nationality\}\(Y,Z\)生成关于该配偶的国籍\(ac\(j\)a^\{\(j\)\}\_\{c\}\)的查询。
### 3.2 评估工作流程
#### 对预训练LLM应用直接编辑:
如图2 (https://arxiv.org/html/2606.10554#S2.F2)所示,我们首先将KE方法应用于原始模型,并保存编辑后的模型权重。
#### 挖掘逻辑规则:
我们构建一个知识图谱,并使用AMIE3作为挖掘工具,从构建的知识图谱的一组三元组中生成逻辑规则。
#### 基于规则生成QA对:
我们使用生成的规则,提示LLM生成QA对,这些QA对随后作为测试用例来验证KE方法。
数据:
DD,
G\\mathcal\{G\},
LLMLLM,
Φ\\Phi;
//数据集、知识图谱、QA生成模型、规则
1
结果:
QQ;
//测试用例的问题和答案
2
3
Q←\{\}Q\\leftarrow\\\{\\\};
//初始化空字典
4
5**for each*question∈D\\in D*do**
triples←G\[question\]\\texttt\{triples\}\\leftarrow\\mathcal\{G\}\[\\texttt\{question\}\];
//获取与问题相关的三元组
6
relevant\_relations←\{r\|\(e1,r,e2\)∈triples\}\\texttt\{relevant\\相似文章
一罩定乾坤:编辑后隐藏事实的发现与探究
本文研究了知识编辑方法ROME和MEMIT的内部机制,揭示了这些编辑依赖于一个共同的权重功能子空间,且是抑制而非覆盖知识,从而解释了编辑为何无法传播到相关事实。
面向异构知识的LLM反事实基准测试与训练:实现事实一致性和顺序稳健的接地推理
本文介绍了TKFQA,一个包含10,130个基于表格、文本和知识图谱的问答对的反事实基准,用于评估LLM的事实一致性和顺序稳健推理,并提出了ORLF,一种训练框架,可提高推理链准确性并降低对输入顺序的敏感性。
基准测试的基准测试:检验常识基准的预测效度
本文通过评估23个大语言模型在四个基准测试及其改进版本上的表现,检验常识基准分数是否能预测现实世界下游任务的表现,发现改进版本保持了排名,但仅提供依赖于任务的预测效度。
识别与解决知识型VQA基准测试的陷阱:审计、修复与增强
本文对知识型VQA基准进行了审计,揭示了系统性的假设违反,使得准确率成为误导性指标。它提出了一种修复协议和多实体增强方法,以恢复答案可推导性和问题清晰度,表明修正后的设置产生了显著不同的模型排名。
重新审视大语言模型中基于参数的知识编辑:理论极限与实证证据
本文对LLMs中基于参数的知识编辑进行了理论分析,揭示了局部编辑如何导致全局推理崩溃,并提供了检索方法优于参数编辑方法的实证证据。