关于范围分类与当前知识编辑基准:一个负面结果,以INLAY作为无梯度案例研究

arXiv cs.CL 论文

摘要

本文提出一个负面结果,表明当前知识编辑基准无法有效评估范围分类器。使用INLAY(一个无梯度编辑器)来演示,由于基准的结构性限制,没有逐查询路由方法能提高性能。

arXiv:2608.26292v1 公告类型:新 摘要:SERAC系列中每个基于记忆的知识编辑器都依赖于一个范围决策:给定一个查询,存储的编辑是否适用?我们报告当前知识编辑基准完全无法衡量这一决策。使用INLAY(一个我们构建的无梯度编辑器,以获取准确的逐查询真实值——模型被冻结,编辑存储在外部可寻址内存中,应用编辑是在解码时沿一个token的反嵌入方向添加偏置),我们在1,689个查询上执行所有候选路由器操作,这些查询涵盖三个数据集和三种输入条件。每次都选择最佳操作的神谕路由器在所有九个数据集与条件组合中,与一行静态策略在四小数点上持平:任何逐查询路由方法的最大可获得增益为0.00点。弃权作为唯一获胜操作在1,689次中零次成功。原因是结构性的:这些是反事实基准,其评估问题要求提供编辑后的答案,因此从参数化知识回答在结构上就是错误的,并且没有负面样本的基准无法奖励分类器拒绝的能力。这超出了我们的系统,扩展到基准用于评估的整个范围分类器家族。我们直接确认了机制:通过自己构建缺失条件——在样本的一半中扣留查询自身的编辑索引,将池化上限从精确的+0.0000移动到+0.0420,并给予弃权首次胜利。我们还报告了INLAY本身不胜利的情况(WISE在Qwen2.5-7B CounterFact上击败了它,而检索增强生成在严格匹配的RippleEdits上击败了我们测试的所有方法,包括INLAY),并披露了在我们自己路由机制的自审中发现的两个错误,这两个错误都没有改变噪声范围之外的已发布头条数字。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:25

# 论领域分类与当前知识编辑基准:一项负面结果,以无梯度方法INLAY为例
来源:https://arxiv.org/html/2608.26292
###### 摘要

SERAC体系中的每个基于记忆的知识编辑器都依赖于一个领域决策:给定一个查询,已存储的编辑是否适用?我们发现,当前的知识编辑基准完全无法衡量这一决策。我们使用INLAY(一个无梯度编辑器,为获取精确的逐查询标准答案而构建——模型保持冻结,编辑存储于外部可寻址存储器,应用编辑时在解码阶段沿单个词元的解嵌方向添加偏置)执行了1,689个查询上所有可能的路由操作,这些查询跨越三个数据集和三种输入条件。一个每次选择最佳操作的神话路由器,在所有九个数据集-条件组合单元中,与简单的静态策略在小数点后四位完全一致:任何逐查询路由方法可获得的最大增益为0.00分。在1,689次查询中,回避操作作为唯一正确操作的次数为零。其根源在于结构性原因:这些反事实基准的评估问题要求给出编辑后的答案,因此使用参数化知识回答本身就是错误的,而一个没有负面案例的基准也无法奖励分类器拒绝的能力。这一结论不仅适用于我们的系统,也普遍适用于该基准所评估的整个领域分类器家族。我们直接证实了其机制:通过在一半样本中对查询隐藏其自身的编辑来构建缺失条件,使聚合的改进空间从+0.00精确变为+0.042,并让回避操作首次取得胜利。我们还报告了INLAY本身未能获胜的情况(WISE在Qwen2.5-7B的CounterFact数据集上优于它,而检索增强生成在严格匹配的RippleEdits数据集上优于我们测试的所有方法,包括INLAY),并披露了在对自己路由机制的自我审计中发现的两个错误,这两个错误并未改变我们已发表的、超出噪声范围的主要数字。

## 1引言

语言模型的知识并非存储在某个可指明的单一位置。没有一行写着“XX公司的CEO是YY”;这个事实是分布于数十亿权重中的一种模式,而每个权重又同时参与成千上万个无关事实。在训练后纠正一个事实(因为它在现实中改变了,或一开始就是错误的)就是知识编辑问题,现在有一大类方法通过定位并重写权重(Meng et al., 2022;Meng et al., 2023;Fang et al., 2025)或在权重之外存储修正并针对每个查询决定存储的修正是否适用(Mitchell et al., 2022b;Hartvigsen et al., 2023;Wang et al., 2024)来解决这一问题。

第二类方法是本文的主题。其中的每一种方法都需要一个领域分类器:一个组件,它查看传入的查询并决定是某个编辑适用于它、一个上下文内示范应该生效,还是模型应该简单地从其已有知识中回答。SERAC的领域分类器(Mitchell et al., 2022b)是其命名实例,但在每一个将冻结或轻度修改的基础模型与外部修正机制配对的架构中,这一相同的决策以不同的名称反复出现。我们构建了这样一个系统,在三个标准基准上执行它可能对每个查询采取的每一种操作,结果发现,这整个架构家族所围绕构建的决策,无法被用于评估它的基准所奖励。

#### 我们为何能如此确信而非猜测。

通常“基准未测试XX”的证据是间接的:某个本应无关紧要的消融研究确实无关紧要,或者一个更简单的基线具有竞争力。我们则计算了*上限*。对于覆盖CounterFact、WikiUpdate和MQuAKE-CF三个数据集在结构化、非结构化及提取证据条件下的1,689个查询,我们执行了*每一种*可能的操作(背诵存储的编辑、基于检索的证据推理或回避),并对每种结果进行评分,从而得到每个查询的正确操作标准答案。一个总是选择最佳可用操作的神话路由器在所有九个单元格中*完全等于*一个简单的静态策略(§6)。任何路由器都没有提升空间,因为回避操作——领域分类器旨在选择的操作——作为唯一正确操作的次数为零。

#### INLAY的位置。

为了获得这个标准答案,我们需要一个系统,其每种操作都能在相同条件下实际执行和评分,包括一个无梯度的背诵路径,没有针对每次编辑的优化成本。我们构建了INLAY:基础模型保持冻结,每个编辑是外部可寻址存储器中的一行(一个语义键加上答案的词元序列),应用编辑时在解码阶段沿答案的解嵌方向添加一个logit空间偏置。写入编辑是表格插入,耗时约5-15毫秒,无梯度步骤;删除编辑是移除该行;当没有编辑生效时,输出逐位不变。INLAY在直接的单事实编辑上与基于梯度的编辑器有竞争力甚至领先(§5),但它并不总是我们测试中最强的方法,我们明确报告了它失败的情况(§5,§5.4)。INLAY是本文核心主张的载体,而非主张本身。

#### 贡献。

(i)一个带有测量上限的负面结果,而非猜测:在1,689个具有逐操作标准答案的查询上,一个神话路由器在每个单元格中与一个简单的静态策略完全一致,且回避操作从未是唯一正确的(§6–§7)。(ii)INLAY,一个具有精确删除和本地化设计的无梯度编辑器,在四个模型系列和所有三种AKEW输入条件下进行评估,包括权重编辑无机制的证据格式(§3–§5)。(iii)对INLAY失败之处的坦诚说明:WISE在Qwen2.5-7B的CounterFact数据集上击败它,而RAG在严格匹配的RippleEdits数据集上击败了我们测试的所有方法,包括INLAY(§5,§5.4),这纠正了早期草案中隐含的一个假设,即所述边界是针对权重编辑器的,而实际揭示它的基准更倾向于检索。(iv)对我们自身路由机制的透明自我审计,包括一个使已发布的数字中的缓解措施失效的门旁路错误(§8)。(v)对多跳链终止问题的诊断和修复,将准确率提高两倍以上并在两个模型规模上保持(§5.3)。

## 2相关工作

#### 权重编辑。

ROME(Meng et al., 2022)将中间层MLP视为线性联想记忆并求解秩一更新;MEMIT(Meng et al., 2023)将多次更新分布到多个层以进行批量编辑;AlphaEdit(Fang et al., 2025)将更新投影到保留知识的零空间中。所有三种方法都需要干净的(提示,目标)对并修改共享参数。Hase et al. (2023)表明,在因果追踪*未*高亮显示的层上进行编辑通常效果同样好,这削弱了从定位到编辑位点的推理。

#### 基于记忆和领域分类的编辑。

SERAC(Mitchell et al., 2022b)引入了一个领域分类器来决定编辑是否适用,将范围内输入路由到反事实模型。MEND(Mitchell et al., 2022a)学习梯度变换。IKE(Zheng et al., 2023)表明,少样本示范可以教会模型更倾向于注入的事实而非其参数化信念。GRACE(Hartvigsen et al., 2023)和WISE(Wang et al., 2024)分别添加了离散码本和侧存储器,每个在生成时都有自己的路由决策。我们直接基于SERAC的领域分类器思想和IKE的示范机制构建;本文不声称这两者是新颖的。我们的寻址遵循产品键记忆(Lample et al., 2019)和最近邻语言模型(Khandelwal et al., 2020)。

#### 基准。

CounterFact和zsRE评估单事实编辑;RippleEdits(Cohen et al., 2024)添加蕴涵结果;MQuAKE(Zhong et al., 2023)添加多跳链;AKEW(Wu et al., 2024)在干净三元组之外提供非结构化和提取的证据。§6–§7是关于这整个基准家族能衡量什么、不能衡量什么的主张,与哪个领域分类方法在其上被评分无关。

图1:(a)权重编辑重写每个事实共享的状态。INLAY保持模型冻结并在旁边的表格中添加一行。(b)干预是在最后解码步骤沿单个词元的解嵌方向添加的偏置,因此它只移动一个分数。当门未触发时,不添加任何内容,输出逐位相同。

## 3方法:INLAY

INLAY的存在是为了使§6中的路由问题能够用精确、可执行的标准答案来回答:每种候选操作必须是我们可以运行和评分的真实代码路径,包括一个足够廉价以进行大规模执行的无梯度背诵路径。我们在此简要描述;它是本文论证的载体,而非其主题。

### 3.1设计

模型保持冻结。每个编辑是一行,包含一个键(事实问题形式的嵌入)、答案的词元序列和元数据(图1a)。写入是插入,而非优化:无梯度,无协方差统计,测量耗时5-15毫秒。删除是精确的:移除该行即删除该编辑,这在删除是法规要求而非可选操作时至关重要(见伦理声明)。编辑不会相互干扰:它们是物理隔离的状态。

### 3.2寻址

键来自句子编码器(Reimers and Gurevych, 2019),而非基础模型的隐藏状态:它速度快,其几何结构专为释义匹配而训练,并且在基础模型被替换时保持固定。键通过Johnson-Lindenstrauss随机投影进行压缩(Johnson and Lindenstrauss, 1984),选择它而非学习投影,因为学习投影会随着编辑分布的变化而漂移,并悄无声息地使每个存储的键失效;固定随机矩阵永不会使存储器失效,代价是引入少量失真。

### 3.3门控与回放

检索总会返回*某些内容*。门结合了绝对相似度阈值、对第二名的优势间隔以及一个关系残差检查,询问查询是否涉及存储的关系而不仅仅是存储的主体(我们在§8中讨论此门的可靠性)。当门触发时,回放遍历存储的词元序列,并在每个解码步骤沿该词元的解嵌列添加偏置,使其赢得argmax(图1b)。答案跨度之外的位置不受影响。在logit空间而非隐藏状态进行干预是一个安全性论点:logit偏置只移动一个分数,而隐藏状态干预通过解嵌传播到每个词元的logit,其方式难以约束;并且由于干预是门控的,静默门控使行为逐位不变。

## 4实验设置

基础模型:GPT-2-XL(1.5B),GPT-J-6B,Qwen2.5-7B,和Mistral-7B-v0.3。基准:CounterFact,zsRE,RippleEdits(Cohen et al., 2024),和AKEW(Wu et al., 2024)覆盖CounterFact、WikiUpdate和MQuAKE-CF在结构化、非结构化及提取条件下。基线通过EasyEdit(Wang et al., 2023)运行。

有两个承诺值得说明,因为它们以结果为代价。数据划分采用主题不相交原则:一个主题从不跨越训练/测试边界,因此学习组件无法记住一个实体并表现出泛化能力。评分在所有情况下使用一种约定(对标准答案及其别名进行不区分变音符号和大小写的子字符串匹配),而非每个方法的内部指标,因此数字在使用不同报告方式的方法间具有可比性。

一个实现细节实质性地影响了正确性:以`sequential_edit=False`调用`BaseEditor.edit`会在返回前恢复权重,因此在其返回后生成会评分*未编辑*的模型。此处报告的所有运行都使用`sequential_edit=True`,并在测试工具控制下进行显式的state-dict快照和恢复。这个错误,以及第二个特别使早期一轮匹配的RippleEdits数字无效的错误,在§8中讨论。

## 5结果

### 5.1编辑准确率与写入成本

图2:CounterFact数据集、结构化输入、GPT-J-6B模型上的编辑准确率,n=147,95% Wilson区间(Wilson, 1927)。使用单一约定而非每个方法的内部指标评分。图2给出了GPT-J-6B的比较。AlphaEdit是最强的权重编辑器,达到89.12%,这与其零空间约束使每次更新更具针对性的特性一致。ROME和MEMIT并列83.67%:单事实CounterFact是两者都收敛的地方,MEMIT的优势在于多编辑保存,而非单编辑效能。两个在其他地方有效的方法在此失败:WISE达到66.67%,尽管EasyEdit自身的编辑后指标报告编辑在147个示例中的141个上落地,因为WISE在生成时通过侧存储器模块路由,而该路由是一个额外的失败点,就地更新没有这个点;GRACE在每个编辑上恰好读得0.0,其基于半径的键很少在释义上触发。在N=2000时,ES/PS/NS的调和平均分上,INLAY以0.8926领先,ROME为0.797,WISE为0.703,AlphaEdit为0.4595,MEMIT为0.4314(完整结果审计.md,A2部分)。INLAY写入耗时5-15毫秒,无梯度步骤,而基于梯度的编辑器需要数秒,比率约为1600倍。

此排名并非在所有模型上成立。在N=2000的Qwen2.5-7B CounterFact数据集上,WISE达到调和平均分0.9466(ES 1.0,PS 0.8553,NS 1.0),而INLAY在N=5000时为0.8944。

相似文章

使用逻辑规则的知识编辑基准测试

arXiv cs.CL

介绍了一个基准测试,用于评估知识编辑方法如何处理事实编辑的逻辑后果,揭示了像ROME和FT这样的现有方法能准确插入直接断言,但未能传播蕴含知识,性能差距高达24%。

长上下文LLM中的位置失败:推理基准测试的盲点

arXiv cs.CL

本论文识别出长上下文LLM推理基准测试中的一个盲点:它们未能控制任务在上下文中的位置,导致位置失败未被检测到。作者提出上下文旋转评估(CRE)来系统地改变任务位置、填充内容和上下文长度,揭示出当推理任务放置在长上下文中时,某些模型的准确率会严重下降。

QuoteBench: 匹配分数如何掩盖命令路径失败

Hugging Face Daily Papers

QuoteBench 揭示了执行边界解析错误显著降低了大型语言模型编程代理的成功率,并且披露边界有助于恢复性能,这表明评估必须考虑部署配置,而不是将匹配分数视为模型的内在属性。