ConceptGuard:大型语言模型中上下文敏感遗忘的基准测试

arXiv cs.CL 论文

摘要

本文介绍了ConceptGuard,这是一个基准测试,用于评估大型语言模型中使用双重用途概念的上下文敏感遗忘能力,揭示了当前遗忘技术在此实际评估框架下表现不佳。

arXiv:2608.20338v1 公告类型:新 摘要:大型语言模型(LLMs)越来越多地需要选择性地移除有害或敏感知识,即遗忘,但现有的方法和基准测试未能完全评估这种能力。当前方法依赖于由独立事实组成的不相交的遗忘集和保留集,并使用简单直接的事实召回来衡量成功。这种框架未能捕捉到遗忘的一个关键要求,即消除有害行为的同时保留良性和有益知识的能力。我们认为,有效的遗忘必须在概念层面操作,确保完全移除不安全的应用,同时保持其正确和有用的使用,从而实现概念上有意义且完整的遗忘。为了更好地从这种实际角度评估遗忘技术,我们引入了双重用途概念的概念:既可用于有害又可用于良性上下文的概念。基于这些概念,我们构建了一个名为ConceptGuard的基准测试,其中遗忘集和保留集在概念使用上是明确互补的。我们的基准测试独特地使遗忘能在概念层面而非稀疏事实层面进行探索和衡量,评估是意图敏感的,目标是最大化上下文分离以促进更安全的行为。我们证明,当前的遗忘技术在此设置下表现不佳,显示出较弱的上下文分离以及在ROUGE和概念级指标上的差表现。我们的结果揭示了强烈的遗忘-效用权衡、上下文敏感性的有限收益以及跨方法概念级控制的不一致性,并为更好地与真实世界安全要求对齐的遗忘方法提供了思路。我们的数据集公开可用。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:19

# ConceptGuard:大语言模型上下文敏感遗忘的基准测试
来源:https://arxiv.org/html/2608.20338
Sahil Kale所属机构:浦那计算机技术学院所属机构:印度浦那邮箱:[sahilrkale05@gmail\.com](mailto:)Ian Harris

###### 摘要

大语言模型(LLMs)越来越需要选择性地移除有害或敏感知识,这被称为“遗忘”,然而现有方法和基准测试未能全面评估这一能力。当前的方法依赖于由独立事实组成的分离的遗忘集和保留集,并使用简单直接的事实回忆来衡量成功。这种框架未能捕捉遗忘的一个关键要求,即消除有害行为同时保留良性和有益知识的能力。我们认为,有效的遗忘必须在概念层面进行,确保完全移除不安全应用,同时保持其正确和有用的使用,从而实现概念上有意义且完整的遗忘。为了从这种实际角度更好地评估遗忘技术,我们引入了“双重用途概念”的概念:既可用于有害背景也可用于有益背景的概念。基于这些概念,我们构建了一个名为ConceptGuard的基准测试,其中遗忘集和保留集在概念使用上明确互补。我们的基准测试独特地使遗忘能够在概念层面而非稀疏事实层面进行探索和衡量,并且评估是意图敏感的,目标是最大化“上下文分离”以促进更安全的行为。我们证明,当前的遗忘技术在此设置下表现不佳,显示出薄弱的上下文分离以及在ROUGE和概念级指标上的较差表现。我们的结果揭示了强烈的遗忘-效用权衡、有限的上下文敏感性增益以及跨方法的概念级控制一致性较差,并为更好契合现实世界安全要求的遗忘方法提供了思路。我们的数据集公开可用。111数据集:https://huggingface.co/datasets/sk0511/concept-guard

## 1引言

大语言模型(LLMs)目前已部署于广泛的应用中,包括教育、医疗、软件开发和决策支持。其广泛应用在放大其效用的同时也扩大了其风险面\(12 (https://arxiv.org/html/2608.20338#bib.bib4)\)\。在大规模、异构语料库上训练的模型不可避免地吸收了不良内容,包括受版权保护的材料、隐私数据以及促成有害或不安全行为的知识\(13 (https://arxiv.org/html/2608.20338#bib.bib5)\)\。因此,在训练后选择性地移除已学习信息的能力——日益被称为*机器遗忘*(12 (https://arxiv.org/html/2608.20338#bib.bib4))——已成为负责任部署的关键要求。

遗忘的目标是确保模型不再使用训练数据中的某些参考来生成响应,同时保留其整体有用性(7 (https://arxiv.org/html/2608.20338#bib.bib7))。从模型安全的角度来看,我们假设这本质上转化为一个目标:移除产生有害响应的能力,同时保留回答其他良性上下文的能力。在当前LLMs文献中,遗忘通常通过定义一个*遗忘集*(包含要移除的数据)和一个*保留集*(包含应保持可访问的数据)来形式化(2 (https://arxiv.org/html/2608.20338#bib.bib8))。现有的遗忘流程通常如下进行。预训练语言模型在包含保留集和遗忘集的数据集上进行微调,然后仅在遗忘集上应用遗忘方法。接着,评估衡量两个属性以检查遗忘是否高效。首先是*遗忘质量*,评估模型是否无法再回忆遗忘集中的信息。其次是*模型效用*,评估模型在保留集上的性能和整体能力是否得到保留。目前有几个基准测试在此框架下运作,包括TOFU(11 (https://arxiv.org/html/2608.20338#bib.bib1))、MUSE(14 (https://arxiv.org/html/2608.20338#bib.bib2))和WMDP(9 (https://arxiv.org/html/2608.20338#bib.bib3))。

参考标题(a)现有遗忘基准测试构建了分离的遗忘集和保留集,并独立评估遗忘性能  
参考标题(b)我们的基准测试构建了互补的遗忘集和保留集,并评估不同意图下的概念使用  
图1:现有遗忘基准测试与我们基于双重用途概念的基准测试之间的比较  
虽然这些基准测试从有效性和计算角度为遗忘方法提供了有用的分析,但我们认为,从模型安全的角度来看,当前基准测试未能充分捕捉遗忘是否在概念上有意义的层面上发生。这源于数据集构建和评估步骤中的两个主要框架缺陷,我们分别将其识别如下。

- •首先,尽管遗忘集和保留集可能来自相似的主题或领域,但它们通常被构建成由一系列事实组成的随机、分离的数据子集,因此未能捕捉遗忘是否保留了某些概念或知识的上下文相关使用。
- •其次,评估方法在孤立事实回忆层面运作,测试特定事实是否根据其在遗忘集或保留集中的存在而被擦除或保留,而不是评估模型是否被训练以防止在有害上下文中回答,同时确保其能安全地在其他地方使用相同概念。

在许多现实的安全场景中,有效的遗忘目标既不应该是移除孤立事实,也不应该是彻底消除一个概念,而是实现选择性使用:防止一个概念的有害应用,同时保留其良性、有益和所有无关的使用。因此,在当前使用孤立数据集和评估的基准测试中表现出色,并不必然意味着有意义或安全的遗忘行为。

在这项工作中,我们引入了一个名为ConceptGuard的新基准测试,旨在评估*双重用途*概念层面的遗忘,即既可用于有害背景也可用于良性背景的概念。我们基准测试中的每个概念都关联着代表双重用途的有害数据和良性数据。遗忘集包含一个概念的有害使用,而保留集包含同一概念的良性使用。关键的是,这些集合是互补的,而不是独立或随机的子集。在我们的基准测试中,遗忘质量直接关系到遗忘后模型的安全性,而模型效用则反映了其在良性上下文中保留正确和有益行为的能力,因为目标是引入随后遗忘不安全行为。本质上,通过我们的基准测试,我们将遗忘的重点从事实删除转移到检查意图敏感的概念移除和保留,从而为LLMs中的遗忘提供更忠实且实际相关的评估。

总之,我们通过本文做出以下贡献:(1)我们分析了现有的LLMs遗忘基准测试,并表明其评估协议未能从安全角度捕捉遗忘的真正目标,即移除概念的有害使用同时保持良性概念使用的性能。(2)我们引入了ConceptGuard,一个基于双重用途概念的新颖基准测试,其中遗忘集和保留集是互补的,以实现对遗忘的主题和上下文评估。(3)我们提供了一个意图敏感的评估协议,并展示了当前遗忘技术如何在遗忘集和保留集之间存在概念重叠时无法满足所有目标。

## 2背景:大语言模型中的遗忘

大语言模型中的机器遗忘通常被表述为一个训练后修改问题,目标是在不从头重新训练模型的情况下,移除指定训练数据子集的影响(16 (https://arxiv.org/html/2608.20338#bib.bib9))。令Df\\mathcal\{D\}\_\{f\}表示*遗忘集*,Dr\\mathcal\{D\}\_\{r\}表示*保留集*。给定一个预训练模型f,遗忘过程寻求生成一个更新的模型f_unlearnf\_\{\\text\{unlearn\}\},使得Df\\mathcal\{D\}\_\{f\}的影响被最小化,同时保留Dr\\mathcal\{D\}\_\{r\}和一般任务上的性能。

在现有工作如8 (https://arxiv.org/html/2608.20338#bib.bib14)和5 (https://arxiv.org/html/2608.20338#bib.bib12)中,此目标通常通过如下两阶段流程实现:

1. 1\.在包含Df\\mathcal\{D\}\_\{f\}和Dr\\mathcal\{D\}\_\{r\}的数据集上对f进行监督微调,以得到f_ftf\_\{\\text\{ft\}\}
2. 2\.应用遗忘方法产生f_unlearnf\_\{\\text\{unlearn\}\},该方法修改模型参数以同时移除Df\\mathcal\{D\}\_\{f\}中包含的信息并保留Dr\\mathcal\{D\}\_\{r\}上的性能

评估通常基于双重标准:遗忘质量,衡量Df\\mathcal\{D\}\_\{f\}中的信息不再可恢复的程度;以及模型效用,衡量f在f_unlearnf\_\{\\text\{unlearn\}\}中其他任务上保留的性能。此表述构成了大多数现有LLMs遗忘基准测试和方法的基础,我们在基准测试中也遵循类似的结构,尽管进行了概念上的增强。

## 3现有基准测试的局限性

我们从模型安全的角度审视现有遗忘基准测试的两个关键概念局限性。虽然两者源于一个共同问题,但我们将它们分开呈现以分析它们对遗忘评估流程的影响。如图1 (https://arxiv.org/html/2608.20338#S1.F1)所示并在表1 (https://arxiv.org/html/2608.20338#S1.T1)中总结,当前基准测试将数据集构建和评估视为分离的过程。两者共同导致了基准测试性能与有意义的遗忘行为之间的不匹配,而ConceptGuard旨在解决这一问题。

### 3.1遗忘集与保留集的分离构建

一个主要局限性在于遗忘集和保留集Df\\mathcal\{D\}\_\{f\}和Dr\\mathcal\{D\}\_\{r\}的构建方式。它们通常被视为从更大数据集中采样的分离子集,没有明确编码它们之间的关系。因此,遗忘是在孤立事实层面而非底层概念及其上下文使用层面进行评估的。

虽然这种设计适用于需要移除特定记录的隐私保护场景,但面向安全的遗忘需要根据上下文修改行为。例如,化学合成知识在一种场景下可能有害,但在教育或工业背景下却是必要的。这需要区分同一概念的有害和良性使用。

现有基准测试未能捕捉到这种区别。TOFU(11 (https://arxiv.org/html/2608.20338#bib.bib1))通过百分比划分将虚构作者数据分为遗忘集和保留集,未强制概念对齐。MUSE(14 (https://arxiv.org/html/2608.20338#bib.bib2))同样划分了来自《哈利·波特》文本和新闻语料库等来源的数据,但未确保Df\\mathcal\{D\}\_\{f\}和Dr\\mathcal\{D\}\_\{r\}之间的互补使用。WMDP(9 (https://arxiv.org/html/2608.20338#bib.bib3))专注于生物安全、网络安全等领域的有害知识,但主要针对有害查询进行评估,其效用在相同概念范围之外衡量。

因此,Df\\mathcal\{D\}\_\{f\}和Dr\\mathcal\{D\}\_\{r\}在结构上保持独立。这阻碍了评估模型是否能够选择性地抑制有害使用同时保留有益使用,反而倾向于在单个事实层面操作的方案,并且也阻碍了分析遗忘性能如何因数据主题而异。

### 3.2评估缺乏上下文敏感性

一个相关的局限性出现在评估中。现有基准测试评估遗忘集中的知识是否被移除,但未验证同一概念的良性使用是否被保留。评估通常分为在Df\\mathcal\{D\}\_\{f\}上的*遗忘质量*和在Dr\\mathcal\{D\}\_\{r\}或不相关任务上的*模型效用*。

遗忘质量衡量无法再现Df\\mathcal\{D\}\_\{f\}中信息的程度。TOFU使用QA对的概率、ROUGE和真实比率,MUSE评估记忆和成员推理,WMDP使用有害查询的准确率。这些关注于特定信息是否不再可访问。模型效用在很大程度上独立评估。TOFU包括保留集和辅助数据集(如真实作者和世界事实),但与遗忘集在概念上不相关;MUSE单独评估保留的性能;WMDP依赖于诸如MMLU之类的通用基准测试。这些评估通常在遗忘集的概念领域之外。

这种分离造成了根本性的差距。由于遗忘和效用是在分离的集合并常常在不相关的领域中评估的,基准测试并未测试模型是否能针对不同上下文应用同一概念。在这些情况下,如果模型抑制整个概念而不是选择性修改其用法,那么基准测试的高分并不意味着上下文敏感或符合安全的遗忘。

## 4ConceptGuard基准测试

我们提出的基准测试旨在解决在现有遗忘框架中识别的数据集构建和评估方面的局限性。它还支持灵活或有针对性的概念级遗忘分析,其中遗忘集和保留集的概念可以针对上下文焦点进行调整。我们描述了数据集的设计,包括围绕双重用途概念的构建,并引入了一个能够捕捉上下文相关遗忘行为的评估框架。

### 4.1双重用途概念

我们的遗忘基准测试基于*双重用途*概念的理念,定义为既可应用于有害背景也可应用于良性背景的概念。虽然双重用途作为概念已在先前的AI风险研究(1 (https://arxiv.org/html/2608.20338#bib.bib10))以及LLMs特定环境(15 (https://arxiv.org/html/2608.20338#bib.bib11))中被讨论过,但我们采用了一种表述,使得双重用途概念可以根据上下文、框架、意图以及与其他概念的组合方式,轻松地用于有害或良性的目的。通过这些概念,我们旨在实现遗忘的目标:不是完全移除一个概念,而是防止其有害应用,同时保留其良性及有益的用途。例如,与网络安全技术、区块链工作原理或生化过程相关的知识,在教育、研究或工业背景下可能至关重要,但如果被恶意意图应用,也可能促成有害使用。因此,在此类场景下,有效的遗忘需要区分这些上下文,而不是完全抑制该概念。

受此驱动,我们基准测试中的每个概念都关联两种互补形式的数据:有害实例,构成遗忘集Df\\mathcal\{D\}\_\{f\};良性实例,构成保留集Dr\\mathcal\{D\}\_\{r\}。关键的是,这些集合不是独立构建的,而是明确配对以代表同一底层概念的不同使用。

### 4.2数据集构建

相似文章

ContextGuard:语言模型中上下文学习的结构化自我审计

arXiv cs.CL

介绍ContextGuard,一个结构化自我审计框架,通过将模型自我评估分解为确认和不确定类别并应用针对性修订来改进语言模型上下文学习。在CL-Bench基准测试中,Qwen3.5-4B的任务解决率从9.64%提升至13.85%。

MLUBench: 多模态大语言模型终身遗忘评估基准

arXiv cs.AI

MLUBench 是一个大规模的多模态大语言模型终身遗忘基准,包含9个类别的127个实体。论文指出现有遗忘方法存在累积退化问题,并提出 LUMoE 来缓解此问题,显示出显著改进。

模型遗忘目标因语言功能不同而异

arXiv cs.CL

本文认为,LLM中的遗忘应依赖于目标,提出了一种基于余弦的元学习RMU变体用于危险知识遗忘,以及一种结合探针方向的多层目标用于毒性遗忘,在四个7-8B模型上取得了显著效果。