LLMs中的多语言去学习:迁移、动力学与可逆性

arXiv cs.CL 论文

摘要

本文通过将TOFU基准扩展到五种语言,研究了LLMs中的多语言去学习。研究发现,去学习迁移因文字和语言家族而异,主要作用于后几层解码层,并且单个引导方向可以恢复跨语言被抑制的大部分知识。

arXiv:2606.03291v1 Announce Type: new 摘要:大型语言模型(LLMs)可能记忆敏感事实,这促使了去学习方法的发展,以在不进行昂贵重训练的情况下移除特定知识。然而,去学习研究仍高度以英语为中心。我们通过将TOFU基准扩展到五种语言,并使用不同的语言排列对模型进行微调、去学习和查询,来研究多语言去学习。我们发现,去学习迁移(即经过去学习模型“遗忘”非去学习语言中事实的能力)具有高度变异性:例如,在共享文字和语言家族的语言之间最显著,并且我们发现去学习语言能够预测哪些查询语言最有可能产生最强的迁移。逐层分析显示,去学习在早期层中基本保留了共享的跨语言潜在空间,而主要作用于后续解码层。这表明去学习并非真正抹除知识,而是诱导了表面上的抑制。利用这一结构,单一推理时的引导方向可以逆转大部分跨语言的这种抑制,恢复50%(Qwen)和90%(Gemma)的被去学习知识。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:38

# Multilingual Unlearning in LLMs: Transfer, Dynamics, and Reversibility 来源:https://arxiv.org/html/2606.03291 ###### 摘要 大型语言模型(LLM)可能会记住敏感事实,这催生了“遗忘”方法,旨在无需昂贵重训练即可移除目标知识。然而,遗忘研究仍高度以英语为中心。我们通过将TOFU基准扩展到五种语言来研究多语言遗忘,并以不同的语言排列对模型进行微调、遗忘和查询。我们发现遗忘迁移——即遗忘模型在其他语言中“忘记”事实的能力——具有高度可变性:例如,在共享文字和语系的语言之间最强,并且我们证明,“遗忘语言”可以预测哪些“查询语言”最有可能产生最强的迁移。逐层分析表明,遗忘在早期层中基本保留了共享的跨语言潜在空间,而主要作用于后期解码层。这表明遗忘并非真正擦除知识,而是诱导了表面抑制。利用这一结构,单一推理时引导方向即可在很大程度上逆转跨语言的这种抑制,恢复Qwen模型中50%和Gemma模型中90%的已遗忘知识。¹¹¹代码地址:https://github.com/MLCY1/multilingual-unlearning-in-llms

## 1 引言

大型语言模型在海量语料上训练,在此过程中可能无意中学习到有害、敏感或有偏见的信息,这促使了事后数据移除的需求(Carlini 等人,2023;Cheng 等人,2025;Meng 等人,2022;Shi 等人,2025)。此外,为保护个人隐私,数据保护法规如“被遗忘权”要求从LLM中移除个人信息(Cao and Yang, 2015;Liu 等人,2025),同时不损害性能。实现这一目标最根本的方法是从头开始重新训练模型,从训练语料中排除相关数据(Triantafillou 等人,2024;Yoon 等人,2023;Cooper 等人,2025)。然而,重新训练现代LLM成本高昂。这导致对“遗忘”方法的兴趣日益增长,这些方法旨在移除现有模型中存储的目标知识。

目前大多数遗忘算法在单语言(主要是英语)环境下运行,并通过修改微调目标来实现,推动模型远离给定示例的原始行为(Jang 等人,2023;Hong 等人,2024;Shi 等人,2025;Huang 等人,2025;Yoon 等人,2025;Du 等人,2025;Lee 等人,2025;Xu 等人,2025a)。虽然这些方法可以减少模型在英文提示下输出特定答案的倾向,但仍然存在两个重要空白。

首先,在多语言LLM中,遗忘如何在语言间迁移仍不清楚。我们首次通过系统性地(1)在语言 $\mathcal{L}_{FT}$ 上微调LLM以学习新知识;(2)在语言 $\mathcal{L}_{\text{unl}}$ 上遗忘部分知识;(3)在语言 $\mathcal{L}_{Q}$ 上查询(假设已被遗忘的)知识,来全面研究这一现象。我们系统地变化 $\mathcal{L}_{FT}$、$\mathcal{L}_{\text{unl}}$ 和 $\mathcal{L}_{Q}$,操控语言相关性、文字以及LLM预训练中的覆盖范围。虽然先前的一些工作已显示出孤立的跨语言迁移效应(Lu and Koehn, 2025;Hwang 等人,2025;Choi 等人,2023),但我们是首次展示系统性模式。由于多语言LLM为使用多种语言的用户提供服务,理解跨语言迁移对于安全部署以及防止攻击者利用语言之间的关系恢复已遗忘知识至关重要。

其次,多语言遗忘的“机制”仍未被很好理解。最近的研究认为,遗忘更像是一种抑制信号,而非真正的知识擦除(Shi 等人,2025;Lee 等人,2025;Wei 等人,2026;Ren 等人,2025;Hu 等人,2025),但这些研究主要局限于单语言或以英语为中心的场景。因此,尚不清楚:(i)被抑制的内容在多语言模型中是否“可恢复”;(ii)该效应是语言特定还是语言无关;(iii)它在模型表示空间中的位置。特别地,我们尚不知道多语言遗忘是会破坏共享的跨语言“思想”空间,还是主要作用于将内部表示映射到特定语言表面形式的后期层。机理理解至关重要,因为它决定了多语言遗忘保证的“强度”和“攻击面”。如果遗忘效应主要调节后期、语言特定的解码层,那么潜在知识可能保持完整,并可通过跨语言提示(即用一种语言提示模型,让其用另一种语言回答)或以不同语言查询遗忘知识而重新浮现(Hu 等人,2025;Lynch 等人,2024)。相反,如果遗忘改变了共享的跨语言表示空间,那么由此产生的保证在实质上更强,因为这意味着对潜在知识的访问被减少,而不仅仅是其语言特定表达被抑制(Wendler 等人,2024;Wang 等人,2025a;Lim 等人,2025)。

为解决这两个空白,我们首先描述了多语言LLM中的跨语言遗忘迁移(第4.1节),揭示了迁移程度因语言相关性、文字和预训练中的主导地位而异。我们还发现,在较弱语言 $\mathcal{L}_{\text{unl}}$ 上的遗忘仍可大幅迁移到 $\mathcal{L}$ 中的较强语言。为了更好地理解语言对知识恢复的影响,我们接下来应用跨语言提示(第4.2节),在 $\mathcal{L}_{Q}$ 中查询但允许模型以 $\mathcal{L}_{FT} \neq \mathcal{L}_{Q}$ 解码,发现跨语言提示增益较大的语言对往往表现出更强的遗忘迁移。接着,我们通过比较遗忘前后模型在不同层和语言上的隐藏表示进行机理分析(第4.3节),发现遗忘在很大程度上保留了早期和中期层的跨语言对齐,同时改变了后期层。最后,我们将这些表示偏移转化为显式的“遗忘方向”(引导向量),并表明沿着这些方向引导可以在不同语言间恢复知识(第4.4节),为遗忘表现为“语言无关的抑制信号”且并未完全擦除知识提供了证据。

总的来说,我们的结果表明,一种语言中“被遗忘”的知识可以迁移到其他语言,并且通过使用一个简单的提取向量进行引导,可以在无需额外重新学习或遗忘数据的情况下大幅逆转遗忘效果。

## 2 背景

**LLM遗忘。** 为在实践中模拟遗忘,我们考虑一个在数据集 $D$ 上微调的模型 $M_\theta$,该数据集可划分为遗忘集 $D_{\text{forget}}$(要遗忘的目标内容)和保留集 $D_{\text{retain}}$(用于保持非目标行为,通常来自同一领域)。大多数方法通过持续微调实现遗忘,将参数从 $\theta$ 更新为 $\hat{\theta}$,以抑制模型输出中的目标内容,同时保持对保留数据的性能(Jang 等人,2023;Shi 等人,2025;Yoon 等人,2025)。最近的分类法根据“意图”区分方法:是旨在移除内部知识,还是抑制其行为表达(Ren 等人,2025)。一个核心挑战是遗忘效力与效用保持之间的权衡(Chang and Lee, 2025;Ren 等人,2025)。

“移除意图”的方法通过修改模型参数来消除目标信息,通常使用反向优化目标,例如对遗忘示例进行梯度上升(Maini 等人,2024;Jin 等人,2024;Jang 等人,2023),或基于偏好的目标,这些目标在实践中通常能实现更有利的遗忘-效用权衡(Zhang 等人,2024;Yoon 等人,2025;Cheng 等人,2025;Jia 等人,2024)。然而,多项研究表明,许多此类方法在机制上类似于“抑制”,因此是可逆的(Ren 等人,2025;Xu 等人,2025c;Hu 等人,2025),恢复通常通过额外的“重新学习”阶段(例如,遗忘后的短暂微调)或提供答案前缀来触发恢复来证明。相比之下,我们通过逐层定位抑制信号,并通过表示引导展示“推理时”可逆性,无需微调或访问答案前缀,并证明可恢复性可跨语言迁移。

另外,“抑制”方法旨在防止泄漏,而不更新核心模型权重(Debdeep Sanyal, 2025;Gao 等人,2025)。由于这些方法通常针对行为抑制而非知识删除,我们专注于参数更新的遗忘方法,并仅将推理时引导用于分析。

**多语言语言模型与跨语言迁移。** 多语言预训练产生了支持跨语言迁移的共享表示,使模型在一种语言上微调后能够泛化到其他语言,即使没有显式的跨语言训练目标(Pires 等人,2019;Ke 等人,2020)。然而,迁移在不同语言间并不均匀:经验上,类型相似的语言之间迁移往往更强,并且可能受益于共享文字或词汇重叠,尽管这种效应并非完全确定(Pires 等人,2019)且可能依赖于下游任务(Blaschke 等人,2025)。此外,机制证据表明,多语言LLM可能在将表示映射到目标语言之前,在与主导预训练语言(通常是英语)对齐的共享语义空间中进行中间处理,这可能会塑造知识迁移和跨语言一致性(Lim 等人,2025)。这些观察促使研究跨语言的遗忘迁移,以突出可能使对抗性攻击成为可能的知识泄露。

**隐藏表示。** 越来越多的探测和机制解释研究表明,Transformer层呈现出粗略的阶段式组织:较低层强调表层处理,而较深层逐渐支持语义抽象和输出控制(Tenney 等人,2019;Olsson 等人,2022)。在多语言Transformer中,分析进一步支持一个三相结构:一个“输入空间”、一个语言无关的中间层“概念空间”,以及一个专门用于语言特定生成的“解码空间”(Wendler 等人,2024;Lim 等人,2025;Jiang 等人,2025)。受此结构启发,推理时激活引导方法从对比激活中构建“引导向量”,并在前向传播中注入这些向量以控制模型行为,无需重训练(Rimsky 等人,2024;Li 等人,2023)。最近的遗忘方法也明确在表示层面操作:表示误导方法通过微调模型来引导中间层表示在遗忘数据上的方向,同时正则化保留行为(Li 等人,2024;Huu-Tien 等人,2025;Shen 等人,2026)。Seyitoğlu 等人(2024)使用引导来检索匿名概念,依赖于模型中嵌入的广泛世界知识。相比之下,我们将微调模型与遗忘模型之间“由遗忘引起的”表示偏移视为机制上的“抑制方向”,并沿着该方向使用“推理时”引导作为分析或干预工具。这使我们能够(i)定位抑制在何处“逐层”出现,(ii)证明可逆性“无需额外的重新学习阶段”或访问遗忘答案前缀,以及(iii)测试抑制方向是否跨语言迁移(即是否为语言无关)。

## 3 准备

在本节中,我们形式化多语言设定,定义贯穿全文的微调和遗忘目标,并描述我们的评估协议。

### 3.1 TOFU 与小样本遗忘

我们基于TOFU(*虚构任务遗忘*)构建,这是一个用于细粒度LLM遗忘的基准(Maini 等人,2024),包含关于200个虚构作者的事实,每个作者由20个简单的问答对描述。这些作者和事实是合成生成的。

相似文章

模型遗忘目标因语言功能不同而异

arXiv cs.CL

本文认为,LLM中的遗忘应依赖于目标,提出了一种基于余弦的元学习RMU变体用于危险知识遗忘,以及一种结合探针方向的多层目标用于毒性遗忘,在四个7-8B模型上取得了显著效果。

随机元遗忘:连接语言骨干与多模态遗忘

arXiv cs.CL

本文介绍了随机元遗忘(SMU),这是一个双层框架,利用VLM级反馈为语言骨干学习一个可进行遗忘的初始化,在多模态遗忘中实现更好的遗忘-保留权衡。

MLUBench: 多模态大语言模型终身遗忘评估基准

arXiv cs.AI

MLUBench 是一个大规模的多模态大语言模型终身遗忘基准,包含9个类别的127个实体。论文指出现有遗忘方法存在累积退化问题,并提出 LUMoE 来缓解此问题,显示出显著改进。

原生可遗忘的大语言模型

arXiv cs.LG

该论文提出了NULLs(原生可遗忘的大语言模型),这是一种模型类别,它将特定来源的贡献隔离到稀疏激活的sinks中,同时共享骨干神经元,从而无需重新训练即可干净地遗忘单个数据源,并保持通用语言能力。