MAAT: 多阶段适配器感知的目标性遗忘

Hugging Face Daily Papers 论文

摘要

MAAT 提出了一种多阶段 LoRA 适配器遗忘方法,并配套了 5WBENCH 基准测试。该研究揭示,由于因果性“为什么”知识涉及长程多跳答案链和梯度稀释问题,这类知识在遗忘时特别困难。在 Llama 3.2-3B 模型上,该方法在遗忘与保留之间取得了优异的平衡。

机器遗忘评估在结构上存在偏差:探究因果和关系知识的“为什么”类问题,在 CounterFact 中占比不足 0.06%,在 ZSRE 中占比 0.6%,在 TOFU、MUSE 和 WMDP-Cyber 中占比均低于 1.3%。这种近乎为零的占比意味着,即使某些方法在因果性知识上表现不佳,其整体评分仍可能很高,且这种缺陷在缺乏均衡评估时无法被发现。我们提出 5WBENCH,一个包含 5000 个样本的均衡基准测试,每个 5W 类别(Who、What、When、Where、Why)各有 1000 个样本,首次使得因果遗忘缺陷变得可量化。利用 5WBENCH,我们证明现有基线方法无法在“为什么”类问题上同时实现高遗忘与高保留:激进的遗忘会损害已保留的知识,而保守的方法则无法遗忘因果事实。“为什么”类问题的难度源于多跳推理链(“为什么”类条目中占 44%,其他类别不超过 2%)以及超过 40.1 个 token 的答案跨度所导致的梯度稀释。我们提出 MAAT(多阶段适配器感知的目标性遗忘),这是一个作用于 LoRA 适配器权重的三阶段框架,结合了梯度投影上升、SVD 秩维度剪枝、任务向量否定以及混合 KL-隐藏状态保留修复。MAAT 是首个在因果性“为什么”知识上同时实现高遗忘与高保留的方法,达到了遗忘-保留帕累托前沿上的新操作点。我们将公开代码。
查看原文
查看缓存全文

缓存时间: 2026/06/01 03:17

论文页面 - MAAT:多阶段适配器感知的目标遗忘

来源:https://huggingface.co/papers/2605.30514

MAAT 提出了一种结构化的 LoRA 适配器遗忘流程,并搭配了 5WBENCH(一个平衡的 5W 基准测试),揭示了因果性的“为什么”知识因包含长多跳答案链和梯度稀释而尤其难以遗忘——并非因为它在逐层编码上具有独特分布。

➡️ MAAT 与 5WBENCH 的关键亮点:

🧪 平衡的 5W 遗忘基准测试 (5WBENCH):引入了一个 5000 样本的基准测试,其中 Who、What、When、Where 和 Why 各占 1000 个示例,暴露了现有遗忘数据集中的一个重大盲区——Why 类型的因果问题几乎缺失,例如在 CounterFact 中占比 <0.06%,在 ZSRE 中占比 0.6%。

🧩 因果知识失败诊断:表明 Why 类型的事实更难遗忘,因为它们的答案跨度更长(平均 40.1 个 token),并且多跳推理结构更多(44%,而其他类别 ≤2%),这使得梯度上升信号分散在分散的因果链上。

🧠 MAAT:多阶段适配器感知的目标遗忘:提出了一种三阶段的仅 LoRA 遗忘方法:梯度投影上升以避免保留梯度的干扰;仅 MLP 的 SVD 秩维度剪枝加上基于遗忘得分的任务向量求反;混合 KL/隐藏状态保留修复与熵正则化,以防止重新学习被遗忘的事实。

技术新颖点:关键的架构举措是将 LoRA 适配器视为结构化的秩空间,而非平坦的参数增量。MAAT 根据遗忘集的激活/梯度相关性对适配器秩维度进行评分,仅剪枝或求反最与遗忘相关的子空间,并修复保留行为,而无需合并或修改冻结的基模型。

为何能推动进展:在 5WBENCH 上,MAAT 达到了比基线更强的遗忘-保留操作点:在 Llama 3.2-3B 上,平均遗忘成功率达 77.4%,保留成功率达 71.6%,同时在遗忘效果与 RO-FT 相当的情况下,保留成功率提升了 +36.4 个百分点。它也是目前唯一一种在所有五个 5W 类别(包括 Why 类型因果知识)上均超过 60% 遗忘成功率和 60% 保留成功率的报告方法。

相似文章