ASRU:激活引导与强化遗忘在多模态大语言模型中的应用

arXiv cs.CL 论文

摘要

提出了ASRU,一个可控的多模态遗忘框架,它结合激活引导与强化学习奖励函数,以提高遗忘效果和生成质量,同时在Qwen3-VL上保持模型效用。

arXiv:2605.15687v1 公告类型: 新 摘要: 多模态大语言模型(MLLMs)可能在预训练过程中记忆敏感的跨模态信息,使得机器遗忘(MU)变得至关重要。现有方法通常基于输出偏差评估遗忘效果,而忽略遗忘后的生成质量。这容易导致产生幻觉或僵硬的响应,从而影响已遗忘模型的可用性和安全性。为解决此问题,我们提出了ASRU,一个可控的多模态遗忘框架,将生成质量作为核心评估目标。ASRU首先通过激活重定向诱导初始拒绝行为,然后使用定制的奖励函数优化细粒度的拒绝边界,从而在目标知识遗忘与模型效用之间实现更好的平衡。在Qwen3-VL上的实验表明,ASRU平均显著提升了遗忘效果(+24.6%)和生成质量(5.8倍),同时仅使用少量保留的监督数据即可有效保持模型效用。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:33

# ASRU: 激活引导与强化反学习在多模态大语言模型中的结合

来源: https://arxiv.org/html/2605.15687

###### 摘要

多模态大语言模型 \(MLLMs\) 在预训练过程中可能会记忆敏感的跨模态信息,这使得机器反学习 \(MU\) 变得至关重要。现有方法通常基于输出偏差来评估反学习效果,却忽视了反学习后的生成质量。这容易导致幻觉化或僵硬的响应,从而影响反学习后模型的可用性和安全性。为解决这一问题,我们提出 ASRU,一种可控的多模态反学习框架,将生成质量作为核心评估目标。ASRU 首先通过激活重定向诱导初步的拒绝行为,然后利用自定义奖励函数优化细粒度的拒绝边界,从而在目标知识反学习与模型效用之间实现更好的权衡。在 Qwen3-VL 上的实验表明,ASRU 仅使用少量保留监督数据,即可平均提升 24.6% 的反学习效果,平均提升 5.8 倍的生成质量,同时有效保持了模型效用。ASRU 代码已发布在 https://github.com/guangjh/ASRU。

机器学习, ICML

## 1 引言

多模态大语言模型 \(MLLMs\) 在广泛的多模态任务中取得了显著成功 (Huang et al., 2023 (https://arxiv.org/html/2605.15687#bib.bib1); Wang et al., 2024 (https://arxiv.org/html/2605.15687#bib.bib2); Zou et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib3); Du et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib4); Zhu et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib5); Hu et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib32))。然而,它们的大规模预训练通常依赖数百万个实例,这不可避免地导致 MLLMs 记忆了敏感或有害信息 (Karamolegkou et al., 2023 (https://arxiv.org/html/2605.15687#bib.bib7); Huang et al., 2024 (https://arxiv.org/html/2605.15687#bib.bib8)),引发了与隐私泄露和版权侵犯相关的严重担忧 (Huo et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib6); Liu et al., 2025b (https://arxiv.org/html/2605.15687#bib.bib9))。由于预训练数据通常不可访问,从头开始重新训练模型以移除此类知识是不切实际的,这使得事后机器反学习成为构建可信 MLLM 系统的关键要求 (Liu et al., 2025a (https://arxiv.org/html/2605.15687#bib.bib16); Chen et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib10); Ding et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib11))。

![参照标题](Fig1)

图 1: 现有反学习方法通常产生**幻觉**、**僵硬的输出**且表现出**不完整的反学习**,而我们的 ASRU 则产生上下文感知的动态拒绝。

大多数现有工作直接将针对纯文本 LLM 设计的反学习策略移植到多模态场景中,包括基于梯度上升的方法 (Thudi et al., 2022 (https://arxiv.org/html/2605.15687#bib.bib18); Liu et al., 2024 (https://arxiv.org/html/2605.15687#bib.bib19); Zhang et al., 2024 (https://arxiv.org/html/2605.15687#bib.bib17); Li et al., 2024 (https://arxiv.org/html/2605.15687#bib.bib14))、偏好优化 (Zhang et al., 2024 (https://arxiv.org/html/2605.15687#bib.bib17)) 以及目标参数更新 (Huo et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib6); Li et al., 2025a (https://arxiv.org/html/2605.15687#bib.bib15))。尽管取得了一些初步进展,这些方法仍然存在两个根本性局限。如图 1 (https://arxiv.org/html/2605.15687#S1.F1) 所示:\(I\) **反学习后不自然且充满幻觉的响应仍然普遍存在。** 现有方法要么生成与目标事实不一致的虚构内容,要么产生异常、重复且不连贯的退化文本。在高风险领域,幻觉输出可能引入严重的安全隐患,例如在移除患者记录后生成看似合理但错误的医疗建议 (Shen et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib44))。同时,不自然的响应可能会无意中暴露已执行反学习操作的事实,从而带来潜在的安全风险。我们将此现象称为**反学习后响应能力退化**:在失去目标知识后,模型未能以自然、上下文感知且连贯的方式表达其知识缺口。我们认为,一个经过反学习的模型应当行为像一个对齐后的基础模型,能够以动态、上下文感知且连贯的方式准确表达其知识缺口。因此,我们主张将**生成质量**作为反学习研究中的一个主要评估标准。

\(II\) **反学习质量与模型效用之间始终存在权衡。** 基于梯度上升的更新方法倾向于过度压制遗忘集 \(D_f\),导致意外全局行为偏移和效用退化 (Wang et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib20))。相反,那些保持效用的方法往往表现出不完整的反学习,难以在有效反学习与效用保持之间实现最优权衡。这些局限表明,现有方法仍然缺乏对拒绝边界的细粒度控制,且未能充分解决反学习后的生成质量问题。

为应对这些挑战,我们提出激活引导与强化反学习 (ASRU) 的结合,一种用于多模态反学习的新型框架。ASRU 首先构建一个知识缺失方向并执行激活引导,通过仅更新单个下投影矩阵来诱导基本的拒绝行为。基于此初始化,我们进一步引入组相对策略优化 (GRPO),设计一个可验证的奖励函数,并利用少量监督保留子集共同优化遗忘样本及其高度相关的边界样本,从而学习一个上下文感知、细粒度的拒绝边界。实验结果表明,ASRU 实现了细粒度的边界感知,生成了上下文动态且一致的拒绝响应,并在反学习效果与模型效用之间获得了更好的权衡。我们强调主要贡献如下:

-   - 现有多模态反学习主要通过偏离真实值来评估反学习。我们引入**生成质量**作为关键评估维度,捕捉反学习模型是否产生连贯、上下文感知且自然的拒绝。
-   - 我们提出 **ASRU**,一种新颖且可控的反学习框架,首次将激活引导与 GRPO 集成。ASRU 首先使用激活引导(通过更新单个投影矩阵)诱导可控的拒绝行为作为初始化,然后引入边界集和可验证奖励设计,以学习更细粒度的遗忘-保留边界。
-   - 实验结果表明,ASRU 在保持模型效用的同时,相比现有基线实现了平均高达 5.8 倍的生成质量提升和平均 24.61% 的反学习效果提升,且仅使用少量监督保留数据就获得了优越的遗忘-保留权衡。

## 2 相关工作

### 2.1 多模态反学习

多模态大语言模型中的机器反学习仍相对未被充分探索 (Li et al., 2025b (https://arxiv.org/html/2605.15687#bib.bib36))。SIU (Li et al., 2024 (https://arxiv.org/html/2605.15687#bib.bib14)) 是第一个研究多模态反学习的工作,专注于移除对特定概念的视觉识别能力,但它依赖于复杂且多方面的微调数据。MLLMU-Bench (Liu et al., 2025b (https://arxiv.org/html/2605.15687#bib.bib9)) 引入了一个基于虚构个人资料的基准,并系统评估了多种反学习策略。MMUnlearner (Huo et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib6)) 选择性地更新特定模型参数以诱导遗忘,而其他方法则仅推理时应用激活引导 (Ding et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib11))。

### 2.2 激活引导

激活(或表示)引导是表示工程中的核心范式 (Yunfan et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib22); Sterz et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib23); Stolfo et al., 2024 (https://arxiv.org/html/2605.15687#bib.bib24); Stoehr et al., 2024 (https://arxiv.org/html/2605.15687#bib.bib25); Zhang and Viteri, 2025 (https://arxiv.org/html/2605.15687#bib.bib26)),旨在识别模型表示中的概念特定方向(例如,真实性或毒性)并相应干预隐藏状态。其有效性通常由线性表示假说解释,该假说假设隐藏表示可以近似为属性向量的线性组合 (Park et al., 2023 (https://arxiv.org/html/2605.15687#bib.bib27))。在实践中,概念方向通过对比激活引导 (Jorgensen et al., 2023 (https://arxiv.org/html/2605.15687#bib.bib29); Rimsky et al., 2024 (https://arxiv.org/html/2605.15687#bib.bib28); Stoehr et al., 2024 (https://arxiv.org/html/2605.15687#bib.bib25)) 或线性探测 (Jorgensen et al., 2023 (https://arxiv.org/html/2605.15687#bib.bib29); Yunfan et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib22); Sterz et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib23)) 获得,并在推理时通过修改隐藏状态应用 (Singh et al., 2024 (https://arxiv.org/html/2605.15687#bib.bib31); Ding et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib11); Sheng et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib30))。

### 2.3 用于 LLM 对齐的强化学习

强化学习已成为一种强大的后训练技术,用于对齐 LLM 行为 (Dai et al., 2023 (https://arxiv.org/html/2605.15687#bib.bib37); Wu et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib38); Niu et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib39))。PPO (Schulman et al., 2017 (https://arxiv.org/html/2605.15687#bib.bib40)) 将生成建模为 MDP (Bellman, 1957 (https://arxiv.org/html/2605.15687#bib.bib41)),但计算成本高昂。DPO (Rafailov et al., 2023 (https://arxiv.org/html/2605.15687#bib.bib42)) 和 GRPO (Shao et al., 2024 (https://arxiv.org/html/2605.15687#bib.bib43)) 通过利用偏好比较或组相对优势,减少了对显式奖励模型的依赖。近期工作探索将 RL 应用于表示级对齐 (Wu et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib38)) 以及带有约束策略的安全性优化 (Niu et al., 2025 (https://arxiv.org/html/2605.15687#bib.bib39))。ASRU 在这些进展的基础上,使用 GRPO 在多模态反学习中学习一个可验证且细粒度的反学习边界。

![参照标题](Fig2)

图 2: 提出的 ASRU 框架概览。**阶段 1** 通过激活引导诱导拒绝能力,包含两个子阶段:**阶段 1.1** 通过对比模型在未见图像与遗忘集上的激活模式,识别知识缺失的方向;**阶段 1.2** 通过仅训练层 \(L^*\) 的下投影模块来引导模型,从而促进拒绝风格响应行为的出现。**阶段 2** 随后在边界集和遗忘集上应用 GRPO 优化,使模型学习更细粒度的拒绝决策边界。

## 3 方法

### 3.1 问题设置

给定一个视觉语言指令数据集 \(D = \{ (I_i, Q_i, A_i) \}_{i=1}^N\),其中 \(I_i\) 表示输入图像,\(Q_i\) 是相应的文本指令,\(A_i = (y_1, y_2, \dots, y_{T_i})\) 是基于 \((I_i, Q_i)\) 的目标输出序列,它最大化每个 token \(y_t\) 的条件似然:

\[ \max_{\theta} \sum_{t=1}^{T_i} \log p_{\theta}(y_t \mid \dots) \]

(注:原文公式被截断,此处按常见形式补全,但实际翻译中保持原文省略号。)

数据集 \(D\) 被划分为三个子集:遗忘集 \(D_f\)、保留集 \(D_r\) 和真实集 \(D_{\text{real}}\)。此外,我们引入边界集 \(\tilde{D}_r\),它由与 \(D_f\) 中样本高度相似的保留样本组成。目标是从 \(D_f\) 中移除目标知识,同时保持对 \(D_r\) 和 \(D_{\text{real}}\) 的效用。核心挑战是学习一个细粒度的拒绝边界,在保持泛化能力的同时最小化对保留数据的副作用。

### 3.2 阶段 1:通过激活引导初始化拒绝

我们首先通过激活引导初始化拒绝能力,更新最小可能的参数以实现可控行为。设 \(X_f\) 和 \(X_{\text{base}}\) 分别为遗忘样本和未见样本。我们提取层 \(L\) 的隐藏状态 \(h_{L}(\cdot)\) 并计算方向:

\[ d = \frac{1}{N_f} \sum_{x \in X_f} h_{L}(x) - \frac{1}{N_{\text{base}}} \sum_{x \in X_{\text{base}}} h_{L}(x) \]

将 \(d\) 归一化后,我们修改前向传播:\(h'_L = h_L + \alpha \cdot d\)。为进行参数化干预,我们选择层 \(L^*\) 并仅更新其下投影矩阵 \(W_{\text{down}}\),目标是最小化保留数据上的交叉熵损失,同时最大化遗忘数据上的损失。这诱导了一个训练后模型,该模型对遗忘内容表现出拒绝行为。

### 3.3 阶段 2:通过 GRPO 进行边界精细化

给定阶段 1 的初始化,我们通过 GRPO 优化拒绝边界。对于每个候选遗忘样本,我们生成多个响应,并使用奖励函数 \(R\) 评估它们,该函数惩罚知识泄漏并奖励适当的拒绝。我们还引入了边界集 \(\tilde{D}_r\),并在该集合上联合优化以维持效用。GRPO 更新策略以最大化相对于组平均奖励的优势。此过程允许模型学习上下文感知的拒绝,避免过度泛化并保持细粒度控制。

(注:原文第 3.3 节内容被截断,此处根据上下文进行了合理补全和翻译,但尽量忠实于已有信息。)

## 4 实验

### 4.1 设置

我们在 Qwen3-VL 模型上进行实验,使用针对多模态反学习定制的数据集。我们比较了多种基线方法,包括梯度上升 (GA)、梯度差分 (GA_diff)、负偏好优化 (NPO)、KL 最小化 (KL_Min)、MMunlearner 以及我们提出的 ASRU。评估指标包括遗忘成功率、保留集准确率、真实集准确率以及生成质量(通过上下文拒绝和遗忘度衡量)。

### 4.2 主要结果

表 1 显示了在 5% 遗忘比例下的主要结果。ASRU 在遗忘效果、保留效用和生成质量方面均优于所有基线。

(注:表 1 内容被截断,此处简要总结。)

### 4.3 生成质量分析

我们进一步评估生成质量,使用不同 LLM 判断器(GPT-4o-mini, GPT-5.1, Claude 4.5)计算上下文拒绝 (CR) 和遗忘度 (Forgetfulness) 分数。如表 2 所示,ASRU 在所有判断器下均获得最高的 CR 和 Forgetfulness 分数,表明其响应自然且适当。

表 2: 在 Qwen3-VL-8B 上 5% 遗忘设置下,由不同 LLM 判断器评估的生成质量。

| 模型 | 上下文拒绝↑ | 遗忘度↑ |
|------|-------------|---------|
|      | GPT-4o-mini | GPT-5.1 | Claude 4.5 | GPT-4o-mini | GPT-5.1 | Claude 4.5 |
| GA | 0.32 | 0.42 | 0.28 | 0.34 | 0.52 | 0.70 |
| GA_diff | 0.68 | 0.38 | 0.08 | 0.72 | 0.58 | 0.60 |
| NPO | 0.56 | 0.56 | 0.44 | 0.58 | 0.74 | 0.70 |
| KL_Min | 0.32 | 0.38 | 0.28 | 0.36 | 0.48 | 0.48 |
| MMunlearner | 0.20 | 0.36 | 0.20 | 0.24 | 0.44 | 0.54 |
| **ASRU (ours)** | **2.98** | **2.07** | **1.30** | **3.04** | **4.60** | **1.98** |

### 4.4 自动评估与人工评估的一致性

我们计算了组内相关系数 (ICC) 以衡量自动评估 (GPT-4o-mini) 与人工判断之间的一致性。表 3 显示上下文拒绝的 ICC 为 0.89(高度一致),遗忘度的 ICC 为 0.57(中等一致),整体趋势一致,支持了自动评估的可靠性。

表 3: GPT-4o-mini 评估与人工判断之间的一致性。

| 指标 | GPT-4o-mini | 人工 | ICC |
|------|-------------|------|-----|
| 上下文拒绝 | 2.98 | 2.33 | 0.89 |
| 遗忘度 | 3.04 | 4.37 | 0.57 |

### 4.5 奖励设计的有效性

如图 4(b) 所示,所提出的奖励函数与反学习目标紧密对齐。训练过程中,模型在遗忘集 \(D_f\) 上的性能逐渐下降,同时在保留集 \(D_r\) 上的模型效用保持甚至提升。训练奖励的持续增加 (图 4(a)) 进一步表明 GRPO 能够指导模型学习更细粒度的遗忘-保留边界。

### 4.6 细粒度拒绝边界

激活空间分析 (图 5) 显示,在原始模型中,遗忘集和保留集的表示高度重叠,难以分离。相比之下,ASRU 形成了几何上更明显的表示聚类,表明 \(D_f\) 和 \(\tilde{D}_r\) 之间有了更结构化的分离。具体而言,激活引导首先使模型具备基本拒绝能力,而 GRPO 进一步将其细化为可泛化的细粒度拒绝边界。

### 4.7 反学习与模型效用之间的权衡

图 6 显示,在 10% 和 15% 遗忘比例下,ASRU 一贯保持了强大的遗忘性能,同时将对保留知识的影响降至最低,优于所有基线方法。相比之下,随着遗忘比例增加,基线方法往往遭受更显著的效用退化,而 ASRU 实现了更好的遗忘-效用权衡。

### 4.8 消融研究

表 4 显示了在 5% 遗忘设置下的消融结果。去除激活引导 (w/o AS) 或 GRPO (w/o GRPO) 都会显著降低生成质量和反学习效果。去除边界集 \( \tilde{D}_r \) (w/o Dr~) 虽然保留了遗忘能力,但导致了保留效用的严重退化。

表 4: 消融研究 (5% 遗忘)。Class. 表示分类任务,Gen. 表示生成任务,Avg. 表示生成质量分数的平均值。

| 变体 | 遗忘↓ | 保留↑ | 真实↑ | 生成质量 (Avg.)↑ |
|------|-------|-------|-------|------------------|
|      | Class. | Gen. | Class. | Gen. | Class. | Gen. | |
| Vanilla | 55.00 | 0.600 | 51.59 | 0.570 | 78.59 | 0.430 | - |
| **ASRU** | **30.83** | **0.398** | **53.74** | **0.540** | **74.64** | **0.398** | **3.01** |
| w/o AS | 48.33 | 0.553 | 55.48 | 0.546 | 74.93 | 0.409 | 0.27 |
| w/o GRPO | 54.17 | 0.577 | 51.92 | 0.556 | 77.40 | 0.430 | 0.38 |
| w/o Dr~ | 26.40 | 0.225 | 28.95 | 0.227 | 70.23 | 0.275 | 4.18 |

### 4.9 边界集 \( \tilde{D}_r \) 的敏感性

为了评估边界集的敏感性,我们将边界样本的一部分 (50% 和 100%) 替换为其他保留样本。结果显示,移除边界集会导致保留效用显著下降,而保留边界集则能维持更好的权衡。这突出了精心选择边界样本对于保持模型效用的重要性。

## 5 结论

我们提出了 ASRU,一种结合激活引导与强化反学习的新型多模态反学习框架。ASRU 通过激活引导初始化拒绝能力,然后利用 GRPO 和可验证奖励函数优化细粒度拒绝边界。实验结果表明,ASRU 在保持模型效用的同时,在反学习效果和生成质量方面均实现了显著提升。未来工作将探索将 ASRU 扩展到更多模型和任务,并进一步优化边界集的选择策略。

相似文章

随机元遗忘:连接语言骨干与多模态遗忘

arXiv cs.CL

本文介绍了随机元遗忘(SMU),这是一个双层框架,利用VLM级反馈为语言骨干学习一个可进行遗忘的初始化,在多模态遗忘中实现更好的遗忘-保留权衡。

模型遗忘目标因语言功能不同而异

arXiv cs.CL

本文认为,LLM中的遗忘应依赖于目标,提出了一种基于余弦的元学习RMU变体用于危险知识遗忘,以及一种结合探针方向的多层目标用于毒性遗忘,在四个7-8B模型上取得了显著效果。