LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘
摘要
本文揭示了经过强化学习训练的多模态大型推理模型中的一个隐私漏洞:即使在最终答案中成功消除了敏感事实,模型仍可能在推理轨迹中重现这些事实。为此,本文提出LEMUR,一个无需训练、推理时运行的框架,利用熵动态来检测并抑制此类泄露。
arXiv:2608.11691v1 公告类型:新
摘要:强化学习(RL)后训练使多模态大型推理模型(MLRMs)具备探索性的思维链(CoT),大幅提升了视觉推理能力。然而,我们发现这种能力引入了一个独特的隐私漏洞:即使一个敏感事实已成功从最终答案中“遗忘”,模型仍可能在其推理轨迹中重现该事实。这种泄露在原生RL训练的MLRMs中远比其非推理基础模型明显,揭示了现有遗忘方法并未设计来解决的隐私风险。我们表明,RL诱导的探索会在敏感内容上留下一种独特的token级熵特征,而基础模型基本不具备这种特征。基于这一观察,我们提出LEMUR——一个完全无需训练、推理时执行的遗忘框架,适用于原生RL训练的多模态模型。LEMUR利用熵动态作为控制信号,判断敏感推理何时开始、净化应在何时停止。在此区间内,它通过熵调制的视觉锚定潜在注入来重定向推理轨迹,将已承诺的token替换为重新基于输入图像的净化后概率加权嵌入。在多种MLRMs上,LEMUR在抑制推理轨迹和答案泄露方面始终优于现有遗忘方法,同时更好地保留了非敏感效用和输出流畅度。这些结果表明,RL诱导的熵动态为隐私泄露提供了独特信号,利用该信号能够实现针对具备推理能力的多模态模型的有效且无需训练的遗忘。
查看缓存全文
缓存时间: 2026/08/13 15:38
# LEMUR: 基于视觉锚定推理重定向的潜在熵感知多模态机器遗忘(Latent Entropy-aware Multimodal Unlearning via Visual-anchored Reasoning Redirection)
来源:https://arxiv.org/html/2608.11691
###### 摘要
强化学习(Reinforcement-Learning, RL)后训练为多模态大推理模型(Multimodal Large Reasoning Models, MLRMs)赋予了探索性思维链(Chain of Thought, CoT)能力,显著提升了视觉推理表现。然而,我们发现这种能力引入了一个独特的隐私漏洞:即使某个敏感事实已成功从最终答案中被遗忘,模型仍可能在推理轨迹中复述该事实。这种泄漏在原生 RL 训练的 MLRMs 中比其非推理基础模型明显更为严重,这揭示了现有机器遗忘方法并未设计用于应对的隐私风险。我们证明,RL 诱导的探索会使敏感内容呈现出一种独特的 token 级熵特征(entropy signature),而该特征在基础模型中基本不存在。基于这一观察,我们提出 LEMUR,一个完全免训练、推理时运行的机器遗忘框架,适用于原生 RL 训练的多模态模型。LEMUR 使用熵动态作为控制信号,以识别敏感推理何时开始以及净化应在何时停止。在该时间间隔内,它通过熵调制的视觉锚定潜在注入(entropy-modulated visual-anchor latent injection)重定向推理轨迹,用经净化处理、按概率加权的、重新锚定到输入图像的嵌入表示替换已承诺的 token。在多种 MLRMs 上,LEMUR 在抑制推理轨迹泄漏和答案泄漏方面均持续优于现有遗忘方法,同时更好地保留非敏感实用性和输出流畅性。这些结果表明,RL 诱导的熵动态为隐私泄漏提供了独特信号,而利用该信号能够实现对具备推理能力的多模态模型的有效免训练遗忘。
## 引言
强化学习(RL)后训练重塑了多模态模型的推理方式。现代多模态大推理模型(MLRMs),如 R1-Onevision 和 Vision-R1(Yang et al. 2025 (https://arxiv.org/html/2608.11691#bib.bib23);Huang et al. 2025 (https://arxiv.org/html/2608.11691#bib.bib5)),不再直接给出答案,而是被训练为进行探索,在回答之前在显式的 ⟨think⟩...⟨/think⟩ 区域中发出长思维链(CoT)。这种探索性推理驱动了它们在视觉问答上的大部分性能提升。然而,驱动这种推理的更强探索能力也带来了更大的隐私风险:这类模型在推理过程中往往比其非推理对应模型泄漏更多敏感信息。这要求实现*机器遗忘*(machine unlearning),即在不需要从头重新训练的情况下,按请求移除指定主体的信息。
请参见图1的说明:不同 MLLMs 的熵现象。我们展示了不同 MLLM 模型对同一问题和图像的回答,以及相应的 token 级熵。在基础 MLLM 上,模型通常表现出相当混乱的熵分布,而 RL 训练的 MLLM 在特定输出区间显示出明显的跳变和骤降。
这些推理模型建立在指令式多模态大语言模型(MLLMs)之上,例如 Qwen2-VL(Wang et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib22))。对这类模型的遗忘通常有两种方式:一种是通过*微调*权重来抑制答案中的目标信息(Thudi et al. 2022 (https://arxiv.org/html/2608.11691#bib.bib20);Zhang et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib24);Huo et al. 2025 (https://arxiv.org/html/2608.11691#bib.bib6)),另一种是通过*免训练*的推理时干预来强制达到遗忘状态,例如破坏提示嵌入、施加 logit 校正或对提示进行守护(Liu et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib12);Huang et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib4);Ji et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib8);Pawelczyk, Neel, and Lakkaraju 2023 (https://arxiv.org/html/2608.11691#bib.bib17);Thaker et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib19))。然而,推理模型暴露了一种以答案为中心的观点所忽视的失败模式:模型可以从最终答案中省略某个隐私事实,却仍在推理轨迹中复述该事实。这导致了一种张力(Li et al. 2026 (https://arxiv.org/html/2608.11691#bib.bib9)):在答案层面进行清理会使轨迹继续泄漏,而为了阻止泄漏而对轨迹进行足够强硬的扰动又会削弱模型的推理能力。除了这种张力之外,现有方法与 RL 训练的 MLRMs 在两个方面存在根本性不匹配。第一,它们缺乏可靠机制来监控 RL 训练所引发的多样化、探索性的推理轨迹。因此,当模型回忆起同一主体的其他敏感属性,或使用语义等价或同义表达复述同一隐私的事实时,泄漏可能会持续存在。第二,这些方法所依赖的微调和激活引导(activation-steering)干预对这类模型可能过于具有破坏性,会严重损害那些最初使它们与众不同的推理能力。这些局限性表明,隐私泄漏应该在解码过程中被拦截,因为此时可以直接监控和控制模型不断演化的推理轨迹。至关重要的是,这一过程也暴露了一个现有方法所忽视的信号。我们从单个 token 层面研究记忆属性在解码过程中如何浮现,发现 RL 训练的 MLRMs 对其复述会产生一种特有的两阶段*熵特征*,而这一特征在其非推理基础模型中基本不存在:泄漏始于一个高熵决策点,模型在若干候选值之间犹豫不决;一旦它承诺该属性,逐 token 熵就会骤降至接近零,并在此属性跨度结束前一直保持低位,直到其边界才恢复。我们将这种暴露的结构归因于 RL 探索,在该过程中模型在轨迹内主动斟酌并承诺已记忆的内容,而不仅仅是在答案中输出这些内容。在这一特征的指导下,我们提出 LEMUR,一个完全在解码时运行的免训练遗忘框架。给定一个遗忘集,LEMUR 构建一个遗忘相关空间(forget-relevance space),以捕捉与目标主体相关的受保护内容,同时使用 token 级熵作为即将回忆的互补内部信号。解码随后由这两种信号共同控制。当模型发出与遗忘相关的 token,或在其逐 token 熵轨迹中表现出异常偏离时,LEMUR 从标准自回归解码切换至潜在解码模式。它不是重新注入已承诺的 one-hot token,而是将潜在轨迹重定向至一个经过净化的视觉锚,注入强度由当前熵动态调制。由于仅靠遗忘相关性无法提供恢复离散解码的可靠判据,LEMUR 使用从当前轨迹统计中估计的自适应熵阈值来确定退出点。为了防止离散解码与潜在解码之间的反复振荡——并由此保持周围推理的连贯性——我们进一步引入了一个不应期冷却窗口,并限制允许的状态转换次数。在一系列 RL 训练的 MLRMs 上,LEMUR 在显著降低答案层面和轨迹层面泄漏的同时,保持了实用性和流畅性,优于基于训练和免训练的基线方法。据我们所知,这是第一个为 RL 训练的推理 MLRMs 设计的遗忘方法,也是第一个利用其解码时熵动态的方法。我们将贡献总结如下。
- •我们证明,RL 训练的 MLRMs 比其基础 MLLMs 遭受明显更严重的推理轨迹泄漏,并且这种泄漏带有独特的 token 级熵特征。
- •基于泄漏的独特熵特征,我们提出 LEMUR,一个免训练框架,通过引导解码过程来实现遗忘,切换到潜在解码状态,并注入熵控制的视觉锚以重定向推理轨迹。
- •在一系列推理 MLRMs 上,LEMUR 实现了最先进的遗忘性能,在泄漏、实用性和流畅性方面均优于基于训练和免训练的基线方法。
## 相关工作
### 推理多模态大语言模型
大型推理模型扩展测试时计算,以发出显式思维链,通过带有可验证奖励的强化学习,学会在承诺答案之前进行深思熟虑(Guo et al. 2025 (https://arxiv.org/html/2608.11691#bib.bib3);Jaech et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib7))。这一范式随后进入多模态领域,其中多模态大推理模型(MLRMs),如 R1-Onevision 和 Vision-R1,将视觉感知与语言推理相结合,显著改善了视觉问答(Yang et al. 2025 (https://arxiv.org/html/2608.11691#bib.bib23);Huang et al. 2025 (https://arxiv.org/html/2608.11691#bib.bib5))。与指令式多模态大语言模型(MLLMs)(其推理过程是通过提示或蒸馏获得的(Wang et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib22);Liu et al. 2023 (https://arxiv.org/html/2608.11691#bib.bib13);Zhang et al. 2025 (https://arxiv.org/html/2608.11691#bib.bib25)))不同,这些模型的推理是原生地通过 RL 获得的。然而,显式轨迹是一把双刃剑:虽然它改善了推理,但也可能使已记忆的私有内容浮出水面,即使最终答案是干净的(Li et al. 2026 (https://arxiv.org/html/2608.11691#bib.bib9)),这种行为最好在单个解码步骤层面进行诊断。我们的方法正是利用了这一视角,对推理轨迹的 token 级熵进行干预。
### 机器遗忘
机器遗忘旨在不从头重新训练的情况下,从已训练模型中移除指定数据的影响。它最初是仅针对文本 LLM 开发的,使用的方法包括梯度上升及其稳定变体、偏好优化,以及贝叶斯或连续学习形式(Thudi et al. 2022 (https://arxiv.org/html/2608.11691#bib.bib20);Zhang et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib24);Nguyen, Low, and Jaillet 2020 (https://arxiv.org/html/2608.11691#bib.bib16);Liu, Liu, and Stone 2022 (https://arxiv.org/html/2608.11691#bib.bib11)),以及作用于提示或输出 logits 的免训练推理时干预(Liu et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib12);Huang et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib4);Ji et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib8);Pawelczyk, Neel, and Lakkaraju 2023 (https://arxiv.org/html/2608.11691#bib.bib17);Thaker et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib19))。与此同时,另一条研究路线从文本到图像扩散模型中擦除概念(Gandikota et al. 2023 (https://arxiv.org/html/2608.11691#bib.bib2);Zhong et al. 2025 (https://arxiv.org/html/2608.11691#bib.bib27);Sun et al. 2026 (https://arxiv.org/html/2608.11691#bib.bib18);Zhang et al. 2026 (https://arxiv.org/html/2608.11691#bib.bib26))。这些思想随后通过单图像、模态感知以及其他多模态特化方案被引入 MLLMs,这些方案主要作用于最终答案(Li et al. 2024 (https://arxiv.org/html/2608.11691#bib.bib10);Huo et al. 2025 (https://arxiv.org/html/2608.11691#bib.bib6);Cheng and Amiri 2024 (https://arxiv.org/html/2608.11691#bib.bib1);Liu et al. 2025b (https://arxiv.org/html/2608.11691#bib.bib15))。推理模型带来了更严峻的挑战,因为仅遗忘答案会使事实仍可从轨迹中恢复,而过于激进的轨迹扰动则会使推理陷入退化的重复(Wang et al. 2025 (https://arxiv.org/html/2608.11691#bib.bib21))。与我们的工作最接近的是 Li et al.(Li et al. 2026 (https://arxiv.org/html/2608.11691#bib.bib9))将这种保留推理的设置形式化,并提出了 R-MUSE,一种免训练的激活引导方法。然而,与上述其他方法类似,它针对的是指令式 MLLMs,并且作用于隐藏激活,而非解码过程本身。因此,据我们所知,LEMUR 是第一个为原生 RL 训练的 MLRMs 设计的遗忘框架,也是第一个在解码时进行干预、利用推理轨迹的熵动态通过熵控制的视觉锚潜在注入来重定向生成过程的框架。
## 方法
### 问题定义
我们研究针对多模态大推理模型(MLRMs)的机器遗忘(MU),目标是在移除目标遗忘知识的同时,最小化通用能力的下降。设 Mθ 表示参数为 θ 的原始 MLRM。我们将 Df = {(I_j, T_j)}_{j=1}^{N_f} 记为*遗忘集*,其中包含需要被遗忘的主体;Dn = {(I_k, T_k)}_{k=1}^{N_n} 为遗忘集之外的其余*正常数据*,模型在这些数据上的通用能力必须得到保留。其中每个 I 是一张图像,T = (q, a) 是一个用于视觉理解的问答对。
#### MLRM 生成。
与非推理 MLLM 将查询直接映射为答案不同,MLRM 将其输入构造为视觉编码器产生的 N 个视觉 token x_v 与 M 个文本 token x_t 的拼接,即 x = x_v ⊕ x_t,然后进行自回归解码。在步骤 t,它预测下一个 token 分布 p_t = M_θ(⋅ ∣ x, y_{<t}),其中 y_{<t} 是先前生成的 token 序列。推理模型的关键能力在于其显式推理轨迹 y = (y_1, ..., y_T),它包含一个思维链区域 <think> ... </think>,后接一个答案区域。我们考虑一个标准的成对遗忘场景:对于 Df 中的每个样本,目标是从整个生成过程(包括思维轨迹和最终答案)中移除关于目标主体的特定知识,同时保留不相关的能力。
#### 熵分析。
考虑解码过程中每一步的归一化熵。对于第 t 步的预测分布 p_t,我们将逐 token 熵定义为
H_t(v) = -∑_{v' ∈ vocab} p_t(v' | y_{<t}) log p_t(v' | y_{<t}) / log |vocab|,
其中 v 表示当前位置的 token 值,|vocab| 为词表大小。我们发现,在 RL 训练的 MLRMs 中,已记忆的敏感属性在被召回到推理轨迹中时,会呈现出一种独特的两阶段熵模式:在属性浮现之前,熵较高,模型在不同候选值之间摇摆;随后,当模型承诺到该属性时,熵迅速下降并维持在低位,直到该属性跨度结束。
#### 解码期间的遗忘目标。
基于上述观察,我们提出 LEMUR,一个完全在解码时运行、无需训练的遗忘框架。它利用熵动态作为敏感推理的控制信号,并使用熵调制的视觉锚潜在注入来重定向推理轨迹。
解码受遗忘相关性和熵轨迹两种信号调控。给定遗忘集,LEMUR 构建一个遗忘相关空间,该空间捕捉与目标主体相关的受保护内容。当模型发出一个与遗忘相关的 token,或在其逐 token 熵轨迹中出现异常偏离时,LEMUR 从标准自回归解码切换到潜在解码模式。具体来说,对于位置 t,我们计算一个遗忘相关得分 s_t = ⟨h_t, e_f⟩,其中 h_t 是当前隐藏状态,e_f 是遗忘相关空间中的嵌入。然后通过比较该得分与阈值来判断是否触发切换至潜在解码。在潜在解码模式下,我们不提交已承诺的 one-hot token,而是将潜变量轨迹重定向向一个经过净化的视觉锚,注入强度由当前熵动态调制。由于仅凭遗忘相关性无法为恢复离散解码提供可靠判据,LEMUR 使用从当前轨迹统计估计的自适应熵阈值来决定退出点。为了防止两种解码模式之间反复振荡,我们引入了不应期冷却窗口,并限制允许的转换次数,以保持周围推理的连贯性。
#### 潜在解码中的视觉锚注入。
设 e_t 为在第 t 步用于下一 token 预测的输入嵌入。在潜在解码模式下,我们构造一个由视觉锚和负向消除锚组成的组合锚。视觉锚 e_vis 是基于从当前隐藏状态 h_t 中提取的视觉特征得到的,其形式为
e_vis = Proj(W_v h_t + b_v),
其中 Proj 为归一化投影,W_v、b_v 为投影参数,用于从未被污染的多模态转向表征中引导潜在轨迹。安全答案锚 e_safe 则通过对几个固定的拒绝和不确定模板(例如“我不确定”和“我无法从图像中辨认出这个人”)的嵌入进行平均得到。它将生成过程拉向一个良性的答案。我们将它们组合成一个复合锚
a = β e_vis + (1 − β) e_safe, (9)
其中 β ∈ [0,1] 用于权衡将响应锚定到图像与将其转向明确的安全表述。
#### 熵控制注入。
我们通过凸插值将复合锚注入潜在反馈:
e_t = (1 − γ_t) \hat{e}_t + γ_t a, (10)
其中注入强度 γ_t 由式(3)的逐步熵 H_t(v) 决定。我们让 γ_t 依赖于熵,因为记忆跨度的两个阶段需要不同的引导强度。当熵较高时,属性值尚未决定,因此强锚可以低成本地引导结果;当熵较低时,模型已经在复述流畅的文本,而掩蔽已使其安全,因此强锚只会扭曲它。因此,我们按 H_t(v) 的比例缩放 γ_t,使用 γ 作为参考熵 τ 下的强度:
γ_t = min( γ_max, (H_t(v)/τ) γ ), (11)
并将其限制在 γ_max 以内,以使反馈保持在嵌入流形上。于是,高熵步骤获得更强的引导,低熵步骤获得较弱的引导;当 H_t(v) = τ 时,强度等于 γ。在敏感片段的每一步应用式(6)–(11),会将推理重定向至安全轨迹,同时保持模型的推理能力。相似文章
深度熵引导采样实现无需训练的大语言模型推理
介绍深度熵引导采样(DEGS),一种无需训练、测试时的方法,利用大语言模型中逐层熵崩塌来改善推理能力,无需强化学习训练,达到与RL后训练模型相竞争的结果。
抗泄漏机器遗忘:评估多跳推理一致性与恢复鲁棒性的新基准
本文介绍了一个用于评估机器遗忘的新基准,重点关注多跳推理一致性和恢复鲁棒性。实验表明,现有遗忘方法在遗忘质量、鲁棒性和效用保持之间面临“不可能三角”的权衡。
打破自回归诅咒:动态认知熵编排的可擦除强化学习用于LLMs
本文提出E³RL,一种使用动态认知熵阈值的强化学习方法,使LLMs能够在生成过程中切除局部逻辑缺陷,克服长程推理中的自回归诅咒,并在AIME等数学推理基准上取得最先进的结果。
重新思考大语言模型推理中的强化学习:关键在于稀疏策略选择,而非能力学习
本文挑战了强化学习(RL)能为大语言模型(LLM)教授新推理能力的假设,论证其作用实则是在高熵决策点进行稀疏策略选择。本文提出了 ReasonMaxxer,这是一种无需强化学习的方法,以显著更低的训练成本实现了与完整强化学习相当的性能。
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。