基于 Process Sidecars 的可撤销学习状态
摘要
本文介绍了 Process Sidecars,一种用于在安全训练后从语言模型中撤销学习状态的双系数编辑族,实现了二阶精度,并在多个模型的实验中优于朴素任务算术。
arXiv:2606.30788v1 公告类型:新
摘要:语言模型通常分阶段进行适配:公共技能阶段、私有记忆阶段以及后期的安全阶段,该阶段学习拒绝与已记忆实体相关的输出。在安全阶段之后撤销记忆并不等同于减去记忆更新:后期的安全优化器已经改变了记忆方向。我们提出了 Process Sidecars,一个双系数编辑族 $\hat{\theta}(\lambda,\gamma)=\theta_{\mathrm{AMS}}-\lambda\Delta_{\mathrm{M}}-\gamma\hat{R}_{\mathrm{S}\leftarrow\mathrm{M}}$,其中 $\hat{R}_{\mathrm{S}\leftarrow\mathrm{M}}=\hat{J}_{\mathrm{S},\varepsilon}(\Delta_{\mathrm{M}})-\Delta_{\mathrm{M}}$,而 $\hat{J}_{\mathrm{S},\varepsilon}$ 是通过已实现的未来 AdamW 安全训练过程的一条中心割线。该实现使用 $\varepsilon=1$ 在自然记忆编辑尺度上;它重用 $\theta_{\mathrm{AMS}}$ 作为正端点,并在 $\theta_{\mathrm{A}}-\Delta_{\mathrm{M}}$ 处计算一条额外的安全轨迹。我们证明了两个结果。首先,精确的侧边栏(使用真实已改变方向 $R_{\mathrm{S}\leftarrow\mathrm{M}}$ 而非割线估计)在 $(\lambda,\gamma)=(1,1)$ 处以二阶精度恢复了反事实的仅安全预言 $\theta_{\mathrm{AS}}$;该证明将 AdamW 视为一个包含参数、一阶矩和二阶矩的增广状态映射。其次,这种过程信息是必要的:每当未来的安全训练改变记忆方向时,所有标量任务算术编辑都会留下一阶反事实误差,而过程侧边栏编辑则是二阶精确的。在三个模型上,验证选择的二维编辑在所有试验中均优于朴素任务算术的保留拒绝封闭性,并且在与 $\gamma=\lambda$ 过程-JVP 子族(缓存的二维网格的对角线切片)的成对比较中均胜出。
查看缓存全文
缓存时间: 2026/07/01 05:32
# 通过过程侧车实现可撤销的学习状态 来源: https://arxiv.org/html/2606.30788 ###### 摘要 语言模型通常分阶段适配:先是公开技能阶段,接着是私有记忆阶段,最后是一个安全阶段,学习拒绝与已记忆实体相关的输出。在安全阶段之后撤销记忆,与简单减去记忆更新并非同一问题。后续的安全优化器已经运输了记忆方向。我们引入 *过程侧车*(process sidecars),一个双系数编辑族 θ^(λ,γ)=θ_AMS−λΔ_M−γR̂_{S←M}, R̂_{S←M}=Ĵ_{S,ε}(Δ_M)−Δ_M,其中 Ĵ_{S,ε} 是通过已实现的未来 AdamW 安全训练过程的一个中心割线。实现中使用 ε=1,这是自然的记忆编辑尺度;它重用 θ_AMS 作为正端点,并在 θ_A−Δ_M 处计算一个额外的安全迹。我们证明两件事。第一,精确的侧车(使用真实的运输方向 R_{S←M},而非割线估计)在 (λ,γ)=(1,1) 处,直到二阶项都恢复反事实的仅安全预言机 θ_AS;证明将 AdamW 视为参数、一阶矩和二阶矩上的增广状态映射。第二,这个过程信息是必要的:只要未来的安全训练弯曲了记忆方向,每个标量任务算术编辑都会留下一阶反事实误差,而过程侧车编辑则是二阶精确的。在 Qwen-2.5-0.5B-Instruct、Qwen-2.5-1.5B-Instruct 和 Llama-3.2-1B-Instruct(每个 20 次试验)上,基于验证选择的 2D 编辑在 60 次试验中的 60 次中改善了保留拒绝封闭性,优于朴素任务算术;在 60 次配对试验中的 60 次中,也优于 γ=λ 过程-JVP 子族(缓存 2D 网格的对角切片,24 个单元格中的 2 个)。逐试验符号为 60/60;按模型-数据-种子聚类聚合,得到 15 个正的块均值和一个精确块符号检验 p=2^{−15}=3.05×10^{−5}。一个锁定协议的确认复制(使用从未见过的种子,并记录了样本量修正)在三个主要尺度和一个当代 8B 变换器上复制了效果(70/70 次试验;20 个正的模型-数据-种子块均值,p=2^{−20}≈9.5×10^{−7})。梯度上升遗忘驱动拒绝封闭性远低于各种配置下的仅安全预言机。
## 1 引言
一个部署的模型很少只有单一的训练历史。基础模型先为公开技能进行适配,然后为用户特定或专有的事实进行适配,最后为一个安全策略(规定模型应拒绝什么)进行适配。最终检查点不仅仅是一个知道私有信息的模型。它是一个模型,其安全策略可能依赖于稍后将被撤销的实体本身。本文研究这个撤销问题。我们给定一个最终检查点 θ_A →_M θ_AM →_S θ_AMS,其中 M 是一个记忆阶段,S 是后续的安全阶段。目标是反事实预言机 θ_AS = Train_S(θ_A),即模型会接受相同安全训练但从未学习记忆的模型。可部署的撤销服务原地编辑已发布的工件 θ_AMS,保留其轨迹特定的特征(数据顺序、优化器状态演化、下游流水线集成),而这些是反事实重新训练模型不会共享的。选择器使用 θ_A、θ_AM、θ_AMS、验证数据和一个额外的安全过程迹;它不访问 θ_AS 或任何测试指标。我们的贡献:当安全阶段运输记忆方向时,沿 Δ_M 的标量任务算术被证明是一阶不完全的,而理想的过程-JVP 侧车将此误差抵消至二阶。标准的权重空间答案是任务算术:从 θ_AMS 中减去记忆增量 Δ_M = θ_AM − θ_A(Ilharco 等,[2023](https://arxiv.org/html/2606.30788#bib.bib12))。这个答案是不完全的。记忆更新在记忆阶段之后并非静态存储,而是被后续的安全优化器作用。如果 T = Train_S 是已实现的安全训练映射,则 θ_AMS = T(θ_A + Δ_M) = θ_AS + DT(θ_A)Δ_M + O(‖Δ_M‖²)。因此,在 ‖Δ_M‖ 的一阶下,最终模型中存在的方向是 DT(θ_A)Δ_M,而不是 Δ_M。朴素任务算术隐含地假设 DT(θ_A) = I。过程侧车估计这个运输的方向。我们将 DT(θ_A)Δ_M 分解为 Δ_M + R_{S←M}, R_{S←M} = (DT(θ_A) − I)Δ_M,并搜索二维族 θ̂(λ,γ) = θ_AMS − λΔ_M − γ R̂_{S←M}。该族包含 γ=0 处的朴素任务算术和 γ=λ 处的过程-JVP 线。额外的系数通过一个固定的、无预言机的验证规则选择,该规则强制遗忘和技能约束,然后最大化拒绝边际。经验上的分离直接出现在图 1 中:在 Qwen-2.5-0.5B-Instruct、Qwen-2.5-1.5B-Instruct 和 Llama-3.2-1B-Instruct 上,过程侧车打开了一个低秘密 AUC 和高拒绝封闭的区域,而朴素和一维过程线则错失了这一区域。从相同的评估网格中选择时,完整 2D 族在 60 次配对试验中的 60 次中击败了匹配的过程-JVP 线。
> 图 1 标题:过程侧车在匹配的秘密令牌可区分性下保持拒绝。保留测试,每个尺度 20 次试验。大标记是每次试验的验证选择点(见图例);淡点是底层网格评估,每方法的帕累托包络以阶梯线覆盖。x 轴是校准后的秘密 AUC,max(AUC, 1−AUC),其中 0.5 表示无可利用的排名信号;y 轴是相对于预言机的拒绝封闭性(1 表示匹配仅安全预言机,0 表示未编辑的最终检查点 θ_AMS)。所有三个选择器都只留下接近机会水平的秘密可区分性(≈0.54);过程-2D 选择获得了显著更高的拒绝封闭性(每个尺度 20/20 胜于朴素)。FT-unlearn 在底部被截断;图内标注给出了所有 FT-unlearn 评估的每次试验封闭性范围(六配置网格加单配置种子扫描),宽于表 4 中每个配置的最小/最大值。
本文提出三个主张。第一,过程侧车是正确的一阶对象。我们证明了完整多步 AdamW 安全过程(包括矩和预处理器状态)的恒等式,并表明当安全训练弯曲记忆方向时,任何限制在原始记忆线上的编辑都会留下二阶误差。第二,二维族超出预言机的一阶近似是有用的,因为有限曲率验证会选择过程-JVP 线无法得到的非对角修正。第三,梯度上升遗忘对于此设置具有错误的局部几何:一旦安全训练使得一阶安全梯度变小,具有正安全曲率的记忆上升方向会在二阶上增加安全损失。
## 2 设置与评估
检查点序列为 θ_A → θ_AM → θ_AMS。记忆阶段 M 在私有事实集 D_M 上训练。安全阶段 S 在绑定到相同实体和诱饵的提示上训练拒绝行为。反事实预言机为 θ_AS = Train_S(θ_A),使用与观察到的 S 阶段相同的安全数据、优化器计划、种子和小批量顺序。在此已实现迹上的条件化使 T = Train_S 成为一个确定性映射。所有实验都使用可训练坐标向量。对于 LoRA 运行,θ 表示适配器坐标向量;对于全参数基线,它表示全可训练向量。主要运行使用 LoRA rank 8,应用于注意力和 MLP 模块(Hu 等,[2022](https://arxiv.org/html/2606.30788#bib.bib10))。记忆数据是形如 AAA-1234-AAA-1234 的高熵金丝雀,与项目标识符配对。结构化合成金丝雀使用类似档案的记录,而非原始令牌串。我们评估三个量。
*遗忘* 是真实秘密令牌在 31 个诱饵中的可恢复信号。我们报告校准后的秘密 AUC,AUC_secret_cal(θ) = max(AUC_secret(θ), 1 − AUC_secret(θ)),当秘密无法在诱饵中排名时等于 0.5,在完美记忆时等于 1.0。校准后 AUC 是正确的保密度量,因为原始 AUC < 0.5 是反排名,并非更好的遗忘:自适应评估器可以翻转分数并恢复相同信号。
*拒绝保持* 是一个带符号的对数概率边际 m(θ) = log p_θ(refuse|prompt) − log p_θ(comply|prompt),针对绑定实体的提示,报告为相对于预言机的封闭性:closure_refusal(θ) = (m(θ) − m(θ_AMS)) / (m(θ_AS) − m(θ_AMS)),因此封闭性 1 表示编辑恢复了预言机边际,封闭性 0 表示仍处于 θ_AMS。负封闭性表示编辑的拒绝边际低于 θ_AMS。
*技能保留* 是一个单侧仅 θ_AMS 分数:如果编辑的公开技能验证 NLL 保持在 θ_AMS 的容忍范围内,则为 1,超出时线性衰减。它不使用预言机量。在表 1 中,我们报告校准 AUC 差距 AUC_secret_cal(θ_2D) − AUC_secret_cal(θ_naive);接近零的值表示两种方法使秘密的可区分性相当。可部署的选择器从不使用 θ_AS 或测试指标。它通过验证秘密 AUC ≤ 0.60、技能保留 ≥ 0.90 和拒绝偏好率 ≥ 0.99 过滤候选;在可行候选中最大化 log(1 + max{0, m_edit − m_AMS}),其中 m 是验证拒绝边际,然后通过最小编辑范数打破平局。
## 3 方法
#### 估计运输后的记忆方向。令 u = Δ_M。过程-JVP 方向是 J_S(u) = DT(θ_A)u,这是前向灵敏度意义上的雅可比-向量乘积(Pearlmutter,[1994](https://arxiv.org/html/2606.30788#bib.bib26);Maclaurin 等,[2015](https://arxiv.org/html/2606.30788#bib.bib20);Lorraine 等,[2020](https://arxiv.org/html/2606.30788#bib.bib17))。计算完整 AdamW 微调运行的精确雅可比是不必要的。我们通过相同未来安全训练过程的中心割线估计该乘积:
Ĵ_{S,ε}(u) = (T(θ_A + εu) − T(θ_A − εu)) / (2ε). (1)
实现中使用 ε=1,因为 ‖Δ_M‖ 是记忆编辑的自然尺度。正端点是已发布的工件:T(θ_A + Δ_M) = T(θ_AM) = θ_AMS,因此在撤销期间只需计算负端点 T(θ_A − Δ_M)。第 4 节中的局部定理给出了极限论证;实验直接评估有限尺度估计器。
#### 编辑族。残差侧车为 R̂_{S←M} = Ĵ_{S,ε}(Δ_M) − Δ_M。我们搜索
θ̂(λ,γ) = θ_AMS − λΔ_M − γ R̂_{S←M}. (2)
三个子族很重要。朴素任务算术是 γ=0。过程-JVP 线是 γ=λ,因为此时编辑减去 λ J_S(Δ_M)。完整 2D 族允许 γ 独立移动。
> **图 2 标题**:过程侧车的自然坐标。过程-JVP 线为 ζ=0。完整 2D 族可以选择非对角曲率校正,而朴素任务算术位于 γ=0 线上,而非过程线上。
用有限曲率自由度更清晰:τ = 1 − λ, ζ = λ − γ。在这些坐标中,过程-JVP 线正好是 ζ=0(图 2)。γ 的原始符号没有不变含义;非对角系数是 ζ。这在经验上很重要:在 Qwen-2.5-1.5B-Instruct 上,选定的 γ 是双峰的,14 次试验选择 +2.0,6 次选择 -0.5。理论预测的是试验局部曲率对齐,而非 γ 的尺度定律。
#### 基线。我们比较随机范数匹配编辑、朴素任务算术、过程-JVP 线、梯度上升 FT-unlearning、负偏好优化(Zhang 等,[2024](https://arxiv.org/html/2606.30788#bib.bib40))以及 WMDP/RMU 基础参数代码路径(Li 等,[2024](https://arxiv.org/html/2606.30788#bib.bib16))。RMU 更新选择的基础模型参数而非 LoRA 适配器坐标;行为指标可比,但该行不报告权重空间预言机封闭性。
## 4 理论
未来安全训练会运输记忆方向。本节形式化这种运输,展示侧车族如何恢复反事实的仅安全预言机,并解释为什么二维族与有限尺度下的过程-JVP 线不同。
###### 假设 1(规则固定安全迹)。已实现的 K 步 AdamW 安全训练迹是固定的:小批量、dropout 掩码、优化器超参数、计划和时间种子都是条件化的。在 θ_A 的邻域内,损失函数是 C³ 的,裁剪决策不跨越其非光滑边界,并且活跃坐标上 AdamW 偏置校正的二阶矩保持远离零。
###### 定理 2(过程侧车恒等式)。在假设 1 下,令 T = Train_S 为已实现的安全训练映射...相似文章
状态承诺学习:训练语言模型区分计算与记忆
本文介绍了状态承诺学习,这是一种训练目标,旨在教会语言模型区分临时计算令牌与持久状态令牌。作者提出了反事实擦除强化学习(CERL)和擦除依赖协议,在数学、逻辑、科学问答以及工具使用任务中展示了改进,且未牺牲准确性。
基于 Lean 的过程验证强化学习用于定理证明
本文提出了过程验证强化学习,利用 Lean 证明助手作为过程预言机,在训练期间提供细粒度的策略级反馈,从而提升定理证明性能。
ProcessThinker: 通过基于展开的过程奖励增强多模态大语言模型推理
ProcessThinker 引入了一种实用的后训练流程,无需训练显式的过程奖励模型即可提供步骤级的过程奖励。它利用基于展开的奖励为多模态大语言模型中的多步推理提供密集的信用分配,在视频基准测试上持续提升性能。
模型遗忘目标因语言功能不同而异
本文认为,LLM中的遗忘应依赖于目标,提出了一种基于余弦的元学习RMU变体用于危险知识遗忘,以及一种结合探针方向的多层目标用于毒性遗忘,在四个7-8B模型上取得了显著效果。
你的语言模型就是其自身的评论者:利用演员内部状态进行价值估计的强化学习
本文介绍了 POISE,一种通过利用模型自身内部状态来估计基线,从而在大型推理模型中实现稳定策略优化的方法,与 PPO 和 GRPO 相比,该方法降低了计算开销。