RoCo-ACE: 基于Rollout条件的在线蒸馏用于保留感知知识注入
摘要
本文介绍了RoCo-ACE,一种用于多模态大语言模型知识注入的基于Rollout条件的在线蒸馏目标。它在限制未更新行为漂移的同时,提高了注入知识的准确性。
arXiv:2607.24771v1 公告类型: 新
摘要: 知识注入通过新的事实或领域特定知识更新预训练的多模态大语言模型,但拟合完整的权威答案可能导致未更新行为发生漂移。在线蒸馏通过在模型生成的rollout上训练来缓解这种漂移,然而统一的基于参考条件的蒸馏只能提供粗略的监督:它可能低估参考支持的rollout令牌,并且仅间接监督缺失的事实。我们引入了RoCo-ACE,一种用于知识注入的基于Rollout条件的在线蒸馏目标。RoCo利用同rollout的无参考/基于参考条件的似然对比,将额外的蒸馏权重重新分配给参考支持的rollout令牌,而ACE则添加了稀疏的参考侧锚定校正,用于纠正rollout中缺失的权威锚点,而无需进行完整答案模仿。在三种知识注入设置、六个保留基准、多个基线和多个基础模型上,RoCo-ACE在比较方法中实现了最佳注入知识准确性,同时使评估的保留接近基础模型。
查看缓存全文
缓存时间: 2026/07/29 09:51
# RoCo-ACE:基于 Rollout 条件在线蒸馏的保留感知知识注入 **来源**:https://arxiv.org/html/2607.24771 Yan Hong¹,Wei Li¹,Kedong Xiu²,Jun Lan\*,¹,Shuheng Zhou¹,Zhongcai Lyu¹,Huijia Zhu¹,Weiqiang Wang¹,Jianfu Zhang\*,³ ¹蚂蚁集团 ²浙江大学 ³上海交通大学 通讯作者:Jun Lan([[email protected]](https://arxiv.org/html/2607.24771v1/mailto:[email protected])),Jianfu Zhang([[email protected]](https://arxiv.org/html/2607.24771v1/mailto:[email protected])) ###### 摘要 知识注入通过新的事实或领域特定知识更新预训练的 MLLM,但拟合完整的权威答案可能导致未更新行为发生漂移。在线蒸馏通过训练模型生成的 rollouts 来限制这种漂移,然而统一的参考条件蒸馏提供的监督过于粗糙:它可能对参考支持的 rollout token 重视不足,且对遗漏的事实仅提供间接监督。我们提出 **RoCo-ACE**,一种用于知识注入的基于 rollout 条件的在线蒸馏目标:**RoCo** 利用同 rollout 的无参考/参考条件似然对比,为参考支持的 rollout token 重新分配额外的蒸馏权重;**ACE** 则为 rollout 中遗漏的权威锚点添加稀疏的参考端锚点修正,而无需模仿完整答案。在三种知识注入设置、六个保留基准、多个基线和基础模型上的实验表明,RoCo-ACE 在比较方法中取得了最佳的注入知识准确度,同时将评估的保留能力保持在接近基础模型的水平。 ## 1. 引言 多模态大语言模型(MLLM)已从视觉-语言预训练和图像-语言引导(Alayrac et al., 2022 (https://arxiv.org/html/2607.24771#bib.bib2); Li et al., 2023 (https://arxiv.org/html/2607.24771#bib.bib17))发展到指令微调的多模态助手(Dai et al., 2023 (https://arxiv.org/html/2607.24771#bib.bib8); Liu et al., 2023 (https://arxiv.org/html/2607.24771#bib.bib19); Bai et al., 2023 (https://arxiv.org/html/2607.24771#bib.bib3))。当前,它们支持指令遵循、视觉理解、定位、文本丰富图像推理以及安全敏感响应行为(Pi et al., 2024 (https://arxiv.org/html/2607.24771#bib.bib25); Wu et al., 2025 (https://arxiv.org/html/2607.24771#bib.bib35))。部署后,这些模型通常需要吸收新实体、事件、领域事实和视觉世界知识。一项有用的知识注入更新应在提高注入知识准确度的同时,限制未更新的多模态和安全行为的漂移,这一点可通过通用多模态基准(Liu et al., 2024a (https://arxiv.org/html/2607.24771#bib.bib20); Chen et al., 2024 (https://arxiv.org/html/2607.24771#bib.bib7))和安全基准(Liu et al., 2024b (https://arxiv.org/html/2607.24771#bib.bib21))来评估。这一目标颇具挑战性:拟合新数据可能干扰先前学习的行为(Kirkpatrick et al., 2017 (https://arxiv.org/html/2607.24771#bib.bib14); Li and Hoiem, 2016 (https://arxiv.org/html/2607.24771#bib.bib18)),且近期 MLLM 知识注入研究也观察到同样的注入-保留权衡(Jiang et al., 2025a (https://arxiv.org/html/2607.24771#bib.bib12), b (https://arxiv.org/html/2607.24771#bib.bib13))。 参见图注 **图 1**:RoCo-ACE 的动机。上方面板展示了直接拟合、约束更新、在线蒸馏以及我们变体之间的注入-保留权衡。RoCo-ACE 通过结合同 rollout 似然对比与稀疏锚点修正,改善了这一权衡。下方面板显示了一个 EVOKE 示例,其中 RoCo-ACE 相比 SFT 和 SDFT(Shenfeld et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib28))恢复了更多权威锚点,同时保持了基于的响应风格。 现有更新策略在注入-保留权衡空间中占据不同区域。监督微调(SFT)(Ouyang et al., 2022 (https://arxiv.org/html/2607.24771#bib.bib24))直接拟合权威答案,可提高注入知识准确度,但它也鼓励完整答案模仿,包括数据集特定的风格和狭窄的响应模式。约束或参数高效方法通过限制模型可以改变的范围或方式来限制漂移(Hu et al., 2022 (https://arxiv.org/html/2607.24771#bib.bib11); Jiang et al., 2025b (https://arxiv.org/html/2607.24771#bib.bib13); Luo et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib22)),但它们并未直接将监督定位到应改变的事实单元上。关键问题是监督粒度:知识注入通常需要更新少量实体、日期、关系或事件细节,而许多训练 token 反映的是通用措辞、非目标视觉细节或答案风格。如图 1 (https://arxiv.org/html/2607.24771#S1.F1) 所示,面向拟合的方法可能以显著的保留成本提高注入效果,而保守方法虽能更好地限制未更新行为中的漂移,却让一些目标事实注入不足。 为解决这种注入-保留权衡,我们提出 **RoCo-ACE**,一种基于 **R**ollout 条件的对比在线蒸馏目标,结合 **A**nchored **C**ross-**E**ntropy(锚点交叉熵)以实现保留导向的知识注入。它在模型生成的 rollouts 上训练,而非拟合完整的权威答案,从而使更新接近当前模型策略(Agarwal et al., 2023 (https://arxiv.org/html/2607.24771#bib.bib1); Gu et al., 2023 (https://arxiv.org/html/2607.24771#bib.bib9); Shenfeld et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib28); Zhao et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib39); Ye et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib37))。然而,统一的参考条件在线蒸馏仍然缺乏细粒度监督:它可能将梯度分配到通用或非支持的措辞上,无法强调参考支持的 rollout token,并且对当前 rollout 中遗漏的事实仅提供间接监督。我们的关键观察是,一个 On-policy rollout 为事实更新暴露了有用的监督拆分。它可能包含已经 on-policy 到达的受参考支持的内容、通用或非支持的措辞,以及被 rollout 遗漏或弱匹配的权威锚点。**RoCo** 处理 rollout 端信号:通过在同 rollout 前缀下对比无参考和参考条件的教师视图,然后额外分配蒸馏权重给那些在参考条件下似然增加的 token。**ACE** 则通过提取的权威事实上的稀疏锚点交叉熵来补充这一信号,为遗漏或弱匹配的锚点分配更大权重。两者结合,在不将完整参考答案变成行为克隆目标的情况下,注入了稀疏的事实内容。 本文做出以下贡献: - • 我们识别出监督粒度是在线蒸馏用于知识注入的一个关键问题:统一的 rollout 蒸馏可能对参考支持的 token 重视不足,且对当前 rollout 中遗漏的事实仅提供间接训练。 - • 我们提出 RoCo-ACE,一种用于知识注入的基于 rollout 条件的对比在线蒸馏目标。RoCo 利用同 rollout 似然对比为参考支持的 rollout token 重新分配额外蒸馏权重;ACE 则为遗漏或弱匹配的权威锚点添加稀疏锚点修正。 - • 在三种知识注入设置和六个保留基准上的实验表明,RoCo-ACE 在提高注入知识准确度的同时,将评估保留能力保持在接近在线蒸馏基线和基础模型的水平。 ## 2. 相关工作 ### 2.1 用于保留的更新空间约束 注入知识的直接方法是拟合权威答案,但完整答案拟合可能使非目标行为发生偏移。为限制这种更新导致的漂移,先前工作通常约束模型可以改变的范围或方式。Adam-NSCL(Wang et al., 2021 (https://arxiv.org/html/2607.24771#bib.bib33))在特征协方差的零空间更新网络,LoRA-Null(Tang et al., 2025 (https://arxiv.org/html/2607.24771#bib.bib30))将相关思想应用于低秩适配,通过选择更好保留预训练行为的初始化空间。KORE(Jiang et al., 2025b (https://arxiv.org/html/2607.24771#bib.bib13))直接研究多模态知识注入,结合知识导向增强与限制多模态更新漂移的约束。参数高效和遗忘感知方法,包括 LoRA(Hu et al., 2022 (https://arxiv.org/html/2607.24771#bib.bib11))、KeepLoRA(Luo et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib22))、MoELoRA(Luo et al., 2024 (https://arxiv.org/html/2607.24771#bib.bib23))和 SEFE(Chen et al., 2025 (https://arxiv.org/html/2607.24771#bib.bib5)),通过低秩适配器、残差梯度更新、专家化模块或遗忘感知约束来限制或组织可训练参数。相关的 MLLM 持续学习工作,如 MLLM-CL(Zhao et al., 2025 (https://arxiv.org/html/2607.24771#bib.bib38))和 LiLoRA(Che et al., 2025 (https://arxiv.org/html/2607.24771#bib.bib4)),进一步研究了异构任务流上的顺序视觉-指令更新。这些方法主要通过限制可编辑参数或更新空间来实现保留导向。RoCo-ACE 具有互补性:它不是约束更新空间,而是改善 rollout token 和权威锚点上的监督粒度。 ### 2.2 用于模型更新的在线蒸馏 知识蒸馏(Hinton et al., 2015 (https://arxiv.org/html/2607.24771#bib.bib10))将教师分布传递给学生。在线或 On-policy 变体,如广义知识蒸馏(Agarwal et al., 2023 (https://arxiv.org/html/2607.24771#bib.bib1))和 MiniLLM(Gu et al., 2023 (https://arxiv.org/html/2607.24771#bib.bib9)),在学生生成的输出上蒸馏,而非仅固定目标响应,从而使监督接近当前学生策略。近期工作进一步研究了更丰富的教师上下文、推理压缩和策略优化变体(Zhao et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib39); Ye et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib37); Sang et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib27); Yang et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib36); Li et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib16))。Song and Zheng (2026 (https://arxiv.org/html/2607.24771#bib.bib29)) 提供了近期综述。SDFT(Shenfeld et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib28))尤其相关,它使用自蒸馏来稳定持续更新并减少遗忘。 在线蒸馏对知识注入具有吸引力,因为它避免了直接拟合完整的权威答案。然而,统一的参考条件 rollout 蒸馏仍提供粗糙的监督:它可能将梯度花费在通用或非支持的措辞上,对参考支持的 rollout token 重视不足,且对遗漏的权威事实仅提供间接监督。RoCo-ACE 通过结合用于参考支持 rollout token 的同 rollout 似然对比和用于被 rollout 遗漏或弱匹配的权威锚点的稀疏参考端修正,改善了这一粒度。 参见图注 **图 2**:RoCo-ACE 概述。学生采样一个 on-policy rollout,其中混合了通用或非目标视觉跨度、受参考支持的事实跨度以及遗漏的权威锚点。RoCo 在无参考和参考条件教师视图下对同一 rollout 进行打分,然后利用它们的似然对比为受参考支持的 rollout token 分配更大的蒸馏权重。ACE 则为 rollout 遗漏或弱匹配的权威锚点补充稀疏锚点交叉熵这一 rollout 端信号。 ## 3. 方法 ### 3.1 概述 我们考虑一个知识注入数据集 \( \mathcal{D} = \{ (x_i, a_i, I_i) \}_{i=1}^N \),其中 \( x_i \) 是用户提示,\( a_i \) 是指定目标事实更新的权威参考答案,\( I_i \) 是可选的图像。我们的目标是将基础 MLLM \( p_{\theta_0} \) 适应成学生模型 \( p_\theta \),在将注入事实纳入其响应的同时,限制未更新行为的漂移。图 2 (https://arxiv.org/html/2607.24771#S2.F2) 给出了 RoCo-ACE 训练目标的概述。 对于每个示例,学生采样一个 on-policy rollout \( y_i = (y_{i,1}, \dots, y_{i,T_i}) \sim p_\theta(\cdot \mid x_i, I_i) \)。该 rollout 为事实更新暴露了一个监督拆分:它可能包含已经 on-policy 到达的受参考支持的事实跨度、通用或非支持的措辞以及非目标视觉细节,以及被 rollout 遗漏或弱匹配的权威锚点。**RoCo** 处理 rollout 端信号:用无参考和参考条件教师视图对同一个 rollout 前缀进行打分。它利用它们的似然对比为受参考支持的 rollout token 重新分配额外蒸馏权重,而通用措辞和非目标视觉细节则主要接收基础蒸馏信号。**ACE** 通过提取的权威事实上的稀疏锚点交叉熵来处理遗漏情况,为 rollout 遗漏或弱匹配的锚点分配更大权重。两者结合,RoCo 和 ACE 在不将完整参考答案视为 token 级模仿目标的情况下,注入了稀疏的事实内容。 ### 3.2 RoCo:基于 Rollout 条件的对比在线蒸馏 在线蒸馏(Shenfeld et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib28); Zhao et al., 2026 (https://arxiv.org/html/2607.24771#bib.bib39))非常适合保留导向的知识注入,因为它在学生自己的 rollout 上训练,而非拟合完整的权威答案。这使更新接近当前学生策略,但统一的参考条件蒸馏仍对每个有效 rollout token 分配损失,尽管只有一小部分携带目标事实。一个学生 rollout 通常混合了受参考支持的事实内容与通用或非支持的措辞。例如,在图 2 (https://arxiv.org/html/2607.24771#S2.F2) 中,rollout 包含受参考支持的跨度如“Princess Anne”、“hospitalized”和“Gatcombe Park”,但也包含非目标视觉细节如“dark green hat”和“formal coat”。**RoCo** 通过比较同一 rollout 前缀下无参考和参考条件教师似然来解决这个监督粒度问题。它为那些在拥有权威参考时似然增加的 token 重新分配额外的蒸馏权重,而通用措辞、非目标视觉细节和答案风格则主要接收基础蒸馏信号。 为使这种选择性重新分配明确化,RoCo 测量权威参考如何改变每个 on-policy token 在同一 rollout 前缀下的似然值。记 \( q_\phi \) 为...
相似文章
从记忆到吸收:用于持续知识注入的混合策略强化学习
本文提出Golden-GRPO Injection (GRIN),一种用于大语言模型持续知识注入的混合策略强化学习框架,克服了监督微调的局限性。实验表明,在知识吸收基准上表现卓越。
ReAD:面向大型语言模型的强化引导能力蒸馏
本文提出了 ReAD,这是一种强化引导的能力蒸馏框架,通过考虑大型语言模型中的跨能力迁移来优化 token 预算。与现有基线相比,该方法在提升下游效用的同时,减少了有害溢出。
KItCAT:基于输入损坏的自回归训练知识注入方法
KItCAT 介绍了一种轻量级的自回归大型语言模型训练策略,该策略通过输入损坏生成多样化的训练输入,无需昂贵的改写即可改善从专业文档的知识注入。
MixSD:混合上下文自蒸馏知识注入
MixSD 提出了一种面向语言模型知识注入的自蒸馏方法,该方法将监督信号与模型自身的原生分布对齐,从而减少微调过程中的灾难性遗忘。它能够实现近乎完美的记忆,同时保留高达 100% 的基础能力,远超标准 SFT。
通过自适应互惠知识蒸馏发现和保持类别相关知识
本文提出自适应互惠知识蒸馏(AR-KD),这是一种新方法,通过关系对齐简化教师模型的输出分布,从而改善从教师到学生的知识传递,在CIFAR-100和ImageNet-1k数据集上实现了高达7.13%的准确率提升。