MANCE:流形感知的概念消除

Hugging Face Daily Papers 论文

摘要

MANCE 提出了一种流形感知方法,用于从模型激活中消除性别或安全性等概念,同时最小化对其他概念的附带损害,在119个设置中达到了最先进水平。

概念消除旨在从表示中移除目标概念,同时保留其中编码的其他信息。这很困难,因为表示编码了许多通常与消除目标相关的概念,因此移除目标可能会损害它们。我们提出流形约束假设(MCH):如果自然表示集中在结构化的低维流形上,那么干预措施应约束在该流形上,从而在干预过程中更好地保留表示中编码的其他信息。我们将 MCH 实例化为一种新的概念消除方法:流形感知概念消除(MANCE)。MANCE 使用预测目标概念的分类器信号对表示进行迭代更新。我们通过自然输入获得的表示来估计流形,然后将概念移除更新投影到估计的流形上。我们在涵盖文本和视觉的 119 个设置上进行了广泛评估,包括 13 个语言模型、三个 NLP 概念和 40 个 CelebA-CLIP 属性。在先前方法之上应用 MANCE 显示出一致的改进泄露结果。我们还引入了 MANCE+ 和 MANCE++,它们在采用 MANCE 之前预先添加一个封闭形式的消除算法,相对于匹配的全空间更新,实现了更好的泄露-精确性权衡。我们的最佳方法 MANCE++ 在非线性概念消除上达到了最先进的结果。这些结果支持了消除设置中的 MCH:干预措施应约束在自然表示流形上。
查看原文
查看缓存全文

缓存时间: 2026/07/07 14:44

论文页面 - MANCE:流形感知的概念擦除

来源:https://huggingface.co/papers/2607.03973 摘要:这是目前最强的方法,用于从模型激活中移除概念(如性别、安全性),同时最大程度避免对其他受控概念的附带损伤。

该方法还基于一个巧妙的几何假设:自然输入生成的隐藏状态并非均匀填充整个表征空间。我们假设它们占据了一个由编码器和数据分布塑造的结构化低维区域,并将其建模为流形。

基于此,我们提出了流形约束假设(Manifold Constraint Hypothesis, MCH):在对目标概念产生相同效果的干预中,受流形约束的干预能比无约束干预更好地保留表征中的其他概念。

我们利用从自然输入中获取的切方向,通过局部一阶近似来具体实现这一假设。

在 119 种设置(涵盖多种模型家族、模态和目标概念)中,MANCE++ 不仅在概念擦除上取得了新的最优性能,还在大多数设置中改进了先前的擦除方法。

相似文章

扩散模型的正交概念擦除

arXiv cs.AI

本文介绍了正交概念擦除(OCE),一种通过乘法正交参数更新从扩散模型中精确移除目标概念的方法,能够在数秒内高效擦除单个及多达100个概念。

自模式连通性引导的基于流形表示遗忘的近似机器遗忘

arXiv cs.LG

本文提出 ManiF-SMC,一种完全在表征空间中运行的近似机器遗忘方法,通过将擦除样本从其原始学习的流形表征推向保留数据中其最近的语义邻居,并使用由自模式连通性模块引导的基于边界的三元组损失来实现自适应边界。

SPACE: 无源代理锚点概念擦除用于多模态大语言模型

arXiv cs.LG

本文介绍了SPACE,这是首个面向多模态大语言模型(MLLMs)的无源遗忘框架,它利用文本引导的代理锚点选择和双约束语义隔离来擦除目标概念,无需访问原始训练数据,实现了与依赖数据的方法相当的性能。