MANCE:流形感知的概念消除
摘要
MANCE 提出了一种流形感知方法,用于从模型激活中消除性别或安全性等概念,同时最小化对其他概念的附带损害,在119个设置中达到了最先进水平。
查看缓存全文
缓存时间: 2026/07/07 14:44
论文页面 - MANCE:流形感知的概念擦除
来源:https://huggingface.co/papers/2607.03973 摘要:这是目前最强的方法,用于从模型激活中移除概念(如性别、安全性),同时最大程度避免对其他受控概念的附带损伤。
该方法还基于一个巧妙的几何假设:自然输入生成的隐藏状态并非均匀填充整个表征空间。我们假设它们占据了一个由编码器和数据分布塑造的结构化低维区域,并将其建模为流形。
基于此,我们提出了流形约束假设(Manifold Constraint Hypothesis, MCH):在对目标概念产生相同效果的干预中,受流形约束的干预能比无约束干预更好地保留表征中的其他概念。
我们利用从自然输入中获取的切方向,通过局部一阶近似来具体实现这一假设。
在 119 种设置(涵盖多种模型家族、模态和目标概念)中,MANCE++ 不仅在概念擦除上取得了新的最优性能,还在大多数设置中改进了先前的擦除方法。
相似文章
扩散模型的正交概念擦除
本文介绍了正交概念擦除(OCE),一种通过乘法正交参数更新从扩散模型中精确移除目标概念的方法,能够在数秒内高效擦除单个及多达100个概念。
自模式连通性引导的基于流形表示遗忘的近似机器遗忘
本文提出 ManiF-SMC,一种完全在表征空间中运行的近似机器遗忘方法,通过将擦除样本从其原始学习的流形表征推向保留数据中其最近的语义邻居,并使用由自模式连通性模块引导的基于边界的三元组损失来实现自适应边界。
SPACE: 无源代理锚点概念擦除用于多模态大语言模型
本文介绍了SPACE,这是首个面向多模态大语言模型(MLLMs)的无源遗忘框架,它利用文本引导的代理锚点选择和双约束语义隔离来擦除目标概念,无需访问原始训练数据,实现了与依赖数据的方法相当的性能。
缓解流形偏离:面向可信MLLM解码的不确定性感知子空间矫正
本文介绍了MGAP,一种无需训练的解码方法,通过自适应地仅抑制语言先验中的有害部分,同时保留模型的语义流形,从而减少多模态大语言模型中的幻觉。该方法在POPE和CHAIR基准测试上优于先前的基线方法。
ConceptGuard:大型语言模型中上下文敏感遗忘的基准测试
本文介绍了ConceptGuard,这是一个基准测试,用于评估大型语言模型中使用双重用途概念的上下文敏感遗忘能力,揭示了当前遗忘技术在此实际评估框架下表现不佳。