标签
Cascade 是一个用于大语言模型遗忘的分层框架,通过多层控制最小化可恢复性,在保持效用的同时减少中间表示中的残留知识,从而改进了现有方法。
本文介绍了LLM遗忘中的遗忘集错位,并提出了一种名为CONFS的数据无关框架来解决这一问题,实现了遗忘与效用之间的竞争性平衡。
本文将工具介导的恢复识别为LLM遗忘中的一种失败模式,并提出Agentic Tool Unlearning(ATU)以同时减少参数回忆和基于工具的恢复,同时保持正常工具使用。
本文介绍了ConceptGuard,这是一个基准测试,用于评估大型语言模型中使用双重用途概念的上下文敏感遗忘能力,揭示了当前遗忘技术在此实际评估框架下表现不佳。
论文提出了AdaPop,一种基于自适应流行度的大语言模型遗忘方法,它根据事实频率调整梯度压力,以提高遗忘效果并减少查询下的信息泄露。
提出了J-Access,一种使用雅可比透镜的推理时审计方法,用于衡量未学习(unlearned)LLM中残余知识的可访问性,发现可访问性可预测恢复速度,但直接最小化它并不能促进真正的删除。
本综述探讨了面向网络防御的大模型遗忘方法,引入了一个三级框架来区分行为抑制、表示级衰减和真正遗忘,并分析了基于梯度、基于影响和局部编辑的方法。
CBD提出了一种仅通过API的黑盒遗忘框架,用于大语言模型。该框架利用两个辅助模型在保留数据和目标数据之间创建受控行为差异,相比现有方法实现了更优的遗忘-效用权衡。
RepSelect提出了一种稳健的LLM遗忘方法,通过压缩权重梯度的前主成分来隔离遗忘集特定的表示,在多种模型家族上相比现有基线实现了4-50倍更好的对抗重学习攻击的鲁棒性。
论文提出了遗忘深度评分(UDS),这是一种利用激活修补来量化目标知识从大语言模型中被彻底擦除程度的指标,在多种遗忘方法上实现了最先进的忠实度和鲁棒性。
本文介绍了次要分量遗忘(MCU),这是一种针对大语言模型遗忘的新颖方法,通过靶向表征中的次要分量来抵御重学攻击。它通过关注模型谱结构中的鲁棒方向,解决了现有方法的脆弱性问题。