llm-unlearning

标签

Cards List
#llm-unlearning

Cascade:大语言模型遗忘的分层可恢复性控制

arXiv cs.CL ↗ · 2026-09-16 缓存

Cascade 是一个用于大语言模型遗忘的分层框架,通过多层控制最小化可恢复性,在保持效用的同时减少中间表示中的残留知识,从而改进了现有方法。

0 人收藏 0 人点赞
#llm-unlearning

揭示模型知识:LLM遗忘中的遗忘集与模型知识的错位

arXiv cs.LG ↗ · 2026-09-02 缓存

本文介绍了LLM遗忘中的遗忘集错位,并提出了一种名为CONFS的数据无关框架来解决这一问题,实现了遗忘与效用之间的竞争性平衡。

0 人收藏 0 人点赞
#llm-unlearning

权重遗忘,工具恢复:LLM智能体的Agentic Tool Unlearning (ATU)

arXiv cs.CL ↗ · 2026-08-25 缓存

本文将工具介导的恢复识别为LLM遗忘中的一种失败模式,并提出Agentic Tool Unlearning(ATU)以同时减少参数回忆和基于工具的恢复,同时保持正常工具使用。

0 人收藏 0 人点赞
#llm-unlearning

ConceptGuard:大型语言模型中上下文敏感遗忘的基准测试

arXiv cs.CL ↗ · 2026-08-21 缓存

本文介绍了ConceptGuard,这是一个基准测试,用于评估大型语言模型中使用双重用途概念的上下文敏感遗忘能力,揭示了当前遗忘技术在此实际评估框架下表现不佳。

0 人收藏 0 人点赞
#llm-unlearning

越流行越难遗忘:基于自适应流行度的大语言模型遗忘方法

arXiv cs.CL ↗ · 2026-08-17 缓存

论文提出了AdaPop,一种基于自适应流行度的大语言模型遗忘方法,它根据事实频率调整梯度压力,以提高遗忘效果并减少查询下的信息泄露。

0 人收藏 0 人点赞
#llm-unlearning

衡量而非优化:预测LLM遗忘中的恢复

arXiv cs.CL ↗ · 2026-08-13 缓存

提出了J-Access,一种使用雅可比透镜的推理时审计方法,用于衡量未学习(unlearned)LLM中残余知识的可访问性,发现可访问性可预测恢复速度,但直接最小化它并不能促进真正的删除。

0 人收藏 0 人点赞
#llm-unlearning

面向网络防御的大模型遗忘:方法、挑战与新兴威胁综述

arXiv cs.LG ↗ · 2026-07-21 缓存

本综述探讨了面向网络防御的大模型遗忘方法,引入了一个三级框架来区分行为抑制、表示级衰减和真正遗忘,并分析了基于梯度、基于影响和局部编辑的方法。

0 人收藏 0 人点赞
#llm-unlearning

CBD:通过受控行为差异实现仅API的LLM黑盒遗忘

arXiv cs.LG ↗ · 2026-06-29 缓存

CBD提出了一种仅通过API的黑盒遗忘框架,用于大语言模型。该框架利用两个辅助模型在保留数据和目标数据之间创建受控行为差异,相比现有方法实现了更优的遗忘-效用权衡。

0 人收藏 0 人点赞
#llm-unlearning

RepSelect:通过表示选择性实现稳健的LLM遗忘

arXiv cs.CL ↗ · 2026-06-17 缓存

RepSelect提出了一种稳健的LLM遗忘方法,通过压缩权重梯度的前主成分来隔离遗忘集特定的表示,在多种模型家族上相比现有基线实现了4-50倍更好的对抗重学习攻击的鲁棒性。

0 人收藏 0 人点赞
#llm-unlearning

通过激活修补测量大语言模型遗忘深度

arXiv cs.CL ↗ · 2026-05-26 缓存

论文提出了遗忘深度评分(UDS),这是一种利用激活修补来量化目标知识从大语言模型中被彻底擦除程度的指标,在多种遗忘方法上实现了最先进的忠实度和鲁棒性。

0 人收藏 0 人点赞
#llm-unlearning

抵御重学攻击的鲁棒大语言模型遗忘:表征中的次要分量至关重要

arXiv cs.CL ↗ · 2026-05-13 缓存

本文介绍了次要分量遗忘(MCU),这是一种针对大语言模型遗忘的新颖方法,通过靶向表征中的次要分量来抵御重学攻击。它通过关注模型谱结构中的鲁棒方向,解决了现有方法的脆弱性问题。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈