在遗忘中应忘记什么?语言模型的遗忘集策划
摘要
本文探讨了语言模型中机器遗忘的遗忘集策划,引入了一个评估逐字输出抑制的基准,并强调了效果与能力保留之间的权衡。
arXiv:2608.14855v1 公告类型:新
摘要:机器遗忘旨在从训练好的模型中移除目标数据或行为,而无需从头重新训练。然而,大多数评估假设要遗忘的示例是已知的。在现实的语言模型部署中,请求者可能要求模型停止再现一首歌或一本书,而不知道万亿令牌语料库中哪些片段、文档、引文或近似副本支持该行为。我们研究了这个缺失的上游问题,即遗忘集策划:将抑制请求映射到传递给遗忘算法的数据。我们介绍了CleanSlate,这是一个针对歌曲和书的逐字输出抑制基准,具有模型特定的提取配置文件、基于内容的问答和能力保留评估。CleanSlate揭示了两种失败模式。自然词汇和精确子串策划者通常产生导致弱抑制的遗忘集。评估感知策划者几乎完全抑制请求的延续,但会导致对非请求内容的附带回归和依赖于模型的能力损失。这些结果表明,实际的遗忘不仅是一个给定遗忘集后的优化问题:选择遗忘的数据决定了可以遗忘什么以及还会损害什么。
查看缓存全文
缓存时间: 2026/08/18 09:53
# 语言模型去学习中应遗忘什么?遗忘集策展研究 来源:https://arxiv.org/html/2608.14855 Arpandeep Khatua 斯坦福大学 [email protected] Youssef Allouah 斯坦福大学 [email protected] Sanmi Koyejo 斯坦福大学 [email protected] ###### 摘要 机器去学习旨在无需从头重新训练即可从已训练模型中移除特定数据或行为。然而,大多数评估假设待遗忘的示例已知。在实际语言模型部署中,请求方可能要求模型停止复现某首歌曲或书籍内容,但并不清楚万亿词元语料库中哪些片段、文档、引文或近似重复文本支撑了该行为。我们研究这一缺失的上游问题——**遗忘集策展**:将抑制请求映射到传递给去学习算法的数据。我们提出 **CleanSlate** 基准测试,针对歌曲和书籍的逐字输出抑制进行评估,包含特定模型的提取分析、基于内容的问答及能力保留测试。**CleanSlate** 揭示了两种失败模式:自然词汇匹配与精确子串匹配的策展方法通常导致弱抑制效果;而评估感知型策展器几乎完全抑制请求的连续输出,却会引发非请求内容的连带退化及依赖模型的能力损失。这些结果表明,实际去学习不仅是给定遗忘集后的优化问题:被选为遗忘的数据既决定了可遗忘的内容,也影响了其他未损害的能力。 ††脚注文本:*共同贡献,按字母序排列。†共同指导,按字母序排列。 ### 1 引言 机器去学习旨在无需从头重新训练即可从已训练模型中移除特定数据或行为 [14, 36]。对于语言模型,这一目标在隐私、安全和版权场景中日益重要,模型所有者可能被要求抑制特定输出或移除特定数据的影响。然而,大多数去学习方法与基准测试仅在关键输入(即遗忘集——用于驱动更新的示例)提供后才研究该问题 [24, 31, 18, 9]。实际请求可能并非以此形式提出:请求方可能要求模型停止复现某歌曲、书籍或其他受保护作品,但去学习算法需要具体的文本片段或文档作为优化目标。这一差距导致了一个缺失的上游问题:应如何将抑制请求映射到用于去学习的数据?我们将此步骤称为**遗忘集策展**:从抑制请求中选取传递给去学习算法的干预数据。 我们聚焦于文化嵌入式作品(如歌曲和书籍)的逐字输出抑制。这比概念去学习范围更窄:抑制一部作品不应要求删除其作者、情节、类型或文化背景。期望行为是选择性的:受保护的连续输出应难以被触发,而关于作品的事实知识及相关能力应保持完整。我们通过概率提取方法验证此目标:测试模型在给定前缀条件下对精确后缀分配的高概率 [15, 7]。因此,去学习后,目标连续输出应无法提取,同时不损害非请求内容的可提取性或基于内容的问答与通用能力。 歌曲和书籍揭示了遗忘集策展的困难。尽管作品可能有规范文本,但支撑模型连续输出的证据很少局限于该来源。如图1所示,歌词和段落可能通过复制、引文、评论、粉丝论坛、新闻文章、代码片段、合成示例及偶然讨论分布于训练语料库中。因此,相关对象是作品的**语料库足迹**:可能支撑目标连续输出的片段与文档的分布式集合。策展人需恢复足够覆盖该足迹的数据以抑制请求行为,同时避免过度损害非请求内容或通用能力。精确匹配有助于发现该足迹,但无法完全覆盖,因为即使训练数据中已移除精确 n-gram 匹配,模型仍可逐字完成文本 [22]。 [图1说明]歌曲与书籍的足迹远超其规范文本。上图展示《Never Gonna Give You Up》的规范歌词来源;周围面板显示非规范来源:GitHub 存储歌词的 Python 文件、将歌词融入快闪新闻报道的《巴尔的摩太阳报》文章、用歌词作为填充文本的 Stack Overflow 回答、在三明治食评中插入副歌的《LEO Weekly》文章,以及将歌词改写为约会建议的“搭讪台词”网站。 **贡献**。我们研究语言模型去学习的**遗忘集策展**问题:给定抑制请求和已训练模型,选择应传递给去学习算法的数据。该框架将请求到数据的问题与下游模型更新问题分离,可评估提议的遗忘集是否实际诱发选择性抑制。为此,我们提出 **CleanSlate** 基准与评估协议,包含 1970–2025 年《公告牌百强单曲榜》的 4,616 首歌曲和 50 本书籍,并提供针对 7B–32B 参数模型的逐模型提取分析。我们还添加了基于内容的问答对,以区分逐字复现的抑制与作品事实知识的消除。该基准评估完整流程:策展人接收抑制请求后返回干预数据,固定去学习算法更新模型,评估结果模型的目标抑制、连带抑制、内容问答保留与通用能力保留。 主要发现如下: 1. **文化作品具有分散的语料库足迹**。歌曲和书籍不仅通过规范文本呈现:较早作品通过引文、评论、代码、粉丝论坛、新闻及偶然引用传播;较新作品也通过成语、类型模板、公有领域引文及重复短语继承早期语言。因此,支撑目标连续输出的证据可能早于作品本身出现,或存在于非复制类来源中。 2. **策展人与去学习器强烈交互**。相同的检索衍生遗忘集根据去学习器和模型的不同,可能产生接近零或完全的抑制效果;在测试网格中,强抑制总是伴随显著的连带抑制。 3. **评估感知型策展揭示选择性缺口**。当跳过检索直接选择评估窗口时,去学习可几乎完全抑制请求的连续输出,但也会导致显著的模型依赖型能力退化并抑制非请求内容。因此,即使在逐字输出抑制中,识别目标文本不等同于构建干净的遗忘集。 这些结果表明,遗忘集不应仅作为语言模型去学习的前提,而应作为评估对象之一。被选择遗忘的内容不仅决定请求行为是否被抑制,也影响相邻能力与通用能力的扰动程度。我们认为实际去学习应研究为从请求到策展遗忘集再到编辑模型的完整流程。 ### 2 相关工作 ##### 记忆化与逐字提取 语言模型记忆化通常通过提取研究:用前缀提示模型并测试其是否复现目标后缀 [5, 4, 1]。[15] 将其细化为概率可发现提取,衡量目标连续输出是否可通过重复采样生成。[7] 将此框架应用于版权书籍,显示可提取性在不同作品与模型家族间差异显著。我们采用此类完成式记忆化概念作为逐字输出抑制的代理指标——目标并非推断训练成员身份或消除所有作品知识,而是使请求的连续输出难以触发,同时保留相近知识与无关能力。 ##### 机器去学习基准 机器去学习旨在无需从头重新训练即可移除已训练模型中指定数据或行为的影响 [14, 36]。语言模型领域已提出多种方法,包括损失上升、基于偏好的目标、logit 调整及表征级干预 [37, 18, 11, 8]。现有基准评估此类更新是否在保留效用的同时抑制目标信息,包括 TOFU 的合成传记 [24]、MUSE 的多轴评估 [31]、WMDP 的危险知识去学习 [18] 及 OpenUnlearning 的统一评估 [9]。这些基准在领域和目标上各有不同,但通常提供待遗忘的示例、实体或评估目标。相反,我们研究上游策展问题:给定作品的抑制请求,应为去学习更新选择哪些数据? ##### 数据选择、检索与归因 近期工作表明,即使遗忘数据已指定,遗忘集的内容仍至关重要:小规模子集或 token 级选择可显著改变抑制-保留权衡 [26, 33, 38, 2, 23]。这推动了选择本身的研究,但先前工作大多假设不良示例或目标领域已知。请求级策展的自然方法是通过词汇搜索或精确子串系统(如 BM25、Infini-gram 与 Infini-gram-mini)检索与目标作品重叠的文本 [20, 35]。然而,文本重叠仅为模型连续输出相关数据的不完美代理:即使训练数据中已移除精确 n-gram 匹配,模型仍可逐字完成文本 [22]。影响函数与数据建模提供了训练样本责任的更因果视角 [17, 16, 10, 13],但将其应用于万亿词料库的请求级策展仍是开放挑战。 ### 3 问题表述:遗忘集策展 设 θ 为预训练语言模型,𝒲 为歌曲或书籍等作品集合。抑制请求识别目标子集 𝒲_f ⊂ 𝒲,其逐字复现应被抑制。而 𝒲_r = 𝒲 \ 𝒲_f 中任何作品的可能逐字复现应被保留。 ##### 可提取性 我们通过概率提取量化逐字复现 [15, 7]。作品被划分为前缀-后缀窗口对 (x, z) 的序列。对于给定前缀 x,模型分配概率 p_z = p_θ(z|x) = ∏_{t=1}^{|z|} p_θ(z_t|x, z_{<t})。我们通过多次采样估计可提取性:对每个窗口 (x, z) 采样 k 次,检查输出是否包含 z 或其超串。可提取性定义为命中次数除以总采样数。 ##### 抑制与保留指标 目标抑制率衡量 𝒲_f 中窗口的可提取性降低程度,计算为去学习前后平均对数概率下降百分比。连带抑制率衡量 𝒲_r 中窗口的非预期可提取性下降。内容保留率评估基于 𝒲 事实知识的问答性能变化。能力保留率通过通用基准测试评估模型一般能力退化程度。 ##### CleanSlate 基准 CleanSlate 包含 4,616 首 Billboard Hot 100 歌曲与 50 本书籍,提供逐模型提取分析、内容问答对及多维度评估。策展方法包括: 1. **精确匹配策展**:基于 n-gram 重叠检索训练语料库中相关片段。 2. **语义检索策展**:使用嵌入相似性匹配语义相关片段。 3. **评估感知策展**:直接选取评估中使用的前缀-后缀窗口。 实验表明,评估感知策展可几乎完全抑制目标,但引发显著连带抑制与能力退化;精确匹配策展抑制较弱但更稳健;语义检索策展在选择性上优于精确匹配。 ### 4 结果与分析 ##### 足迹扩散与策展困难 图2展示歌曲《Smile》在语料库中的足迹分布:其规范歌词仅占小部分,更多足迹存在于评论、改编、新闻及社交媒体中。图3显示《1984》书籍的类似现象:规范文本仅覆盖少量 n-gram,而讨论、引用与分析构成主要足迹。这表明策展需平衡覆盖度与精准度。 ##### 策展方法对比 表1总结不同策展方法在 CleanSlate 上的表现:评估感知策展的目标抑制率达 98.2%,但连带抑制率高达 45.7%;精确匹配(n=5)目标抑制率为 63.4%,连带抑制率为 12.1%;语义检索目标抑制率为 71.8%,连带抑制率为 18.3%。内容保留率与能力保留率在评估感知策展中最低(分别为 81.5% 与 88.2%),而精确匹配最高(94.3% 与 96.7%)。 ##### 模型依赖性与规模影响 图4显示不同模型规模(7B–32B)下策展效果差异:大模型对评估感知策展更敏感,抑制更强但连带损害也更显著;小模型对精确匹配更鲁棒。表2显示去学习算法(如梯度上升、DPO)与策展方法的交互:梯度上升在精确匹配下抑制较弱,但在评估感知下过拟合严重;DPO 在各类策展下表现更均衡。 ##### 选择性困境 图5揭示抑制与保留的权衡曲线:理想策展应接近右上角(高抑制、高保留),但实际方法均存在 trade-off。评估感知策展位于曲线右端(高抑制、低保留),精确匹配位于左端(低抑制、高保留),而语义检索在中部取得更好平衡。 ### 5 讨论 #### 5.1 策展作为核心挑战 遗忘集策展不仅是预处理步骤,更是决定去学习效果的关键。现有工作大多假设遗忘集已知,而实际请求需从自然语言请求映射到数据。本文提出 CleanSlate 基准与系统评估,揭示策展方法选择对结果的决定性影响。 #### 5.2 未来方向 1. **动态策展**:开发可随请求变化自适应调整的策展算法。 2. **多模态扩展**:将策展方法扩展到图像、音频等模态的去学习。 3. **因果归因**:结合影响函数或因果推断改进策展精准度。 4. **法律与伦理框架**:建立策展方法与版权、隐私法规的合规性评估。 ### 6 结论 本文证明遗忘集策展是语言模型去学习的核心未解决问题。通过引入 CleanSlate 基准与系统评估,我们揭示了不同策展方法在抑制效果、连带损害与能力保留间的权衡。实际去学习应视为从请求到策展再到模型更新的完整流程,而非孤立优化问题。未来工作需进一步研究智能策展算法与评估标准,以实现选择性、安全且高效的去学习。 **附录:补充实验** #### A.1 语料库构建细节 CleanSlate 语料库包含三个层级: 1. **核心层(𝒞_core)**:目标作品规范文本。 2. **中间层(𝒞_mid)**:公开网页、论坛、新闻等。 3. **扩展层(𝒞_ext)**:合成数据、低质量抓取内容。 #### A.2 提取评估协议 每个作品划分为 128 词元窗口,步长为 64 词元。每个前缀采样 20 次,温度为 0.8。可提取性阈值设为 0.5(即 10 次中 5 次命中)。 #### A.3 足迹密度分析 图6显示足迹密度与提取概率的相关性:在语料库高频出现的位置,提取概率显著升高。这证实了语料库重复暴露是记忆化的主要驱动因素。 #### A.4 退化分析 图7展示能力退化谱:代码生成、数学推理等任务受影响最大,而简单事实问答较稳健。这表明去学习可能干扰模型的结构化知识表示。 **参考文献**(保持原链接与编号) [1] Carlini et al. (2021) [2] Chen et al. (2023) [3] ...(共 38 条参考文献)
相似文章
ForgetBench:语言模型中长期参数记忆遗忘动态的基准测试
ForgetBench 引入了一个基准测试,用于系统地表征大型语言模型在持续知识编辑下的遗忘行为,通过基于概念和场景的问答来衡量时间衰减和保留动态。
窄域遗忘,广域保留:作为非对称泛化问题的机器遗忘
本文将大型语言模型中的机器遗忘界定为一个非对称泛化问题,提出了SUITE评估协议与训练语料库以解决遗忘不足与过度遗忘问题,并介绍了JensUn++算法,该算法在三个大型语言模型上实现了最佳的遗忘-保留效用权衡。
已删除,但未消失:输出遗忘并非真正遗忘
本文认为,标准的输出层机器遗忘评估高估了成功程度,表明方法可以在输出层看似成功,同时保留与重新训练模型相关的结构性表征层差异。作者提出与重新训练一致的表征遗忘作为更强的评估视角。
模型遗忘目标因语言功能不同而异
本文认为,LLM中的遗忘应依赖于目标,提出了一种基于余弦的元学习RMU变体用于危险知识遗忘,以及一种结合探针方向的多层目标用于毒性遗忘,在四个7-8B模型上取得了显著效果。
PreUnlearn:在大语言模型遗忘前审计附带知识损害
本文提出了PreUnlearn,一个在LLM遗忘执行前审计附带知识损害的框架,采用以数据为中心的分析来预测跨语义层的下游损害。