抗泄漏机器遗忘:评估多跳推理一致性与恢复鲁棒性的新基准
摘要
本文介绍了一个用于评估机器遗忘的新基准,重点关注多跳推理一致性和恢复鲁棒性。实验表明,现有遗忘方法在遗忘质量、鲁棒性和效用保持之间面临“不可能三角”的权衡。
arXiv:2608.04519v1 公告类型:新
摘要:对机器遗忘方法进行基准测试对于理解敏感知识是否从大型语言模型(LLM)中移除至关重要。目前的遗忘基准主要包含单跳问题和少量多跳问题。尽管有效,它们仍面临两个挑战。(1)知识并非孤立存在,因此与普通查询相比,多样的多跳推理路径可能更容易导致知识泄漏。(2)遗忘可能是脆弱的:被遗忘的知识可以通过恢复攻击(如遗忘后的轻量级自适应)部分恢复,这使得静态评估不够充分。因此,在本文中,我们引入了 \unlearning 作为一个新基准,用于理解跨多样推理路径和恢复攻击的鲁棒LLM知识移除。我们使用该基准在3个模型、6种遗忘方法和2个精心整理的数据集上进行了实验。结果表明,现有方法容易受到多跳推理路径和恢复攻击的影响。我们进一步探讨了LLM遗忘中遗忘质量、鲁棒性和模型效用之间的权衡。
查看缓存全文
缓存时间: 2026/08/06 07:42
# 防泄漏遗忘:评估多跳推理一致性与恢复鲁棒性的新基准 来源:https://arxiv.org/html/2608.04519 **发现2:** 被遗忘的知识仍然可以被现有攻击恢复,且多跳查询往往比单跳查询更容易恢复。 ### 6.3 遗忘质量、鲁棒性与实用性之间的经验性权衡 参见图4(https://arxiv.org/html/2608.04519#S6.F4)的说明: 图4:机器遗忘的“理想三角形”,表明现有遗忘方法无法在保持模型实用性的同时实现防泄漏遗忘。第一行子图为 MQuAKE 上的结果,第二行子图为 Books 上的结果。 图4(https://arxiv.org/html/2608.04519#S6.F4)使用雷达图展示了6种遗忘方法在三个维度上的表现。每个顶点代表一个基准维度:遗忘质量、鲁棒性(以 1−max(RR) 度量)以及实用性保持。越靠近外边界表示性能越好。理想的遗忘方法应呈现为触及所有三条外边的大三角形(即在三个指标上均达到最大化)。我们的实验结果揭示了一种经验性权衡:没有任何算法接近理想的“外三角形”。相反,所有方法都被限制在一个小得多的可行区域内,形成了“不可能三角”——在某一维度上的提升总是以其他维度的损失为代价。 具体而言,该基准揭示了不同算法方法之间截然不同的性能模式。以 Llama-3.1-8B-Instruct 在 MQuAKE 上的结果为例,PALU 取得了最佳的遗忘性能(93.0%的遗忘质量)和对恢复攻击的强鲁棒性(87.1%),但这带来了高昂的代价:它严重损害了模型的通用能力,将 BBH 性能降至原始模型的一半(49.9%)。与之相对,RMU 几乎完美地保持了模型实用性(99.2%),但在核心任务上表现糟糕:它未能有效移除目标知识,并且对恢复方法高度脆弱。TV 则介于这两个极端之间,提供了更平衡的方案,但仍无法实现强遗忘、鲁棒防御和实用性保持的理想组合。 重要的是,类似的权衡出现在不同模型家族和规模中。无论使用哪种模型,也无论我们测试哪个基准,都没有方法能同时实现所有三个目标。这表明所观察到的权衡可能并非特定模型架构或规模的人为产物。这些结果也凸显了使用单一指标评估遗忘的局限性。遗忘质量高的方法如果被移除的知识可以被恢复,仍然可能不足;而保持实用性的方法如果目标知识仍可通过多跳推理访问,也不能被视为成功。一个完整的基准需要同时考虑遗忘性、鲁棒性和实用性。 **发现3:** 在保持推理能力的同时实现防泄漏遗忘是困难的。 ## 7 结论 在本文中,我们引入了一个新的基准——Leak-Resistant Unlearning,它不仅评估直接查询和有限的多跳问题,还评估被遗忘的知识是否仍潜伏在模型中。通过对多样化推理路径和恢复攻击的测试,我们发现当前的遗忘方法存在局限性:被遗忘的知识可以通过替代推理结构泄漏,并且这类知识往往很容易被恢复,有时甚至比单跳知识更容易通过多跳方式恢复。总体而言,现有方法仍然难以在遗忘质量、鲁棒性和保持通用实用性之间取得平衡。 ## 8 局限性 **基于LLM的数据构建。** 我们的流程依赖LLM进行知识提取、多跳问题生成、推理分解和语义判断。尽管我们应用了严格的过滤步骤,这些由LLM驱动的过程仍可能引入微妙的噪声、人为捷径或基准偏差。具体来说,依赖“LLM作为裁判”的范式容易受到已知失败模式的影响,并且可能并不总能与细致入微的人工评估完全一致。 **有限的实验范围。** 我们的实证评估覆盖了3个具有代表性的LLM、6种遗忘算法、3种恢复方法和2种基准设置。此外,我们对参数级操作的依赖使得该评估仅限于开放权重架构,而黑盒商业API(例如GPT-4)的遗忘动态未能得到解决。虽然这提供了相当广泛的基础,但仍无法穷尽快速扩展的新型模型架构、遗忘框架和复杂的对抗攻击空间。因此,我们的结论应被理解为对一般趋势的有力证据,而非确定性的普遍主张。 **聚焦事实性知识。** 我们的基准针对显式事实性知识及其相关推理结构的遗忘而设计。其他遗忘维度,如擦除涉及隐私的记忆、受版权保护的文本片段或隐含有害行为,仍然表现出不同的表示机制,并且严格超出本研究的范围。 **语言范围限制。** 我们的基准数据集和评估协议主要以英语构建。由于先前文献表明LLM天生具有强大的跨语言迁移能力,在当前的评估框架中,被遗忘的事实性知识是否仍可能通过跨语言多跳查询(例如,提示模型使用英语以外的语言进行推理)泄漏,仍是一个关键但未充分探索的维度。 ## 9 伦理声明 本工作遵循ACL伦理政策。我们研究的是LLM的遗忘问题。我们使用的数据来自开源许可下的公共遗忘基准。 ## 参考文献 - Rwku: benchmarking real-world knowledge unlearning for large language models. *Advances in Neural Information Processing Systems* 37, pp. 98213–98263. 被引用:第4项 (https://arxiv.org/html/2608.04519#A2.I1.i4.p1.1), §2.1 (https://arxiv.org/html/2608.04519#S2.SS1.p3.1)。 - M. Choi, C. Park, D. Lee, and J. Choo (2024) Breaking chains: unraveling the links in multi-hop knowledge unlearning. *arXiv preprint arXiv:2410.13274*。 被引用:§2.1 (https://arxiv.org/html/2608.04519#S2.SS1.p3.1)。 - C. Dahal, A. Balasubramaniam, and Z. Xiong (2026) GONE: structural knowledge unlearning via neighborhood-expanded distribution shaping. 外部链接:2603.12275, 链接 (https://arxiv.org/abs/2603.12275) 被引用:第7项 (https://arxiv.org/html/2608.04519#A2.I1.i7.p1.1), §2.1 (https://arxiv.org/html/2608.04519#S2.SS1.p3.1)。 - A. Grattafiori, A. Dubey, A. Jauhri, A. Pandey, A. Kadian, A. Al-Dahle, A. Letman, A. Mathur, A. Schelten, A. Vaughan, A. Yang, A. Fan, A. Goyal, A. Hartshorn, A. Yang, A. Mitra, A. Sravankumar, A. Korenev, A. Hinsvark, A. Rao, A. Zhang, A. Rodriguez, A. Gregerson, A. Spataru, B. Roziere, B. Biron, B. Tang, B. Chern, C. Caucheteux, C. Nayak, C. Bi, C. Marra, C. McConnell, C. Keller, C. Touret, C. Wu, C. Wong, C. C. Ferrer, C. Nikolaidis, D. Allonsius, D. Song, D. Pintz, D. Livshits, D. Wyatt, D. Esiobu, D. Choudhary, D. Mahajan, D. Garcia-Olano, D. Perino, D. Hupkes, E. Lakomkin, E. AlBadawy, E. Lobanova, E. Dinan, E. M. Smith, F. Radenovic, F. Guzmán, F. Zhang, G. Synnaeve, G. Lee, G. L. Anderson, G. Thattai, G. Nail, G. Mialon, G. Pang, G. Cucurell, H. Nguyen, H. Korevaar, H. Xu, H. Touvron, I. Zarov, I. A. Ibarra, I. Kloumann, I. Misra, I. Evtimov, J. Zhang, J. Copet, J. Lee, J. Geffert, J. Vranes, J. Park, J. Mahadeokar, J. Shah, J. van der Linde, J. Billock, J. Hong, J. Lee, J. Fu, J. Chi, J. Huang, J. Liu, J. Wang, J. Yu, J. Bitton, J. Spisak, J. Park, J. Rocca, J. Johnstun, J. Saxe, J. Jia, K. V. Alwala, K. Prasad, K. Upasani, K. Plawiak, K. Li, K. Heafield, K. Stone, K. El-Arini, K. Iyer, K. Malik, K. Chiu, K. Bhalla, K. Lakhotia, L. Rantala-Yeary, L. van der Maaten, L. Chen, L. Tan, L. Jenkins, L. Martin, L. Madaan, L. Malo, L. Blecher, L. Landzaat, L. de Oliveira, M. Muzzi, M. Pasupuleti, M. Singh, M. Paluri, M. Kardas, M. Tsimpoukelli, M. Oldham, M. Rita, M. Pavlova, M. Kambadur, M. Lewis, M. Si, M. K. Singh, M. Hassan, N. Goyal, N. Torabi, N. Bashlykov, N. Bogoychev, N. Chatterji, N. Zhang, O. Duchenne, O. Çelebi, P. Alrassy, P. Zhang, P. Li, P. Vasic, P. Weng, P. Bhargava, P. Dubal, P. Krishnan, P. S. Koura, P. Xu, Q. He, Q. Dong, R. Srinivasan, R. Ganapathy, R. Calderer, R. S. Cabral, R. Stojnic, R. Raileanu, R. Maheswari, R. Girdhar, R. Patel, R. Sauvestre, R. Polidoro, R. Sumbaly, R. Taylor, R. Silva, R. Hou, R. Wang, S. Hosseini, S. Chennabasappa, S. Singh, S. Bell, S. S. Kim, S. Edunov, S. Nie, S. Narang, S. Raparthy, S. Shen, S. Wan, S. Bhosale, S. Zhang, S. Vandenhende, S. Batra, S. Whitman, S. Sootla, S. Collot, S. Gururangan, S. Borodinsky, T. Herman, T. Fowler, T. Sheasha, T. Georgiou, T. Scialom, T. Speckbacher, T. Mihaylov, T. Xiao, U. Karn, V. Goswami, V. Gupta, V. Ramanathan, V. Kerkez, V. Gonguet, V. Do, V. Vogeti, V. Albiero, V. Petrovic, W. Chu, W. Xiong, W. Fu, W. Meers, X. Martinet, X. Wang, X. Wang, X. E. Tan, X. Xia, X. Xie, X. Jia, X. Wang, Y. Goldschlag, Y. Gaur, Y. Babaei, Y. Wen, Y. Song, Y. Zhang, Y. Li, Y. Mao, Z. D. Coudert, Z. Yan, Z. Chen, Z. Papakipos, A. Singh, A. Srivastava, A. Jain, A. Kelsey, A. Shajnfeld, A. Gangidi, A. Victoria, A. Goldstand, A. Menon, A. Sharma, A. Boesenberg, A. Baevski, A. Feinstein, A. Kallet, A. Sangani, A. Teo, A. Yunus, A. Lupu, A. Alvarado, A. Caples, A. Gu, A. Ho, A. Poulton, A. Ryan, A. Ramchandani, A. Dong, A. Franco, A. Goyal, A. Saraf, A. Chowdhury, A. Gabriel, A. Bharambe, A. Eisenman, A. Yazdan, B. James, B. Maurer, B. Leonhardi, B. Huang, B. Loyd, B. D. Paola, B. Paranjape, B. Liu, B. Wu, B. Ni, B. Hancock, B. Wasti, B. Spence, B. Stojkovic, B. Gamido, B. Montalvo, C. Parker, C. Burton, C. Mejia, C. Liu, C. Wang, C. Kim, C. Zhou, C. Hu, C. Chu, C. Cai, C. Tindal, C. Feichtenhofer, C. Gao, D. Civin, D. Beaty, D. Kreymer, D. Li, D. Adkins, D. Xu, D. Testuggine, D. David, D. Parikh, D. Liskovich, D. Foss, D. Wang, D. Le, D. Holland, E. Dowling, E. Jamil, E. Montgomery, E. Presani, E. Hahn, E. Wood, E. Le, E. Brinkman, E. Arcaute, E. Dunbar, E. Smothers, F. Sun, F. Kreuk, F. Tian, F. Kokkinos, F. Ozgenel, F. Caggioni, F. Kanayet, F. Seide, G. M. Florez, G. Schwarz, G. Badeer, G. Swee, G. Halpern, G. Herman, G. Sizov, Guangyi, Zhang, G. Lakshminarayanan, H. Inan, H. Shojanazeri, H. Zou, H. Wang, H. Zha, H. Habeeb, H. Rudolph, H. Suk, H. Aspegren, H. Goldman, H. Zhan, I. Damlaj, I. Molybog, I. Tufanov, I. Leontiadis, I. Veliche, I. Gat, J. Weissman, J. Geboski, J. Kohli, J. Lam, J. Asher, J. Gaya, J. Marcus, J. Tang, J. Chan, J. Zhen, J. Reizenstein, J. Teboul, J. Zhong, J. Jin, J. Yang, J. Cummings, J. Carvill, J. Shepard, J. McPhie, J. Torres, J. Ginsburg, J. Wang, K. Wu, K. H. U, K. Saxena, K. Khandelwal, K. Zand, K. Matosich, K. Veeraraghavan, K. Michelena, K. Li, K. Jagadeesh, K. Huang, K. Chawla, K. Huang, L. Chen, L. Garg, L. A, L. Silva, L. Bell, L. Zhang, L. Guo, L. Yu, L. Moshkovich, L. Wehrstedt, M. Khabsa, M. Avalani, M. Bhatt, M. Mankus, M. Hasson, M. Lennie, M. Reso, M. Groshev, M. Naumov, M. Lathi, M. Keneally, M. Liu, M. L. Seltzer, M. Valko, M. Restrepo, M. Patel, M. Vyatskov, M. Samvelyan, M. Clark, M. Macey, M. Wang, M. J. Hermoso, M. Metanat, M. Rastegari, M. Bansal, N. Santhanam, N. Parks, N. White, N. Bawa, N. Singhal, N. Egebo, N. Usunier, N. Mehta, N. P. Laptev, N. Dong, N. Cheng, O. Chernoguz, O. Hart, O. Salpekar, O. Kalinli, P. Kent, P. Parekh, P. Saab, P. Balaji, P. Rittner, P. Bontrager, P. Roux, P. Dollar, P. Zvyagina, P. Ratanchandani, P. Yuvraj, Q. Liang, R. Alao, R. Rodriguez, R. Ayub, R. Murthy, R. Nayani, R. Mitra, R. Parthasarathy, R. Li, R. Hogan, R. Battey, R. Wang, R. Howes, R. Rinott, S. Mehta, S. Siby, S. J. Bondu, S. Datta, S. Chugh, S. Hunt, S. Dhillon, S. Sidorov, S. Pan, S. Mahajan, S. Verma, S. Yamamoto, S. Ramaswamy, S. Lindsay, S. Lindsay, S. Feng, S. Lin, S. C. Zha, S. Patil, S. Shankar, S. Zhang, S. Zhang, S. Wang, S. Agarwal, S. Sajuyigbe, S. Chintala, S. Max, S. Chen, S. Kehoe, S. Satterfield, S. Govindaprasad, S. Gupta, S. Deng, S. Cho, S. Virk, S. Subramanian, S. Choudhury, S. Goldman, T. Remez, T. Glaser, T. Best, T. Koehler, T. Robinson, T. Li, T. Zhang, T. Matthews, T. Chou, T. Shaked, V. Vontimitta, V. Ajayi, V. Montanez, V. Mohan, V. S. Kumar, V. Mangla, V. Ionescu, V. Poenaru, V. T. Mihailescu, V. Ivanov, W. Li, W. Wang, W. Jiang, W. Bouaziz, W. Constable, X. Tang, X. Wu, X. Wang, X. Wu, X. Gao, Y. Kleinman, Y. Chen, Y. Hu, Y. Jia, Y. Qi, Y. Li, Y. Zhang, Y. Zhang, Y. Adi, Y. Nam, Yu, Wang, Y. Zhao, Y. Hao, Y. Qian, Y. Li, Y. He, Z. Rait, Z. DeVito, Z. Rosnbrick, Z. Wen, Z. Yang, Z. Zhao, and Z. Ma (2024) The llama 3 herd of models. 外部链接:2407.21783, 链接 (https://arxiv.org/abs/2407.21783) 被引用:§5.1 (https://arxiv.org/html/2608.04519#S5.SS1.p1.1)。 - S. Hu, Y. Fu, S. Wu, and V. Smith (2025) Unlearning or obfuscating? jogging the memory of unlearned llms via benign relearning. In *International Conference on Learning Representations*, Vol. 2025, pp. 8857–8888. 被引用:§2.1 (https://arxiv.org/html/2608.04519#S2.SS1.p1.1)。 - J. Huang and K. C. Chang (2023) Towards reasoning in large language models: a survey. In *Findings of the association for computational linguistics: ACL 2023*, pp. 1049–1065. 被引用:§2.1 (https://arxiv.org/html/2608.04519#S2.SS1.p2.1)。 - G. Ilharco, M. T. Ribeiro, M. Wortsman, S. Gururangan, L. Schmidt, H. Hajishirzi, and A. Farhadi (2023) Editing models with task arithmetic. 外部链接:2212.04089, 链接 (https://arxiv.org/abs/2212.04089) 被引用:第4项 (https://arxiv.org/html/2608.04519#A4.I1.i4.p1.3), §2.1 (https://arxiv.org/html/2608.04519#S2.SS1.p1.1), 第4项 (https://arxiv.org/html/2608.04519#S5.I1.i4.p1.1)。 - J. Jang, D. Yoon, S. Yang, S. Cha, M. Lee, L. Logeswaran, and M. Seo (2023) Knowledge unlearning for mitigating privacy risks in language models. In *Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)*, pp. 14389–14408. 被引用:第1项 (https://arxiv.org/html/2608.04519#A4.I1.i1.p1.1), §2.1 (https://arxiv.org/html/2608.04519#S2.SS1.p1.1), 第1项 (https://arxiv.org/html/2608.04519#S5.I1.i1.p1.1)。 - N. Li, A. Pan, A. Gopal, S. Yue, D. Berrios, A. Gatti, J. D. Li, A. Dombrowski, S. Goel, L. Phan, G. Mukobi, N. Helm-Burger, R. Lababidi, L. Justen, A. B. Liu, M. Chen, I. Barrass, O. Zhang, X. Zhu, R. Tamirisa, B. Bharathi, A. Khoja, Z. Zhao, A. Herbert-Voss, C. B. Breuer, S. Marks, O. Patel, A. Zou, M. Mazeika, Z. Wang, P. Oswal, W. Lin, A. A. Hunt, J. Tienken-Harder, K. Y. Shih, K. Talley, J. Guan, R. Kaplan, I. Steneker, D. Campbell, B. Jokubaitis, A. Levinson, J. Wang, W. Qian, K. K. Karmakar, S. Basart, S. Fitz, M. Levine, P. Kumaraguru, U. Tupakula, V. Varadharajan, R. Wang, Y. Shoshitaishvili, J. Ba, K. M. Esvelt, A. Wang, and D. Hendrycks (2024a) The wmdp benchmark: measuring and reducing malicious use with unlearning. 外部链接:2403.03218, 链接 (https:/
相似文章
LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘
本文揭示了经过强化学习训练的多模态大型推理模型中的一个隐私漏洞:即使在最终答案中成功消除了敏感事实,模型仍可能在推理轨迹中重现这些事实。为此,本文提出LEMUR,一个无需训练、推理时运行的框架,利用熵动态来检测并抑制此类泄露。
Reflective Recovery: 一种通过从错误中学习进行推理的自监督方法
本文介绍了Reflective Recovery,这是一种自监督方法,通过将失败轨迹转化为训练数据来增强LLM推理能力,打破缩放崩溃并实现涌现性自我纠正。
MAAT: 多阶段适配器感知定向遗忘
本文指出了机器遗忘基准中的一个盲点:因果类(Why型)知识的代表性不足,并提出了5WBench(一个均衡的基准)和Maat(一个基于LoRA适配器的三阶段遗忘框架),该框架在因果事实的遗忘与保留方面均表现优异。
大语言模型真的能遗忘吗?通过对抗性评估揭示遗忘差距
该研究揭示了大语言模型在机器遗忘方面的显著差距,表明对抗性评估能够揭示遗忘信息的可恢复性,即使在使用强标准指标的情况下,凸显了对抗性压力测试的必要性。
从持续学习中的灾难性遗忘角度重新思考后门对抗性遗忘
本文从持续学习的角度重新思考后门遗忘,定义了完全后门遗忘,并提出盲反演-后门对抗性遗忘(BI-BAU),该方法将对抗训练集成到EM算法中,以有效消除各种攻击类型和模态下的后门效应。