跨视觉、语言、视频和音频的多模态遗忘:方法、数据集和基准综述
摘要
对跨视觉、语言、视频和音频的多模态遗忘方法、数据集和基准的综合综述,提供了分类法并强调了未解决问题。
arXiv:2607.07907v1 公告类型:新
摘要:随着VLM、DM、LLM和AFM的日益普及,这些多模态基础模型可能会无意中编码来自其训练数据的敏感、受版权保护、有偏见或不安全的跨模态关联。在处理删除请求或策略更新后重新训练往往不切实际,而由于知识分布在共享表示中,有针对性的遗忘仍然困难。多模态遗忘通过允许在保留整体效用的同时跨模态选择性移除来解决这一挑战。本综述提供了一个统一的、系统导向的视角,涵盖了视觉、语言、音频和视频领域的多模态遗忘,基于最新进展、新兴应用和未解决问题。我们的分类法能够跨模型架构和模态进行系统比较,阐明了删除强度、保留、效率、可逆性和鲁棒性之间的权衡。本综述强调了未解决问题和实际考量,以支持多模态遗忘的未来研究和部署。我们发布了一个精选仓库:https://smsnobin77.github.io/Awesome-Multimodal-Unlearning/
查看缓存全文
缓存时间: 2026/07/10 06:16
# 跨视觉、语言、视频与音频的多模态遗忘:方法、数据集与基准综述 来源:https://arxiv.org/abs/2607.07907 查看PDF (https://arxiv.org/pdf/2607.07907) > 摘要:随着VLMs、DMs、LLMs和AFMs的广泛采用,这些多模态基础模型可能不经意地编码来自其训练数据的敏感、受版权保护、有偏见或不安全的跨模态关联。在收到删除请求或策略更新后进行重训练通常不切实际,而针对性的遗忘仍很困难,因为知识分布在共享表示中。多模态遗忘通过允许在保持整体效用的同时跨模态选择性移除,解决了这一挑战。本综述基于最新进展、新兴应用和开放问题,提供了一个统一的、面向系统的视角,涵盖跨视觉、语言、音频和视频的多模态遗忘。我们的分类法支持跨模型架构和模态的系统比较,明确了删除强度、保持、效率、可逆性和鲁棒性之间的权衡。本综述强调了开放问题和实际考虑,以支持多模态遗忘的未来研究和部署。我们发布了一个精选知识库:此HTTPS URL (https://smsnobin77.github.io/Awesome-Multimodal-Unlearning/) ## 提交历史 来自:Nobin Sarwar [查看电子邮件 (https://arxiv.org/show-email/8ee361a5/2607.07907)] **\[v1\]** 2026年7月8日星期三 20:42:46 UTC (2,356 KB)
相似文章
MLUBench: 多模态大语言模型终身遗忘评估基准
MLUBench 是一个大规模的多模态大语言模型终身遗忘基准,包含9个类别的127个实体。论文指出现有遗忘方法存在累积退化问题,并提出 LUMoE 来缓解此问题,显示出显著改进。
随机元遗忘:连接语言骨干与多模态遗忘
本文介绍了随机元遗忘(SMU),这是一个双层框架,利用VLM级反馈为语言骨干学习一个可进行遗忘的初始化,在多模态遗忘中实现更好的遗忘-保留权衡。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。
MulTaBench:基于文本与图像的多模态表格学习基准测试
介绍了 MulTaBench,一个包含40个数据集的基准测试,用于文本和图像模态的多模态表格学习。实验表明,任务特定的嵌入调优优于冻结的预训练嵌入,特别是在模态提供互补预测信号时。
多模态大语言模型的计算幽默:方法、数据集、评估与挑战
关于使用大语言模型进行多模态幽默理解的全面综述,涵盖方法、数据集、评估协议以及在解读迷因、卡通和漫画中幽默的挑战。