用于特征发现与控制的多模态模型对比分析
摘要
MMDiff利用多模态稀疏自编码器来隔离、检测和控制多模态语言模型中的特征,提升可解释性并针对视觉和安全行为进行定向引导。
查看缓存全文
缓存时间: 2026/08/17 07:46
论文页面 - 多模态模型差异分析用于特征发现与控制
来源:https://huggingface.co/papers/2608.09928
摘要
MMDiff 使用多模态稀疏自编码器,在多模态语言模型中隔离、检测并控制特定特征,从而提升模型的可解释性,并实现对视觉与安全行为的定向调控。
多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)展现出强大的视觉理解能力,但导致这些行为的内部特征仍难以识别、审计或控制。虽然稀疏自编码器 (https://huggingface.co/papers?q=sparse%20autoencoders)(SAEs)可用于事后检查,能将隐状态分解为可解释的特征方向,但它们既不能轻松隔离多模态训练改变了哪些特征,也无法直接用于定向控制。我们提出了 MMDiff (https://huggingface.co/papers?q=MMDiff),一个多模态模型差异分析框架。该框架训练多模态 SAEs (https://huggingface.co/papers?q=multimodal%20SAEs) 并将其转化为特征级接口,用于发现和控制多模态行为。MMDiff (https://huggingface.co/papers?q=MMDiff) 支持三种用途:(i) 特征隔离 (https://huggingface.co/papers?q=feature%20isolation),通过对比基础语言模型的 SAE 与其多模态适配对应物,识别被多模态训练改变的特征;(ii) 任务特定特征检测,通过基于 token 的对比激活分析 (https://huggingface.co/papers?q=contrastive%20firing%20analysis) 隔离因果特征;以及 (iii) 特征级控制 (https://huggingface.co/papers?q=feature-level%20control),通过因果性地移除或引导 (https://huggingface.co/papers?q=steering) 发现的特征方向。我们为三类 MLLM 系列(LLaVA-MORE、PaliGemma 2 和 InternVL3.5)训练了多模态 SAEs (https://huggingface.co/papers?q=multimodal%20SAEs),并在视觉空间理解 (https://huggingface.co/papers?q=visual-spatial%20understanding)、多模态安全 (https://huggingface.co/papers?q=multimodal%20safety) 和 OCR 任务上进行了评估。MMDiff (https://huggingface.co/papers?q=MMDiff) 发现了稀疏且因果特异的特征,移除这些特征可选择性地削弱目标行为:在空间任务上平均降低 12%,在 OCR 上平均降低 17%,并在多模态安全 (https://huggingface.co/papers?q=multimodal%20safety) 攻击中将攻击成功率降低 24%,且不影响视觉问答性能。引导 (https://huggingface.co/papers?q=Steering) 这些特征相较于标准单层引导 (https://huggingface.co/papers?q=steering) 基线,平均将空间和 OCR 准确率分别提升了 +3.6% 和 +1.8%。这些结果表明,多模态 SAEs (https://huggingface.co/papers?q=multimodal%20SAEs) 不仅可作为可解释性工具,还可作为审计、引导 (https://huggingface.co/papers?q=steering) 和控制 MLLM 行为、使其生成更安全且更强大内容的机制。
查看 arXiv 页面 (https://arxiv.org/abs/2608.09928) 查看 PDF (https://arxiv.org/pdf/2608.09928) 项目页面 (https://pixl.cs.ox.ac.uk/mmdiff) GitHub (https://github.com/hunarbatra/MMDiff) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.09928)
在您的代理中获取此论文:
hf papers read 2608.09928
没有最新的 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
没有模型链接到此论文。
在模型的 README.md 中引用 arxiv.org/abs/2608.09928 以从本页链接它。
引用本文的数据集0
没有数据集链接到此论文。
在数据集的 README.md 中引用 arxiv.org/abs/2608.09928 以从本页链接它。
引用本文的空间0
没有空间链接到此论文。
在空间的 README.md 中引用 arxiv.org/abs/2608.09928 以从本页链接它。
包含本文的收藏夹2
相似文章
MMDiff: 扩展扩散变换器以实现多模态生成
MMDiff 通过轻量级解码器将冻结的扩散变换器扩展为多模态生成系统,通过多时间步特征融合,在语义分割和其他感知任务上实现了显著改进。
PerceptionDLM: 基于多模态扩散语言模型的并行区域感知
PerceptionDLM 提出了一种多模态扩散语言模型,通过结构化注意力掩码和高效提示实现并行区域感知,在不牺牲字幕质量的情况下实现更快的推理。实验表明,在多区域感知任务中,性能具有竞争力且速度大幅提升。
CL-DMDF:基于对比学习的动态多模态数据融合模型
本文提出了CL-DMDF,一种基于对比学习和双维度注意力机制的动态多模态数据融合模型,用于处理缺失模态并提升判别学习能力。
MBDiff:多视图行为感知扩散模型用于概率性公用事业数据插补
提出MBDiff,一种用于概率性公用事业数据填补的多视图行为感知扩散模型,该模型从全局、局部和实例级视图学习用户行为,并使用条件注意力去噪网络。在佛罗里达州的真实公用事业数据上进行的评估表明,它优于最先进的基线模型。
更快但不同:加速多模态扩散语言模型中内容漂移的诊断与控制
本文研究了无训练加速如何静默改变基于扩散的多模态大语言模型生成的内容,并提出了成对诊断和一致性控制方法来缓解内容漂移。