用于特征发现与控制的多模态模型对比分析

Hugging Face Daily Papers 论文

摘要

MMDiff利用多模态稀疏自编码器来隔离、检测和控制多模态语言模型中的特征,提升可解释性并针对视觉和安全行为进行定向引导。

多模态大型语言模型(MLLMs)表现出强大的视觉理解能力,但导致这些行为的内部特征仍然难以识别、审计或控制。尽管稀疏自编码器(SAEs)可以将隐藏状态分解为可解释的特征方向,用于事后检查,但它们既不容易隔离哪些特征被多模态训练改变,也不直接有助于定向控制。我们引入了MMDiff,一个多模态模型对比分析框架,它训练多模态SAEs并将其转化为特征级接口,用于发现和控制多模态行为。MMDiff支持三种用途:(i) 特征隔离,通过对比基线语言模型SAE与其多模态适配版本来识别被多模态训练改变的特征;(ii) 任务特定特征检测,通过逐词对比激活分析来隔离因果特征;(iii) 特征级控制,通过因果移除或引导发现的特征方向。我们为三个MLLM家族(LLaVA-MORE、PaliGemma 2和InternVL3.5)训练多模态SAEs,并在视觉空间理解、多模态安全和OCR上进行评估。MMDiff发现了稀疏且因果特定的特征,移除这些特征会平均在空间任务上降低目标行为12%,在OCR上降低17%,并在多模态安全攻击中将攻击成功率降低24%,且对VQA性能无影响。引导这些特征使空间和OCR准确率平均比标准单层引导基线提高+3.6%和+1.8%。这些结果表明,多模态SAEs不仅可以作为可解释性工具,还可以作为审计、引导和控制MLLMs行为以实现更安全和更强大生成的机制。
查看原文
查看缓存全文

缓存时间: 2026/08/17 07:46

论文页面 - 多模态模型差异分析用于特征发现与控制

来源:https://huggingface.co/papers/2608.09928

摘要

MMDiff 使用多模态稀疏自编码器,在多模态语言模型中隔离、检测并控制特定特征,从而提升模型的可解释性,并实现对视觉与安全行为的定向调控。

多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models)(MLLMs)展现出强大的视觉理解能力,但导致这些行为的内部特征仍难以识别、审计或控制。虽然稀疏自编码器 (https://huggingface.co/papers?q=sparse%20autoencoders)(SAEs)可用于事后检查,能将隐状态分解为可解释的特征方向,但它们既不能轻松隔离多模态训练改变了哪些特征,也无法直接用于定向控制。我们提出了 MMDiff (https://huggingface.co/papers?q=MMDiff),一个多模态模型差异分析框架。该框架训练多模态 SAEs (https://huggingface.co/papers?q=multimodal%20SAEs) 并将其转化为特征级接口,用于发现和控制多模态行为。MMDiff (https://huggingface.co/papers?q=MMDiff) 支持三种用途:(i) 特征隔离 (https://huggingface.co/papers?q=feature%20isolation),通过对比基础语言模型的 SAE 与其多模态适配对应物,识别被多模态训练改变的特征;(ii) 任务特定特征检测,通过基于 token 的对比激活分析 (https://huggingface.co/papers?q=contrastive%20firing%20analysis) 隔离因果特征;以及 (iii) 特征级控制 (https://huggingface.co/papers?q=feature-level%20control),通过因果性地移除或引导 (https://huggingface.co/papers?q=steering) 发现的特征方向。我们为三类 MLLM 系列(LLaVA-MORE、PaliGemma 2 和 InternVL3.5)训练了多模态 SAEs (https://huggingface.co/papers?q=multimodal%20SAEs),并在视觉空间理解 (https://huggingface.co/papers?q=visual-spatial%20understanding)、多模态安全 (https://huggingface.co/papers?q=multimodal%20safety) 和 OCR 任务上进行了评估。MMDiff (https://huggingface.co/papers?q=MMDiff) 发现了稀疏且因果特异的特征,移除这些特征可选择性地削弱目标行为:在空间任务上平均降低 12%,在 OCR 上平均降低 17%,并在多模态安全 (https://huggingface.co/papers?q=multimodal%20safety) 攻击中将攻击成功率降低 24%,且不影响视觉问答性能。引导 (https://huggingface.co/papers?q=Steering) 这些特征相较于标准单层引导 (https://huggingface.co/papers?q=steering) 基线,平均将空间和 OCR 准确率分别提升了 +3.6% 和 +1.8%。这些结果表明,多模态 SAEs (https://huggingface.co/papers?q=multimodal%20SAEs) 不仅可作为可解释性工具,还可作为审计、引导 (https://huggingface.co/papers?q=steering) 和控制 MLLM 行为、使其生成更安全且更强大内容的机制。

查看 arXiv 页面 (https://arxiv.org/abs/2608.09928) 查看 PDF (https://arxiv.org/pdf/2608.09928) 项目页面 (https://pixl.cs.ox.ac.uk/mmdiff) GitHub (https://github.com/hunarbatra/MMDiff) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.09928)

在您的代理中获取此论文:

hf papers read 2608.09928

没有最新的 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

没有模型链接到此论文。

在模型的 README.md 中引用 arxiv.org/abs/2608.09928 以从本页链接它。

引用本文的数据集0

没有数据集链接到此论文。

在数据集的 README.md 中引用 arxiv.org/abs/2608.09928 以从本页链接它。

引用本文的空间0

没有空间链接到此论文。

在空间的 README.md 中引用 arxiv.org/abs/2608.09928 以从本页链接它。

包含本文的收藏夹2

相似文章

MMDiff: 扩展扩散变换器以实现多模态生成

Hugging Face Daily Papers

MMDiff 通过轻量级解码器将冻结的扩散变换器扩展为多模态生成系统,通过多时间步特征融合,在语义分割和其他感知任务上实现了显著改进。

PerceptionDLM: 基于多模态扩散语言模型的并行区域感知

Hugging Face Daily Papers

PerceptionDLM 提出了一种多模态扩散语言模型,通过结构化注意力掩码和高效提示实现并行区域感知,在不牺牲字幕质量的情况下实现更快的推理。实验表明,在多区域感知任务中,性能具有竞争力且速度大幅提升。

MBDiff:多视图行为感知扩散模型用于概率性公用事业数据插补

arXiv cs.LG

提出MBDiff,一种用于概率性公用事业数据填补的多视图行为感知扩散模型,该模型从全局、局部和实例级视图学习用户行为,并使用条件注意力去噪网络。在佛罗里达州的真实公用事业数据上进行的评估表明,它优于最先进的基线模型。