仅使用MLP:用于多模态语言模型的高效视觉状态重建
摘要
本文提出了δ-Vision,一种通过使用轻量级低秩适配器高效重建视觉状态而不丢弃视觉令牌,从而降低多模态语言模型计算开销的方法。
查看缓存全文
缓存时间: 2026/09/29 04:09
论文页面 - 纯粹的MLP:多模态语言模型中的高效视觉状态重构
来源:https://huggingface.co/papers/2609.34972
摘要
长的视觉token序列在多模态大语言模型(MLLMs)中常常占据了计算开销的很大一部分。现有方法通过修剪冗余的视觉token来减少这一成本,但会永久丢弃那些可能在后续层中有用的视觉证据。我们转而探究:是否可以在减少通过Transformer重复演化表示的计算成本的同时,保留所有视觉token?为回答这个问题,我们对视觉到文本的信息流进行了低秩干预。我们发现,在阻断视觉到文本的注意力之后,仅恢复少数几个方向就能恢复大部分损失的准确性,这表明相关的视觉影响集中在一个低维子空间中。我们进一步观察到特定层的视觉状态具有很强的可预测性:轻量级的MLP能够以高余弦相似度和低重构误差来近似它们。受这些发现的启发,我们提出了 δ-Vision,它用轻量级的低秩适配器取代了视觉token的重复Transformer演化,这些适配器在构建层级视觉记忆的同时,保留所有视觉token用于文本检索。在图像和视频基准测试中,δ-Vision在相似或更低计算量下实现了比视觉token剪枝基线更高的准确性,同时在不丢弃视觉token的情况下提供了具有竞争力的推理效率。
查看arXiv页面 (https://arxiv.org/abs/2609.34972) 查看PDF (https://arxiv.org/pdf/2609.34972) GitHub2 (https://github.com/declare-lab/delta-Vision) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.34972)
在你的代理中获取本文:
hf papers read 2609\.34972
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接本文
在模型的README.md中引用arxiv.org/abs/2609.34972以从本页链接它。
引用本文的数据集0
无数据集链接本文
在数据集的README.md中引用arxiv.org/abs/2609.34972以从本页链接它。
引用本文的Space0
无Space链接本文
在Space的README.md中引用arxiv.org/abs/2609.34972以从本页链接它。
包含本文的收藏0
无收藏包含本文
将本文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
VFA: 通过无视觉适应增强多模态大语言模型的多语言能力
本文提出无视觉适应(VFA),一种通过融合多语言和视觉对齐的任务向量来增强多模态大语言模型多语言能力的框架,无需视觉数据,并展示了性能提升和数据效率。
Late-Layer Fusion 足矣:视觉饱和下多模态大语言模型的双路径视觉令牌路由
本文提出 DPVR-LF,一种面向多模态大语言模型(MLLM)的模态不对称路由框架,该框架在视觉令牌饱和点将其路由到轻量级侧分支,并执行晚期融合,从而在减少视觉计算量的同时保持具有竞争力的性能。
选择、压缩、再投资:长视频多模态语言模型中视觉令牌分配的控制性研究
本文对长视频多模态语言模型的视觉令牌分配进行了控制性研究,发现帧选择显著提升准确性,而空间压缩在节省的令牌重新投资到更多帧时几乎是免费的,强调了统一比较框架的必要性。
研究图像分词器作为统一多模态模型中的视觉语言
本文使用受控的自回归测试平台,分析了图像分词器设计如何影响多模态模型中的联合文本-图像建模,揭示了不同的扩展行为及其与下游性能的相关性。
Stateful Visual Encoders for Vision-Language Models
本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。