仅使用MLP:用于多模态语言模型的高效视觉状态重建

Hugging Face Daily Papers 论文

摘要

本文提出了δ-Vision,一种通过使用轻量级低秩适配器高效重建视觉状态而不丢弃视觉令牌,从而降低多模态语言模型计算开销的方法。

长视觉令牌序列通常在多模态大语言模型(MLLMs)的计算开销中占很大比例。现有方法通过修剪冗余视觉令牌来降低成本,但会永久丢弃可能在后续层中有用的视觉证据。我们转而探讨是否可以在减少通过Transformer反复演化表示的成本的同时,保留所有视觉令牌。为了回答这个问题,我们对视觉到文本的信息流进行低秩干预。我们发现,在视觉到文本注意力被阻止后,仅恢复少数方向就能恢复大部分丢失的准确性,表明相关的视觉影响集中在低维子空间中。我们进一步观察到层特定视觉状态的强可预测性:轻量级MLP能够以高余弦相似度和低重建误差近似它们。受这些发现启发,我们提出了δ-Vision,它使用轻量级低秩适配器替代Transformer对视觉令牌的反复演化,构建逐层视觉记忆,同时保留所有视觉令牌用于文本检索。在图像和视频基准测试中,δ-Vision在可比或更低的计算下实现了比视觉令牌修剪基线更高的准确性,同时在没有丢弃视觉令牌的情况下提供了具有竞争力的推理效率。
查看原文
查看缓存全文

缓存时间: 2026/09/29 04:09

论文页面 - 纯粹的MLP:多模态语言模型中的高效视觉状态重构

来源:https://huggingface.co/papers/2609.34972

摘要

长的视觉token序列在多模态大语言模型(MLLMs)中常常占据了计算开销的很大一部分。现有方法通过修剪冗余的视觉token来减少这一成本,但会永久丢弃那些可能在后续层中有用的视觉证据。我们转而探究:是否可以在减少通过Transformer重复演化表示的计算成本的同时,保留所有视觉token?为回答这个问题,我们对视觉到文本的信息流进行了低秩干预。我们发现,在阻断视觉到文本的注意力之后,仅恢复少数几个方向就能恢复大部分损失的准确性,这表明相关的视觉影响集中在一个低维子空间中。我们进一步观察到特定层的视觉状态具有很强的可预测性:轻量级的MLP能够以高余弦相似度和低重构误差来近似它们。受这些发现的启发,我们提出了 δ-Vision,它用轻量级的低秩适配器取代了视觉token的重复Transformer演化,这些适配器在构建层级视觉记忆的同时,保留所有视觉token用于文本检索。在图像和视频基准测试中,δ-Vision在相似或更低计算量下实现了比视觉token剪枝基线更高的准确性,同时在不丢弃视觉token的情况下提供了具有竞争力的推理效率。

查看arXiv页面 (https://arxiv.org/abs/2609.34972) 查看PDF (https://arxiv.org/pdf/2609.34972) GitHub2 (https://github.com/declare-lab/delta-Vision) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.34972)

在你的代理中获取本文:

hf papers read 2609\.34972

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接本文

在模型的README.md中引用arxiv.org/abs/2609.34972以从本页链接它。

引用本文的数据集0

无数据集链接本文

在数据集的README.md中引用arxiv.org/abs/2609.34972以从本页链接它。

引用本文的Space0

无Space链接本文

在Space的README.md中引用arxiv.org/abs/2609.34972以从本页链接它。

包含本文的收藏0

无收藏包含本文

将本文添加到收藏 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

Stateful Visual Encoders for Vision-Language Models

Hugging Face Daily Papers

本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。