一种用于视觉令牌剪枝的AI4AI框架

Hugging Face Daily Papers 论文

摘要

AutoPrune是一个无需训练的框架,利用大语言模型(LLMs)通过领域特定语言和残差搜索自动为多模态大语言模型设计视觉令牌剪枝策略,以极小的性能损失实现高效率(在移除94.4%视觉令牌的同时保留99%的性能)。

视觉令牌剪枝可以大幅降低多模态大语言模型(MLLMs)的推理成本,但现有方法主要依赖固定的手工启发式规则和高成本的专家试错。随着剪枝目标、预算和模型架构的多样化,手动探索不断扩大的设计空间变得越来越困难。本文旨在通过回答一个自然问题来构建用于视觉令牌剪枝的AI4AI框架:大语言模型能否自动设计有效的视觉令牌缩减算法?尽管LLMs具有广泛的算法知识和强大的推理能力,但将这些通用知识转化为针对特定任务的有效解决方案仍然是一项艰巨的任务。我们认为,关键在于设计一种合适的搜索状态表示,将LLMs的内部知识与视觉令牌剪枝的结构要求和约束联系起来。基于这一见解,我们提出了AutoPrune,一个无需训练的、由LLM驱动的视觉令牌剪枝策略设计框架。AutoPrune的核心是引入了一种令牌剪枝领域特定语言(TPDSL),包含131个可重用原子,用于预算控制、令牌评分、选择约束和令牌重组。TPDSL的一个关键特性是,它将每个搜索状态表示为强基策略的残差修改。这种残差表述缩小了搜索空间,并将LLM的注意力引导到对性能影响最大的策略组件上。在14个多模态基准测试和三个MLLM骨干网络上的实验证明了AutoPrune的有效性、效率和可迁移性。即使移除94.4%的视觉令牌,AutoPrune仍保留了超过99%的全令牌性能,同时将FLOPs降低了9.9倍,预填充延迟降低了6.4倍。
查看原文
查看缓存全文

缓存时间: 2026/08/14 07:26

论文页面 - 面向视觉 Token 剪枝的 AI4AI 框架

来源:https://huggingface.co/papers/

相似文章

通过令牌剪枝优化韩语中心的大语言模型

arXiv cs.CL

本文系统地评估了令牌剪枝这一压缩技术在韩语中心的LLM任务上的应用,该技术通过移除与无关语言对应的令牌和嵌入参数来压缩模型。研究评估了流行的多语言模型(Qwen3、Gemma-3、Llama-3、Aya)在不同词汇配置下的表现,发现令牌剪枝能显著改进生成稳定性并降低特定领域部署的内存占用。

使用ART微调多模态大语言模型:基于艺术强化训练

Hugging Face Daily Papers

ART(基于艺术强化训练)通过梯度反向传播优化原始视觉输入,实现对冻结的多模态大语言模型的参数高效微调,其性能与LoRA相当,同时支持为vLLM等高吞吐引擎预编译的计算图。

小型LLM:剪枝与从头训练

arXiv cs.LG

本文实证比较了剪枝与从头训练小型语言模型的差异,发现在有限token预算下剪枝具有明显优势,但随着训练规模扩大,优势逐渐减小,尤其是在粗粒度剪枝情况下。