一种用于视觉令牌剪枝的AI4AI框架
摘要
AutoPrune是一个无需训练的框架,利用大语言模型(LLMs)通过领域特定语言和残差搜索自动为多模态大语言模型设计视觉令牌剪枝策略,以极小的性能损失实现高效率(在移除94.4%视觉令牌的同时保留99%的性能)。
查看缓存全文
缓存时间: 2026/08/14 07:26
论文页面 - 面向视觉 Token 剪枝的 AI4AI 框架
来源:https://huggingface.co/papers/
相似文章
Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin
This paper introduces a method to predict middle-layer attention in multimodal LLMs to prune visual tokens efficiently, using question-contrastive teacher selection and cross-modal attention distillation.
研究人员让AI智能体优化LLM推理,Token用量锐减70%
研究人员开发了AutoTTS框架,通过AI智能体自动设计控制策略来优化LLM推理,在保持高推理准确率的同时,将Token消耗降低约70%。
通过令牌剪枝优化韩语中心的大语言模型
本文系统地评估了令牌剪枝这一压缩技术在韩语中心的LLM任务上的应用,该技术通过移除与无关语言对应的令牌和嵌入参数来压缩模型。研究评估了流行的多语言模型(Qwen3、Gemma-3、Llama-3、Aya)在不同词汇配置下的表现,发现令牌剪枝能显著改进生成稳定性并降低特定领域部署的内存占用。
使用ART微调多模态大语言模型:基于艺术强化训练
ART(基于艺术强化训练)通过梯度反向传播优化原始视觉输入,实现对冻结的多模态大语言模型的参数高效微调,其性能与LoRA相当,同时支持为vLLM等高吞吐引擎预编译的计算图。
小型LLM:剪枝与从头训练
本文实证比较了剪枝与从头训练小型语言模型的差异,发现在有限token预算下剪枝具有明显优势,但随着训练规模扩大,优势逐渐减小,尤其是在粗粒度剪枝情况下。