面向视觉和语言Transformer的损伤感知多臂老虎机剪枝
摘要
本文提出了一种损伤感知的多臂老虎机方法,用于视觉和语言Transformer的结构化训练后剪枝。实验表明,与基线方法相比,该方法在多种模型和数据集上表现出降低的性能下降。
arXiv:2609.05448v1 Announce Type: new
摘要:Transformer的结构化训练后剪枝需要选择完整的功能单元,其抑制导致有限的退化。我们将语言和视觉Transformer的结构单元选择表述为固定候选评估预算下的损伤感知多臂老虎机问题。注意力头和MLP通道组在校准批次上被临时掩蔽。配对损伤是掩蔽损失减去同一批次上的基础损失,减少了批次间的变异。平滑有界奖励驱动UCB风格策略或分数Beta Thompson采样,并通过逐步添加一个单元来顺序构建最终掩蔽。所选单元在原始密集检查点中被功能归零;因此,报告的参数效应代表有效的结构抑制,而非物理压缩或测量加速。在WikiText-2、LAMBADA和Imagenette上的实验涵盖了GPT-2、OPT、Pythia、Qwen2.5、SmolLM2、ViT-B/16、DeiT-Tiny和Swin-Tiny,并与随机、幅度、静态显著性和预算贪心选择进行比较。在五个随机种子下,多臂老虎机方法在配对语言模型比较中通常相对于预算贪心减少退化。在论文中强调的28项比较中,23个bootstrap置信区间排除了零,11个配对测试的p < 0.05;在完整116个数据集测试中,Benjamini-Hochberg校正后有六个q < 0.05。ViT-B/16和Swin-Tiny的匹配评估结果表明,它们的增益不能仅由更大的候选评估预算来解释。
查看缓存全文
缓存时间: 2026/09/10 08:35
# 损伤感知剪枝方法在视觉与语言Transformer中的应用 来源:https://arxiv.org/abs/2609.05448 查看PDF (https://arxiv.org/pdf/2609.05448) > 摘要:Transformer模型的结构化后训练剪枝需选择能保持完整功能性的单元,以最大限度减少模型性能下降。我们将语言与视觉Transformer的结构化单元选择问题,构建为固定候选评估预算下的损伤感知多臂老虎机问题。通过在标定批次数据上临时遮蔽注意力头与MLP通道组,计算配对损伤值——即遮蔽状态损失与基准损失的差值,有效降低批次间方差。采用平滑有界奖励机制驱动UCB策略或分式Beta汤普森采样,通过逐步添加单元构建最终掩码。被选中的单元在原始密集参数检查点中被功能置零,因此报告的参数影响反映的是有效结构抑制而非实际压缩或测量加速。实验覆盖WikiText-2、LAMBADA和Imagenette数据集,涉及GPT-2、OPT、Pythia、Qwen2.5、SmolLM2、ViT-B/16、DeiT-Tiny和Swin-Tiny模型,与随机、幅值、静态显著性和预算贪心选择方法进行对比。在五组随机种子的配对语言模型比较中,老虎机方法通常能相对预算贪心法降低性能下降。论文中重点标注的28组对比实验中,23组自助法置信区间不包含零值,11组配对检验p值<0.05;在116个数据集级检验的完整家族中,经Benjamini-Hochberg校正后有6组q值<0.05。ViT-B/16与Swin-Tiny的匹配评估结果表明,其性能提升并非完全源于更大的候选评估预算。 ## 投稿记录 作者:Salem Ameen \[查看邮件 (https://arxiv.org/show-email/05400591/2609.05448)\] **\[v1\]**2026年8月2日 星期日 23:57:18 UTC \(3,177 KB\)
相似文章
基于多臂赌博机的深度神经网络结构化神经元剪枝
本文提出了一种新颖的基于多臂赌博机算法的深度神经网络结构化神经元剪枝框架,并在多种任务上验证了其有效性。
使用多臂老虎机进行卷积神经网络中损失感知的特征图剪枝
本文介绍了一种使用多臂老虎机(UCB1和Thompson采样)进行卷积神经网络损失感知的特征图剪枝框架,选择性移除冗余特征图,在降低计算成本的同时保持准确率。
一种用于视觉令牌剪枝的AI4AI框架
AutoPrune是一个无需训练的框架,利用大语言模型(LLMs)通过领域特定语言和残差搜索自动为多模态大语言模型设计视觉令牌剪枝策略,以极小的性能损失实现高效率(在移除94.4%视觉令牌的同时保留99%的性能)。
检索,而非重新训练:在测试时将视觉语言动作模型扩展到新任务
本文介绍了一种检索增强的视觉-语言-动作策略,通过使用预训练模型和索引演示,消除了每个任务的微调,实现了高效的跨本体泛化和测试时的任务适应。
Reroute,而非移除:面向视觉语言模型的可恢复视觉令牌路由
提出Reroute,一种无需训练的视觉语言模型插件,用可恢复的路由替代不可逆的视觉令牌剪枝,允许令牌在后续阶段重新进入流水线,从而在激进的令牌缩减下提升接地性能,同时保持VQA性能。