activation-aware

标签

Cards List
#activation-aware

批量自适应剪枝:面向语言推理模型的周期性神经元激活感知权重剪枝

arXiv cs.CL · 2026-08-17 缓存

本文提出了一种针对批量推理中大型推理模型的无需训练自适应剪枝方法,采用周期性 top-k 选择和激活记忆以提高准确性和计算效率。

0 人收藏 0 人点赞
#activation-aware

PALS:面向大语言模型剪枝的百分位感知层稀疏度方法

arXiv cs.CL · 2026-07-09 缓存

PALS根据激活幅度的99百分位数调整大语言模型剪枝中的每层稀疏比,在LLaMA-2-7B上相比均匀稀疏实现了显著困惑度改进,且附加成本可忽略不计。

0 人收藏 0 人点赞
#activation-aware

SigmaScale:基于SVD低秩分解与学习缩放矩阵的LLM压缩方法

arXiv cs.CL · 2026-06-08 缓存

介绍SigmaScale,一种为基于SVD的LLM压缩学习辅助缩放矩阵的方法,在Llama 3.1 8B和Qwen3-8B基准测试上展现出具有竞争力的性能。

0 人收藏 0 人点赞
#activation-aware

QAM-W:基于哈达玛旋转和激活感知缩放的LLM权重联合二维码本量化

arXiv cs.LG · 2026-05-27 缓存

介绍了QAM-W,一种针对LLM权重的联合二维码本量化方法,采用哈达玛旋转和激活感知缩放,在每权重5–6比特下实现接近BF16的困惑度,并以减少32%的权重比特达到与SmoothQuant W8A8相当的质量。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈