post-training-quantization

标签

Cards List
#post-training-quantization

@PyTorch: 模型优化与训练后量化 模型量化是一种减少VRAM使用并提高...

X AI KOLs Following · 2026-05-26 缓存

这篇来自NVIDIA的文章介绍了如何使用NVIDIA Model Optimizer库,通过训练后量化方法将CLIP模型量化为FP8格式,从而减少VRAM使用并提升在消费级GPU上的推理性能。

0 人收藏 0 人点赞
#post-training-quantization

基于平坦度的理论最优量化

arXiv cs.LG · 2026-05-20 缓存

介绍了平坦度度量与双向对角量化(BDQ)用于大型语言模型的训练后量化,实现了接近无损的4比特权重和激活量化,并在极低比特设置下取得了显著改进。

0 人收藏 0 人点赞
#post-training-quantization

K-Quantization 及其对输出性能的影响

arXiv cs.CL · 2026-05-20 缓存

本文研究了不同量化级别(2位到8位)对八个大型语言模型在推理、代码理解和阅读理解任务上的性能影响,发现虽然更高精度通常带来更好的性能,但激进量化通常能保持可接受的准确率,且更大的模型展现出更强的韧性。

0 人收藏 0 人点赞
#post-training-quantization

LoopQ:递归Transformer的量化

arXiv cs.LG · 2026-05-19 缓存

LoopQ是一种针对循环语言模型的后训练量化框架,解决了分布偏移、状态复用和误差累积问题。在4位权重和激活量化下,平均准确率提升68.8%。

0 人收藏 0 人点赞
#post-training-quantization

E-PMQ:专家引导的合并后量化与合并权重锚定

arXiv cs.CL · 2026-05-19 缓存

本文介绍了E-PMQ,一种专家引导的合并后量化框架,解决了合并和量化带来的联合偏差,在CLIP-ViT和FLAN-T5等多任务合并模型上取得了显著的精度提升。

0 人收藏 0 人点赞
#post-training-quantization

面向大语言模型的显著性感知正则化量化校准

arXiv cs.AI · 2026-05-08 缓存

本文提出了显著性感知正则化量化校准(SARQC),这是一个统一的框架,通过添加正则化项以保持权重接近度,从而改善大语言模型(LLM)的训练后量化(PTQ),提升泛化能力和性能。

0 人收藏 0 人点赞
#post-training-quantization

从信号退化到计算崩溃:揭示LLM量化的两种失效模式

arXiv cs.CL · 2026-04-23 缓存

研究者发现激进LLM量化存在两种截然不同的失效模式——信号退化与计算崩溃,并证明无需训练的修复手段仅能缓解前者,表明超低比特模型需进行结构性重建。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈