2-bit QAT 模型发布
摘要
关于2位量化感知训练(QAT)在更大规模MoE模型上的潜力的讨论,比较其与4位QAT及三元LLM的性能,并探讨在消费级硬件上的可行性。
目前为止,利用量化感知训练(QAT)的模型发布主要集中在4位上。我很好奇,一个更大的MoE模型(约120b到400b参数)能实现什么。显然,该模型无法接近8/16位的性能,但也许这可以成为从头训练三元LLM(1.58位)的更好替代方案。在这些规模下,可以将模型放入运行64/128 GB RAM的消费级计算机中,并且它可能优于大小约一半(80b/235b)的4位精度模型。我怀疑之所以没有尝试,是因为工具和编码可能会受到太大影响。我在创意写作的背景下考虑这个问题。根据我的经验,2位仍然可以表现良好。你怎么看?编辑:我承认,对于与8位/16位模型类似的性能,4位QAT可能是最佳解决方案。我想知道的是……一个4位的120b模型与一个2位的240b QAT模型相比如何?它们的性能会相似吗?我们注意到向更大模型发展的趋势。QAT模型能否弥合向中端模型过渡时的差距?
相似文章
LC-QAT:基于线性约束向量量化的数据高效2比特LLM量化感知训练
提出LC-QAT,一种用于大语言模型的2比特仅权重量化感知训练框架,通过学习仿射映射实现端到端训练,仅使用0.1%–10%的训练数据即达到最优结果。
CAT-Q: 用于LLM的高效且准确的三值量化
CAT-Q 提出了一种面向LLM的训练后三值量化方法,该方法使用可学习调制和软化三值化技术,仅需512个校准样本即可实现优于BitNet 1.58-bit的性能,并可扩展到235B参数规模。
对QAT模型使用替代量化有意义吗?[D]
讨论对像Gemma-4这样的量化感知训练(QAT)模型使用替代量化方法是否合理,质疑unsloth的基准测试显示其更接近QAT微调的性能是有益还是适得其反。
Gemma 4 26B A4B IT QAT 对比
一位用户在MMLU_PRO和HumanEval上对Gemma 4 26B IT的三个量化版本(4位、6位和8位QAT)进行了基准测试,发现QAT 8位模型在HumanEval上的表现不如6位量化版本,且并未明显优于4位版本,从而质疑QAT对此模型的优越性。
重新思考小型VLM量化:从组件分析到硬件感知的边缘部署
本文系统性地评估了Jetson边缘设备上小型视觉语言模型的组件级量化,发现模型架构(MoE vs 稠密)显著影响量化敏感性,且量化误差在大体上是累加的,除了模态对齐路径之外。