2-bit QAT 模型发布

Reddit r/LocalLLaMA 新闻

摘要

关于2位量化感知训练(QAT)在更大规模MoE模型上的潜力的讨论,比较其与4位QAT及三元LLM的性能,并探讨在消费级硬件上的可行性。

目前为止,利用量化感知训练(QAT)的模型发布主要集中在4位上。我很好奇,一个更大的MoE模型(约120b到400b参数)能实现什么。显然,该模型无法接近8/16位的性能,但也许这可以成为从头训练三元LLM(1.58位)的更好替代方案。在这些规模下,可以将模型放入运行64/128 GB RAM的消费级计算机中,并且它可能优于大小约一半(80b/235b)的4位精度模型。我怀疑之所以没有尝试,是因为工具和编码可能会受到太大影响。我在创意写作的背景下考虑这个问题。根据我的经验,2位仍然可以表现良好。你怎么看?编辑:我承认,对于与8位/16位模型类似的性能,4位QAT可能是最佳解决方案。我想知道的是……一个4位的120b模型与一个2位的240b QAT模型相比如何?它们的性能会相似吗?我们注意到向更大模型发展的趋势。QAT模型能否弥合向中端模型过渡时的差距?
查看原文

相似文章

CAT-Q: 用于LLM的高效且准确的三值量化

arXiv cs.CL

CAT-Q 提出了一种面向LLM的训练后三值量化方法,该方法使用可学习调制和软化三值化技术,仅需512个校准样本即可实现优于BitNet 1.58-bit的性能,并可扩展到235B参数规模。

对QAT模型使用替代量化有意义吗?[D]

Reddit r/MachineLearning

讨论对像Gemma-4这样的量化感知训练(QAT)模型使用替代量化方法是否合理,质疑unsloth的基准测试显示其更接近QAT微调的性能是有益还是适得其反。

Gemma 4 26B A4B IT QAT 对比

Reddit r/LocalLLaMA

一位用户在MMLU_PRO和HumanEval上对Gemma 4 26B IT的三个量化版本(4位、6位和8位QAT)进行了基准测试,发现QAT 8位模型在HumanEval上的表现不如6位量化版本,且并未明显优于4位版本,从而质疑QAT对此模型的优越性。