@jino_rohit: 在开始学习LLMs的量化之前,你需要理解不同数字格式在内存中是如何表示的……
摘要
一篇帖子解释为什么理解内存中的数字格式对于学习LLM量化至关重要,涵盖梯度NaN调试、数值稳定性以及量化失真。
在开始学习LLMs的量化之前,你需要理解不同数字格式在内存中是如何表示的。为什么?
1. 调试梯度为何变为NaN
2. 训练为何数值不稳定
3. 量化如何扭曲我的数轴
4. 为什么某些量化方案比其他方案效果更好
这是我的文章,通过可视化帮助你建立关于它的心智模型!
查看缓存全文
缓存时间: 2026/05/23 22:16
在开始学习大语言模型的量化之前,你需要理解不同数值格式在内存中是如何表示的。为什么?
- 调试梯度为什么变成NaN
- 为什么训练在数值上不稳定
- 量化如何扭曲我的数轴
- 为什么某些量化方案比其他方案效果更好
这是我的一篇文章,通过可视化帮助你建立相关的思维模型!
就是你!
相似文章
大逆转与格式协同设计:LLM量化的线性变换
本文综述了200项关于大语言模型量化的工作,形式化了“大逆转”原则,该原则对比了编码中的能量集中与量化中的组内平坦化,并基于部署方案与MXFP4、NVFP4等格式提供了线性变换选择指南。
@akshay_pachaar: 如果必须将70B模型适配到单个GPU上,我会学习的LLM量化技术:(收藏此帖) FP16的70B模型……
一条推文介绍了五种关键的LLM量化技术(RTN, GPTQ, AWQ, LLM.int8(), QAT),用于在有限硬件上适配大型模型,并引用了一篇综合性研究论文。
解耦量化:专用于大语言模型预填充与解码阶段
本文介绍了解耦量化,一种针对大语言模型预填充和解码阶段定制量化方法以提升推理效率和准确性的技术。
@charles_irl: 低精度浮点数很奇怪。我一直在推理/训练之外使用它们来建立直觉…
一条推文介绍了微缩放/块量化格式(如NVFP4和MXFP4)的可视化工具,解释了这些低精度浮点数的工作原理以及它们在LLM推理中减少内存带宽需求的应用。
ZK-LLM 之下的比特:面向可验证私有 LLM 推理的零知识友好型量化评估
本文首次对大语言模型的零知识友好型量化进行了系统性研究,对该概念进行了形式化定义,并在权重、激活值以及非线性查找表精度三个维度上评估了九个模型(包括 Qwen2.5-14B 和 Qwen3-30B-A3B)。研究发现,激活值精度和 RMSNorm 平方根倒数查找是 ZK 证明成本的主导因素,而传统的低比特量化启发式方法并不能转化为按比例的证明开销节省。