标签
QUASAR是一种量化感知训练方法,通过使用损失感知重建来降低损失下限,提升大型语言模型中低比特模型的性能,在2-4比特时实现显著的精度增益。
提出了 CurveFP,一种闭合乘积码本族,将量化幅度分布在交叉对数曲线上,实现精确的符号异或和整数索引更新。它以七位推理达到 FP8 类行为,并在 7B-9B 模型上改善了困惑度。
本文提出了HiFloat4格式和Rollout-ResQ,用于LLM的端到端FP4强化学习后训练,在Qwen2.5模型上实现了与BF16相比仅1.1%的准确率差距。
本文研究了对递归推理模型的量化,其中权重共享块被重复使用,发现每张量4位量化会导致灾难性漂移,但每块缩放(如MXInt4)能恢复准确性,且更深层的架构更为敏感。
本文介绍了一种低精度(NVFP4)强化学习训练的方法,平衡了吞吐量和稳定性,解决了前向和后向传播量化误差的问题。
详细剖析了NVIDIA GPU编程从Volta到Blackwell的演变,重点突出了从同步线程模型到异步数据流的转变以及喂饱张量核心的挑战。文章讨论了TMA、TMEM和tcgen05 MMA等新硬件特性,并展示了FlashAttention-3和FlashMLA等现代内核如何利用这些变化实现更高利用率。
dMX 是一个可微分混合精度量化框架,能够为大型语言模型逐层学习最优的浮点位宽分配,目标是由 OCP 标准定义的 MXFP 系列格式。它采用基于温度的退火策略和预算感知的正则化项进行连续优化,在 Llama、Qwen3 和 SmolLM2 模型上始终优于基于 KL 散度的启发式方法。
Mix-Quant 提出了一种面向智能体大语言模型的阶段感知量化框架,在预填充阶段使用 NVFP4 量化以加速计算,同时在解码阶段保持 BF16 精度以维持准确性。该方法在智能体基准测试中实现了预填充速度提升最高 3 倍,且性能下降极小。
来自 Modal 的 LLM Engineer's Almanac,提供了一个互动探索器,用于理解 bf16 和 fp4 等低精度浮点数格式。