标签
本文评估了LLM推理中INT8量化的一致性测试套件,发现二的幂次量化缩放能够实现跨内核的位级确定性,而基于容差的检查仅限于预条件和有界性。
本文将 SmoothQuant 集成到 PyTorch 的原生栈中,以在 Intel Xeon CPU 上高效进行小型 NLP 模型的 INT8 推理,实现了高达 5.8 倍的加速,且精度损失可忽略不计。
本文测试了CUTLASS和Triton INT8量化GPU内核在LLM推理中使用vLLM的可互换性,发现由于尺度应用和舍入导致输出发散,并提出了一种内核等效的一致性程序。
ComfyUI v0.27.0でネイティブ対応されたINT8 ConvRot量子化手法について、FP8を超える性能報告やモデル格納形式の分類を含む技術解説記事。