int8-quantization

标签

Cards List
#int8-quantization

跨GPU内核的确定性LLM推理:二的幂次INT8量化缩放与基于容差一致性检查的局限性

arXiv cs.LG · 2026-09-02 缓存

本文评估了LLM推理中INT8量化的一致性测试套件,发现二的幂次量化缩放能够实现跨内核的位级确定性,而基于容差的检查仅限于预条件和有界性。

0 人收藏 0 人点赞
#int8-quantization

利用 PyTorch 原生栈在服务器 CPU 上高效进行小型 NLP 模型的 INT8 推理

arXiv cs.CL · 2026-08-20 缓存

本文将 SmoothQuant 集成到 PyTorch 的原生栈中,以在 Intel Xeon CPU 上高效进行小型 NLP 模型的 INT8 推理,实现了高达 5.8 倍的加速,且精度损失可忽略不计。

0 人收藏 0 人点赞
#int8-quantization

整数不在场证明:定位INT8量化LLM推理中的跨核发散

arXiv cs.LG · 2026-08-17 缓存

本文测试了CUTLASS和Triton INT8量化GPU内核在LLM推理中使用vLLM的可互换性,发现由于尺度应用和舍入导致输出发散,并提出了一种内核等效的一致性程序。

0 人收藏 0 人点赞
#int8-quantization

Explanation of INT8 ConvRot (FP8 is no longer needed)

Hacker News Top · 2026-08-03 缓存

ComfyUI v0.27.0でネイティブ対応されたINT8 ConvRot量子化手法について、FP8を超える性能報告やモデル格納形式の分類を含む技術解説記事。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈