awq

标签

Cards List
#awq

@akshay_pachaar: 如果必须将70B模型适配到单个GPU上,我会学习的LLM量化技术:(收藏此帖) FP16的70B模型……

X AI KOLs Following · 2026-07-22 缓存

一条推文介绍了五种关键的LLM量化技术(RTN, GPTQ, AWQ, LLM.int8(), QAT),用于在有限硬件上适配大型模型,并引用了一篇综合性研究论文。

0 人收藏 0 人点赞
#awq

为什么AutoRound被严重忽视?

Reddit r/LocalLLaMA · 2026-06-21

一位用户质疑为什么AutoRound——这款在低位宽下精度保留出色且能直接导出GGUF的量化工具,尽管在复杂模型(如Qwen3.6 27B)上表现优于标准AWQ和RTN,却仍然被忽视。

0 人收藏 0 人点赞
#awq

在4090上以高达475t/s运行DiffusionGemma 26b……以及一些想法

Reddit r/LocalLLaMA · 2026-06-18

一位用户分享了他们在4090 GPU上通过vLLM运行DiffusionGemma 26B的经验,速度高达475t/s,但指出了单用户限制、准确度较低和上下文短等缺点,并认为它不值得替代常规的26B模型。

0 人收藏 0 人点赞
#awq

介绍 cyankiwi AWQ 4-bit 量化——26.05 更新

Reddit r/LocalLLaMA · 2026-05-14

Cyankiwi 推出了其 AWQ 4-bit 量化方法的更新版本,该方法联合优化缩放因子和量化范围,在 Llama-3 模型上实现了比现有方法更低的 KL 散度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈