int4

标签

Cards List
#int4

两个标志将官方Ling-3.0-flash INT4在单个DGX Spark上的推理速度从20.8提升到38.7 tok/s

Reddit r/LocalLLaMA · 2026-08-09

本文介绍了两个配置标志,它们将官方Ling-3.0-flash INT4在单个DGX Spark上的推理速度从20.8 tok/s提升到38.7 tok/s,同时提醒需要使用特定的vLLM分支,并指出在长上下文性能方面的权衡。

0 人收藏 0 人点赞
#int4

unsloth/Qwen3.6-27B-NVFP4 vs. Intel/Qwen3.6-27B-int4-AutoRound vs. nvidia/Qwen3.6-27B-NVFP4 —— 该选哪一个?

Reddit r/LocalLLaMA · 2026-07-30

本文比较了 Qwen3.6-27B 的三种量化变体(Unsloth 和 Nvidia 的 NVFP4,Intel 的 int4-AutoRound),并向社区请求基准测试和幻觉数据。

0 人收藏 0 人点赞
#int4

在 PrismaQuant 上对 RTX Pro 4500(使用 Oculink)的 INT4 Autoround 和 NVFP4 W4A4 量化模型的一些测试

Reddit r/LocalLLaMA · 2026-07-11

报告了在 PrismaQuant 上使用 Oculink 对 RTX Pro 4500 GPU 进行 INT4 Autoround 和 NVFP4 W4A4 量化模型的测试。

0 人收藏 0 人点赞
#int4

jlnsrk/GLM-5.2-colibri-int4

Hugging Face Models Trending · 2026-07-06 缓存

针对GLM-5.2 744B MoE模型的预转换int4量化权重,旨在使用colibrì引擎在约25GB内存的消费级硬件上运行。

0 人收藏 0 人点赞
#int4

40+ token/秒 - 在单台 DGX Spark 上使用 vLLM 运行 Qwen 3.5 122B Int4 的优化方案

Reddit r/LocalLLaMA · 2026-05-20

用户分享了一种在单台 DGX Spark 上使用 vLLM 运行 Qwen 3.5 122B Int4 的优化方案,实现了每秒超过 40 个 token 的速度。他们邀请其他人尝试并进一步优化。

0 人收藏 0 人点赞
#int4

Qwen3.6-27B 各量化格式 KLD 对比:INT 与 NVFP

Reddit r/LocalLLaMA · 2026-04-22

Reddit 帖子对比了 Qwen3.6-27B 的多种量化版本(INT4、NVFP4、BF16-INT4),展示不同场景下内存占用与精度的权衡。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈