标签
对Qwen3.6-35B在RTX 3090上的nvfp4、nvfp4-fast和AWQ 4位量化进行了基准测试,结果显示性能相近,而MTP头技巧将吞吐量提升了41%。
在4台DGX Spark机器上运行4-bit量化版GLM-5.2(753B MoE),Terminal-Bench 2.1得分为70.8%,而完整模型为81.0%。
FourTune提出了一个全4比特量化框架(W4A4G4),用于扩散模型的高效后训练,采用三分支混合流水线和自定义融合内核,在12B FLUX.1-dev上将内存减少2.25倍,吞吐量提升2.27倍,且无质量损失。
NVIDIA 的 4 位量化 Qwen3.6-27B 模型(NVFP4)据称接近无损,在四分之一大小下保持了全尺寸质量。
NVIDIA 的 4 位量化版 Qwen3.6-27B (NVFP4) 相较于完整的 bf16 模型被发现近乎无损,行为差异微小且随机而非系统性,使其成为实用的即插即用替代品。
DeepSeek V4 Flash 的 2位、3位和4位精度 GGUF 量化版本,已在 Hugging Face 上发布,可用于 llama.cpp 和 Ollama 等工具的本地推理。
文章质疑了Alpie Core 32B(一个针对低显存和智能体工作流优化的4位推理编码模型)的供应商基准测试的有效性,指出缺乏独立的基准测试复现。
UnslothAI 宣布,其 4-bit Qwen3.6 MTP GGUF 模型仅凭单个提示即可搜索超过70个网站,通过 Unsloth Studio 可在20GB内存上本地运行。此次更新增加了自动 MTP 和推测解码支持。
Cyankiwi 推出了其 AWQ 4-bit 量化方法的更新版本,该方法联合优化缩放因子和量化范围,在 Llama-3 模型上实现了比现有方法更低的 KL 散度。