我们基于Hy3 295B的1位量化版本比云端API运行快2.2倍,且质量无损
摘要
Hy3 295B模型的1位量化版本在推理速度上比云端API快2.2倍,且质量无损
暂无内容
相似文章
@atomic_chat_hq: 在本地运行1位Hy3,速度比其API快2.2倍,质量相同!我们为两个模型分配了相同的任务并比较…
腾讯的Hy3 295B模型现已提供1位和4位GGUF格式,相比云端API,本地推理速度提升2.2倍,同时保持质量,如在4块RTX 5090显卡(128GB显存)上所展示的。
Hy4的官方1位量化版本??? 👀
本文介绍了Hy4预览模型的官方1位量化构建版本,提供尺寸减小的GGUF文件,以及在修改后的llama.cpp上运行的说明。
我们量化了新的 Ornith 1.5 9B 和 35B-A3B
本文详细介绍了使用 Atomic Dynamic 方法对 Ornith 1.5 9B 和 35B-A3B AI 模型进行量化,提供了与标准量化的基准对比,并分享了 Hugging Face 集合。
2.5倍更快的Qwen3.6 NVFP4 Unsloth量化版本
Unsloth推出使用NVFP4格式的量化Qwen3.6模型,推理速度提升2.5倍。
@anirudhbv_ce: 介绍 SpectralQuant.. 来拯救您的 KV 缓存 :)
SpectralQuant 是一种新的 KV 缓存量化技术,在 Mistral 7B 上实现了 5.95 倍压缩,仅带来 7.5% 的困惑度开销,显著优于 TurboQuant,且每个模型只需 15 秒校准。