我们基于Hy3 295B的1位量化版本比云端API运行快2.2倍,且质量无损
摘要
Hy3 295B模型的1位量化版本在推理速度上比云端API快2.2倍,且质量无损
暂无内容
相似文章
@atomic_chat_hq: 在本地运行1位Hy3,速度比其API快2.2倍,质量相同!我们为两个模型分配了相同的任务并比较…
腾讯的Hy3 295B模型现已提供1位和4位GGUF格式,相比云端API,本地推理速度提升2.2倍,同时保持质量,如在4块RTX 5090显卡(128GB显存)上所展示的。
2.5倍更快的Qwen3.6 NVFP4 Unsloth量化版本
Unsloth推出使用NVFP4格式的量化Qwen3.6模型,推理速度提升2.5倍。
@anirudhbv_ce: 介绍 SpectralQuant.. 来拯救您的 KV 缓存 :)
SpectralQuant 是一种新的 KV 缓存量化技术,在 Mistral 7B 上实现了 5.95 倍压缩,仅带来 7.5% 的困惑度开销,显著优于 TurboQuant,且每个模型只需 15 秒校准。
Hy3 1Bit 89-93 GB
Hy3 1-bit量化模型的公告,内存占用89-93 GB。
@Tono_Ken3: 在GPU上驱动Qwen3.6-27b(100 TPS),同时在CPU上驱动Hy3-299B(25 TPS),本地LLM推理计算新时代的曙光…
演示同时在GPU上以100 TPS运行Qwen3.6-27b,在CPU上以25 TPS运行Hy3-299B,标志着本地LLM推理的一个里程碑。