@Darkolorin: 今天我们发布了Uzu中的推测解码实现。这是自实验室成立以来最大的发布。Init…
摘要
发布Uzu中的推测解码实现,初步支持Qwen3.6 27B,并即将支持Qwen3.8 27B和Muse Glimmer。
今天我们发布了Uzu中的推测解码实现。这是自实验室成立以来最大的发布。
初步针对Qwen3.6 27B,即将支持Qwen3.8 27B和Muse Glimmer。https://t.co/Wu9r8fFPCW
查看缓存全文
缓存时间: 2026/09/04 04:19
今天我们正式发布了Uzu中的推测解码实现。这是我们自成立以来最重要的版本更新。
当前首先支持Qwen3.6 27B模型,Qwen3.8 27B与Muse Glimmer支持也将很快推出。https://t.co/Wu9r8fFPCW
相似文章
针对 Qwen 的最快推测解码
一种针对 Qwen 模型的最快推测解码的新实现已可用,通过 Hugging Face 分支在 sglang 中得到支持,后续将在 uzu 引擎中获得支持。
@charles_irl:推测就是一切。在这篇博客中,我们宣布与Z Lab共同发布六款最新的DFla…
Modal和Z Lab发布了六款新的DFlash推测解码草稿模型,用于Qwen 3.x,在B200上实现了每秒超过1000个token,并认为推测解码是最有影响力的推理优化。
@Ex0byt: 各位,这是 Qwen3.6-27B-PRISM-PRO-DQ - 敬请享用!
发布了 Qwen3.6-27B-PRISM-PRO-DQ,这是 Qwen3.6-27B 的动态量化 GGUF 版本,去除了偏见/宣传内容,保留了原生 MTP 草稿头和视觉塔,支持无损推测解码以实现更快的推理。
Qwen3.6-27B 推测解码在更大量化下性能提升
Qwen3.6-27B 模型在使用更大量化级别时,推测解码性能提升,推理效率增强。
mudler/Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-APEX-MTP-GGUF 刚刚发布!
Mudler 发布了 Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled 模型的 APEX-MTP GGUF 量化版本,将多 token 预测头捆绑在一起,用于与 llama.cpp 的自推测解码。