@inco_ai: 希望您喜欢我们的首次发布!(更多精彩即将呈现)
摘要
Inco AI 宣布 DFlash 2,这是一项下一代解码技术,可在 M5 Max MacBook Pro 上为 Qwen3.8-27B 实现高达 4.6 倍的速度提升,提高效率而不改变输出。
查看缓存全文
缓存时间: 2026/08/19 06:38
希望你喜欢我们的首次发布!(还有更多即将到来)
刘志坚 (@zhijianliu_): DFlash 2 来了!在 M5 Max MacBook Pro 上,Qwen3.8-27B 模型能达到 70 tok/s 的速度。
⚡ 在输出结果相同的前提下,速度最高可达自回归解码的 4.6 倍。
这是 DFlash 的下一代产品,最初在 Z Lab 孕育,后在 Inco AI 完成升级。每次处理都能免费多获得一个被接受的 token!
相似文章
DFlash与Spec V2解码(14分钟阅读)
Z Lab、SGLang和Modal发布DFlash,这是一种针对Qwen 3.5 397B-A17B的新型投机解码模型,采用块扩散和KV注入技术,相较于基线实现超过4倍吞吐量提升,相较于原生MTP实现1.5倍提升。
@charles_irl:推测就是一切。在这篇博客中,我们宣布与Z Lab共同发布六款最新的DFla…
Modal和Z Lab发布了六款新的DFlash推测解码草稿模型,用于Qwen 3.x,在B200上实现了每秒超过1000个token,并认为推测解码是最有影响力的推理优化。
@dealignai: Qwen3.6-27b 和 35b 的 MXFP4 与 MXFP8 CRACK 版本现已推出,支持 MTP。尽享无审查的极速体验!35b mxfp4: https://huggingface…
DealignAI 发布了 Qwen3.6-27B 和 35B 模型的 CRACK-abliterated 以及 MXFP4/MXFP8 量化版本,保留了 MTP,可在 Apple Silicon 上实现更快的推测解码。
DeepSeek v4 Flash 0731 4bit 在 M5 Air 32gb 上:prefill 约50tps,decode 约1tps
一位用户分享了在32GB M5 MacBook Air上运行4比特量化DeepSeek v4 Flash的实验,通过流式专家等技巧实现了约50 tokens/s的prefill和1 tokens/s的decode。
z-lab/Qwen3.6-35B-A3B-DFlash
z-lab 发布 DFlash,一种基于轻量级块扩散模型的投机解码草稿器,可并行生成 15–16 个 token,为 Qwen3.6-35B-A3B 推理带来最高 2.9× 加速。