@inco_ai: 希望您喜欢我们的首次发布!(更多精彩即将呈现)

X AI KOLs Timeline 模型

摘要

Inco AI 宣布 DFlash 2,这是一项下一代解码技术,可在 M5 Max MacBook Pro 上为 Qwen3.8-27B 实现高达 4.6 倍的速度提升,提高效率而不改变输出。

希望您喜欢我们的首次发布!(更多精彩即将呈现)
查看原文
查看缓存全文

缓存时间: 2026/08/19 06:38

希望你喜欢我们的首次发布!(还有更多即将到来)

刘志坚 (@zhijianliu_): DFlash 2 来了!在 M5 Max MacBook Pro 上,Qwen3.8-27B 模型能达到 70 tok/s 的速度。

⚡ 在输出结果相同的前提下,速度最高可达自回归解码的 4.6 倍。

这是 DFlash 的下一代产品,最初在 Z Lab 孕育,后在 Inco AI 完成升级。每次处理都能免费多获得一个被接受的 token!

相似文章

DFlash与Spec V2解码(14分钟阅读)

TLDR AI

Z Lab、SGLang和Modal发布DFlash,这是一种针对Qwen 3.5 397B-A17B的新型投机解码模型,采用块扩散和KV注入技术,相较于基线实现超过4倍吞吐量提升,相较于原生MTP实现1.5倍提升。

z-lab/Qwen3.6-35B-A3B-DFlash

Hugging Face Models Trending

z-lab 发布 DFlash,一种基于轻量级块扩散模型的投机解码草稿器,可并行生成 15–16 个 token,为 Qwen3.6-35B-A3B 推理带来最高 2.9× 加速。