标签
一位用户突出了Buun在优化AI模型方面的工作,实现了在单张3090 GPU上对Qwen 3.6的高速推理,并为Qwen 3.8开发了DFlash2。
用户在Qwen3.8 27B模型上测试了DFlash2,报告称代码生成时的推理速度有所提升,但与MTP相比内存使用量增加。
DFlash 2,由 z-lab 开发的模型优化工具,现已支持 Qwen 3.8 27B 和 Muse Glimmer 模型,提升了文本生成能力。