包含DeepSeek-V4.1、视觉功能和推测解码的FreeToken分支(内含双3090性能数据)

Reddit r/LocalLLaMA 工具

摘要

一位开发者分享了FreeToken的分支版本,这是一个边缘原生的MoE服务引擎,新增了DeepSeek-V4.1支持、Qwen模型的视觉功能以及推测解码,包括在双RTX 3090硬件上的基准测试数据。

我已经在自己的双3090机器上运行FreeToken一段时间了,最终维护了一个分支版本。发布出来以防对其他人有用。如果你还没用过,快速了解一下:FreeToken是一个边缘原生的MoE服务引擎。它将专家卸载到主机RAM/NVMe,并在CPU和GPU上协同执行,因此你可以在消费级硬件上运行大型MoE模型。上游版本在这里:https://github.com/FlashML-org/FreeToken 我在上游基础上新增的功能: - DeepSeek-V4.1-Flash(mHC、CSA2稀疏注意力、lightning索引器、Engram n-gram内存、DSpark草稿) - Qwen3.8-Flash-Next的视觉功能,包括端到端OpenAI image_url输入 - 推测解码:MTP草稿头(嵌入式或外部工件)、拒绝采样、提交已接受前缀而非重新扩展、可选轮次链接 - FTW(快速权重格式)现在携带侧面表(PLE/Engram)和MTP头,以及TP切片 - 几个模型系列的张量并行加载,可选fp8全归约 - 重新设计了量化配置层,使每个模块的方案来自同一位置 - 各种修复(FTW TP频带偏移、O_DIRECT读取、调度器规格预算、Engram哈希) 供参考的我的机器配置: - 2x RTX 3090(每个24GB,PCIe x16),张量并行 = 2 - AMD EPYC 7203P,8核/16线程,8x DDR4-2400 - 模型:nvidia/Qwen3.8-Flash-Next-NVFP4转换为FTW格式(512个专家,卸载) - 服务标志:--moe-strategy offload --tensor-parallel-size 2 --moe-cache-auto --ple-backend pinned --expert-load parallel --max-prefill-length 8192 --disable-moe-prefill-overlap 基准测试(256个输出token,5次运行,固定提示,平均/中位数 tok/s): - 贪婪模式,MTP关闭:48.0 / 52.4 - 采样模式(温度0.8),MTP关闭:46.2 / 50.9 - 贪婪模式,MTP开启:21.5 / 22.4(接受率约56%) - 采样模式,MTP开启:34.0 / 43.8(MTP默认在采样模式下关闭) 因此,在普通路径上启用CUDA图时,MTP在此配置下目前净损失。在匹配条件下(急切模式,无重叠),它是普通路径的约1.5倍(17.2 vs 11.4),并且每个批量大小的验证图在独立运行中将MTP路径从16 tok/s提升到28 tok/s。那个验证图是我目前关注的重点,尚未声称胜利。仍然像上游一样只提供文本服务;视觉是我接线实现的功能。DeepSeek-V4.1默认将Engram表保留在磁盘上,因此需预留空间。 仓库(匿名分支,Apache-2.0,保留上游署名):https://github.com/anon761/freetoken 这是一个分支,不是上游,因此可能有不完善之处。如果你尝试后出现问题,请在此回复或开启issue,我会查看。也好奇大家接下来想用哪些模型或量化格式。
查看原文

相似文章

Deepseek V4 Flash 在 RTX 5090 MoE 上运行

Reddit r/LocalLLaMA

用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。