包含DeepSeek-V4.1、视觉功能和推测解码的FreeToken分支(内含双3090性能数据)
摘要
一位开发者分享了FreeToken的分支版本,这是一个边缘原生的MoE服务引擎,新增了DeepSeek-V4.1支持、Qwen模型的视觉功能以及推测解码,包括在双RTX 3090硬件上的基准测试数据。
相似文章
Deepseek V4 Flash 在 RTX 5090 MoE 上运行
用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。
85 GB DeepSeek-V4-Flash 在 12 GB RTX 3060 + 64 GB DDR5 RAM 上以约 3 token/秒运行 - 为 FreeToken 设计的 Overspill,灵感来自 Colibri
Overspill 是一个为 FreeToken 设计的实验性磁盘层,它允许通过内存映射和缓存优化在有限的消费级硬件上运行像 DeepSeek-V4-Flash 这样的大型 MoE 模型,在一个配置有 12 GB GPU 和 64 GB RAM 的系统上实现大约 3 token/秒的速度。
在本地用4张老款RTX 2080 Ti运行DeepSeek-V4(2000美元预算配置)。自定义图灵内核、W8A8量化,以及255个预填充token/秒!
一位开发者成功在四张RTX 2080 Ti GPU上以2500美元预算本地运行DeepSeek-V4-Flash(总计284B,激活13B),通过自定义图灵CUDA内核、W8A8量化和异构推理实现了255个预填充token/秒。该实现已开源。
@aehyok: 分享一个开源项目 FreeToken 专门让超大 MoE 模型在消费级电脑上运行的本地推理引擎。 Qwen3.6 35B → 8GB RTX 4060 笔记本电脑 @ 39 tok/s DeepSeek-V4-Flash 284B → R…
FreeToken is an open-source local inference engine designed to run large Mixture-of-Experts (MoE) models on consumer-grade computers, offering significantly faster performance than alternatives like Ollama with easy installation and native GUI.
DeepSeek-V4-Flash-Vision-Exp (285B MoE) 在 10-12 张 RTX 3090 上 — 推测解码,视觉
在 10-12 张 RTX 3090 GPU 上运行 DeepSeek-V4-Flash-Vision-Exp 285B MoE 模型,可实现超过 60-120 tok/s 的解码速度,支持视觉和工具调用,文档完整,便于重现。