@MaxForAI: 卧槽,这个项目可以让你的4060跑大模型???? 来自 UC Berkeley、 MIT、UT Austin 的研究者,刚刚开源了 FreeToken:专门解决超大 MoE 模型在个人电脑上的推理框架。 根据官方的论文,目前已经跑出了几组…
摘要
FreeToken是一个开源推理框架,由UC Berkeley、MIT和UT Austin的研究者开发,专门用于在个人电脑上运行超大MoE模型,通过动态分配GPU、CPU和内存资源实现高效推理。
查看缓存全文
缓存时间: 2026/08/21 23:16
卧槽,这个项目可以让你的4060跑大模型????
来自 UC Berkeley、 MIT、UT Austin 的研究者,刚刚开源了 FreeToken:专门解决超大 MoE 模型在个人电脑上的推理框架。
根据官方的论文,目前已经跑出了几组很夸张的数据:
Qwen3.6 35B → 8GB RTX 4060 笔记本 → 39.3 tok/s DeepSeek-V4-Flash 284B → RTX 5090 台式机 → 22~25 tok/s GLM-5.2 753B → RTX PRO 6000 工作站 → 约 15 tok/s
一台只有 8GB 显存的 4060 游戏本,35B 模型已经能跑到接近 40 tok/s。
这个速度甚至超过论文统计的 Codex 线上中位解码速度 33 tok/s。
FreeToken 的思路是把 GPU、CPU、系统内存、PCIe 全部拉进来一起干活。
因为 MoE 每个 token 实际只会激活少量 Expert,所以没必要把几百 B 参数全塞进显存。
FreeToken 会动态判断: 哪些常驻显存,哪些临时从内存搬到 GPU,哪些直接扔给 CPU 计算。
Prefill 时提前搬下一层 Expert,Decode 时再根据 CPU、GPU 和 PCIe 的实际速度动态分工。
甚至FreeToken还专门做了 Agent State Cache。
Agent 调工具、修改 Context、继续执行任务时,可以少做很多重复 Prefill。
所以 FreeToken 展示的 Demo 也非常明确:
写代码、读邮件、调用工具,甚至直接打游戏。
你完全可以在自己游戏电脑上挂一个开源大模型,再让 Claude Code、Codex 这类 Agent Harness 去调用。
以前大家折腾本地模型,还在研究「我的显卡到底能不能把这个模型加载起来」。
现在一张 4060,已经开始研究怎么养一个全天候本地 Agent 了。
消费级显卡跑前沿模型这件事,正在变得越来越实用了。
这个项目真牛逼啊,等我明天用办公室的电脑试一下
Shuo Yang (@Andy_ShuoYang): Your gaming PC can now serve frontier models at interactive speed using official checkpoints without extreme quantization!
Qwen3.6 35B → 8GB RTX 4060 laptop @ 39 tok/s
DeepSeek-V4-Flash 284B → RTX 5090 desktop @ 22-25 tok/s
GLM-5.2 753B → RTX PRO 6000 workstation @ 15 tok/s
相似文章
@aehyok: 分享一个开源项目 FreeToken 专门让超大 MoE 模型在消费级电脑上运行的本地推理引擎。 Qwen3.6 35B → 8GB RTX 4060 笔记本电脑 @ 39 tok/s DeepSeek-V4-Flash 284B → R…
FreeToken is an open-source local inference engine designed to run large Mixture-of-Experts (MoE) models on consumer-grade computers, offering significantly faster performance than alternatives like Ollama with easy installation and native GUI.
@AISuperDomain: 别再为了跑大模型去买多卡工作站了! 开源推理引擎 FreeToken 把 CPU、GPU、内存统合为一体: 8G 显存轻薄本 跑 35B MoE,家用单卡游戏本直接干 290B+! 彻底解决显存塞不下的难题,开源免费: #AI #LLM …
开源推理引擎FreeToken将CPU、GPU和内存统合为一体,使消费级硬件如8G显存笔记本能运行35B MoE模型,家用单卡游戏本可运行290B+模型,彻底解决显存限制。
@Phoenixyin13: 这是全新的最佳美国开源模型。 Thinking Machines Lab 直接放出一个 975B 参数MoE 多模态巨兽,Apache-2.0 完全开源!在常规基准上,它甚至干掉了 NVIDIA 的 Nemotron 强项模型。 它的核心…
Thinking Machines Lab 发布了全新的 975B 参数 MoE 多模态开源模型,Apache-2.0 许可,在常规基准上超越 NVIDIA Nemotron,支持文本、图像、音频全模态,激活参数仅 41B,高效且友好部署。
@wlzh: 微软+宾大开源Multiplex Thinking:让大模型在岔路口"分身"再合体 核心思路一句话讲完:模型推理到关键决策点时,"分身"成K个探路者各走一条路,走完一步再融合回一个复合token继续推。K=3的话,一个token装三个人的…
微软和宾夕法尼亚大学开源Multiplex Thinking方法,让大模型在推理时分身成K路并行探索再合并,提升效率。在7B模型上实现AMC2023准确率破50%,AIME2025超55%。
@NFTCPS: 本地跑大模型这事,一看几百 GB 权重和显存要求,大多数人当场劝退,我以前也是。 colibri 直接换了个玩法,把显存、内存、硬盘当一个整体来调,权重按需从硬盘流式加载,纯 C 写、零依赖,已经 25000+ Star。 几个点说下: …
介绍colibri,一个纯C编写的开源推理引擎,能够将显存、内存和硬盘作为统一层次结构,流式加载大模型权重,支持多种前沿MoE模型在消费级硬件上本地运行,降低大模型使用门槛。