@MaxForAI: 卧槽,这个项目可以让你的4060跑大模型???? 来自 UC Berkeley、 MIT、UT Austin 的研究者,刚刚开源了 FreeToken:专门解决超大 MoE 模型在个人电脑上的推理框架。 根据官方的论文,目前已经跑出了几组…

X AI KOLs Timeline 工具

摘要

FreeToken是一个开源推理框架,由UC Berkeley、MIT和UT Austin的研究者开发,专门用于在个人电脑上运行超大MoE模型,通过动态分配GPU、CPU和内存资源实现高效推理。

卧槽,这个项目可以让你的4060跑大模型???? 来自 UC Berkeley、 MIT、UT Austin 的研究者,刚刚开源了 FreeToken:专门解决超大 MoE 模型在个人电脑上的推理框架。 根据官方的论文,目前已经跑出了几组很夸张的数据: Qwen3.6 35B → 8GB RTX 4060 笔记本 → 39.3 tok/s DeepSeek-V4-Flash 284B → RTX 5090 台式机 → 22~25 tok/s GLM-5.2 753B → RTX PRO 6000 工作站 → 约 15 tok/s 一台只有 8GB 显存的 4060 游戏本,35B 模型已经能跑到接近 40 tok/s。 这个速度甚至超过论文统计的 Codex 线上中位解码速度 33 tok/s。 FreeToken 的思路是把 GPU、CPU、系统内存、PCIe 全部拉进来一起干活。 因为 MoE 每个 token 实际只会激活少量 Expert,所以没必要把几百 B 参数全塞进显存。 FreeToken 会动态判断: 哪些常驻显存,哪些临时从内存搬到 GPU,哪些直接扔给 CPU 计算。 Prefill 时提前搬下一层 Expert,Decode 时再根据 CPU、GPU 和 PCIe 的实际速度动态分工。 甚至FreeToken还专门做了 Agent State Cache。 Agent 调工具、修改 Context、继续执行任务时,可以少做很多重复 Prefill。 所以 FreeToken 展示的 Demo 也非常明确: 写代码、读邮件、调用工具,甚至直接打游戏。 你完全可以在自己游戏电脑上挂一个开源大模型,再让 Claude Code、Codex 这类 Agent Harness 去调用。 以前大家折腾本地模型,还在研究「我的显卡到底能不能把这个模型加载起来」。 现在一张 4060,已经开始研究怎么养一个全天候本地 Agent 了。 消费级显卡跑前沿模型这件事,正在变得越来越实用了。 这个项目真牛逼啊,等我明天用办公室的电脑试一下
查看原文
查看缓存全文

缓存时间: 2026/08/21 23:16

卧槽,这个项目可以让你的4060跑大模型????

来自 UC Berkeley、 MIT、UT Austin 的研究者,刚刚开源了 FreeToken:专门解决超大 MoE 模型在个人电脑上的推理框架。

根据官方的论文,目前已经跑出了几组很夸张的数据:

Qwen3.6 35B → 8GB RTX 4060 笔记本 → 39.3 tok/s DeepSeek-V4-Flash 284B → RTX 5090 台式机 → 22~25 tok/s GLM-5.2 753B → RTX PRO 6000 工作站 → 约 15 tok/s

一台只有 8GB 显存的 4060 游戏本,35B 模型已经能跑到接近 40 tok/s。

这个速度甚至超过论文统计的 Codex 线上中位解码速度 33 tok/s。

FreeToken 的思路是把 GPU、CPU、系统内存、PCIe 全部拉进来一起干活。

因为 MoE 每个 token 实际只会激活少量 Expert,所以没必要把几百 B 参数全塞进显存。

FreeToken 会动态判断: 哪些常驻显存,哪些临时从内存搬到 GPU,哪些直接扔给 CPU 计算。

Prefill 时提前搬下一层 Expert,Decode 时再根据 CPU、GPU 和 PCIe 的实际速度动态分工。

甚至FreeToken还专门做了 Agent State Cache。

Agent 调工具、修改 Context、继续执行任务时,可以少做很多重复 Prefill。

所以 FreeToken 展示的 Demo 也非常明确:

写代码、读邮件、调用工具,甚至直接打游戏。

你完全可以在自己游戏电脑上挂一个开源大模型,再让 Claude Code、Codex 这类 Agent Harness 去调用。

以前大家折腾本地模型,还在研究「我的显卡到底能不能把这个模型加载起来」。

现在一张 4060,已经开始研究怎么养一个全天候本地 Agent 了。

消费级显卡跑前沿模型这件事,正在变得越来越实用了。

这个项目真牛逼啊,等我明天用办公室的电脑试一下

Shuo Yang (@Andy_ShuoYang): Your gaming PC can now serve frontier models at interactive speed using official checkpoints without extreme quantization!

Qwen3.6 35B → 8GB RTX 4060 laptop @ 39 tok/s

DeepSeek-V4-Flash 284B → RTX 5090 desktop @ 22-25 tok/s

GLM-5.2 753B → RTX PRO 6000 workstation @ 15 tok/s

相似文章

@Phoenixyin13: 这是全新的最佳美国开源模型。 Thinking Machines Lab 直接放出一个 975B 参数MoE 多模态巨兽,Apache-2.0 完全开源!在常规基准上,它甚至干掉了 NVIDIA 的 Nemotron 强项模型。 它的核心…

X AI KOLs Timeline

Thinking Machines Lab 发布了全新的 975B 参数 MoE 多模态开源模型,Apache-2.0 许可,在常规基准上超越 NVIDIA Nemotron,支持文本、图像、音频全模态,激活参数仅 41B,高效且友好部署。

@wlzh: 微软+宾大开源Multiplex Thinking:让大模型在岔路口"分身"再合体 核心思路一句话讲完:模型推理到关键决策点时,"分身"成K个探路者各走一条路,走完一步再融合回一个复合token继续推。K=3的话,一个token装三个人的…

X AI KOLs Timeline

微软和宾夕法尼亚大学开源Multiplex Thinking方法,让大模型在推理时分身成K路并行探索再合并,提升效率。在7B模型上实现AMC2023准确率破50%,AIME2025超55%。

@NFTCPS: 本地跑大模型这事,一看几百 GB 权重和显存要求,大多数人当场劝退,我以前也是。 colibri 直接换了个玩法,把显存、内存、硬盘当一个整体来调,权重按需从硬盘流式加载,纯 C 写、零依赖,已经 25000+ Star。 几个点说下: …

X AI KOLs Timeline

介绍colibri,一个纯C编写的开源推理引擎,能够将显存、内存和硬盘作为统一层次结构,流式加载大模型权重,支持多种前沿MoE模型在消费级硬件上本地运行,降低大模型使用门槛。