FreeToken:高效边缘原生MoE服务与带宽自适应执行
摘要
FreeToken是一个边缘原生服务系统,它将计算和模型状态动态映射到异构本地硬件上,以在个人机器上运行大型开放权重模型,使得在单个GPU上高效执行高达753B参数的模型成为可能。
查看缓存全文
缓存时间: 2026/08/19 03:55
论文页面 - FreeToken:面向带宽自适应执行的高效边缘原生MoE服务系统
来源:https://huggingface.co/papers/2608.16157 作者:
,
,
,
,
,
,
,
,
,
,
摘要
FreeToken是一个边缘原生的混合专家(Mixture-of-Experts,MoE)服务系统,能够动态地将计算任务和模型状态映射到异构本地硬件上,从而在个人设备上运行大型开放权重模型。
前沿开放权重模型(https://huggingface.co/papers?q=open-weight%20models)日益普及,但服务这些模型仍然主要依赖于数据中心基础设施。我们提出了FreeToken,一个边缘原生的MoE服务(https://huggingface.co/papers?q=MoE%20serving)系统,它将个人设备视为一个统一、弹性的推理平台,而非一个小型GPU。FreeToken围绕本地AI的两大现实,协同设计了完整的服务栈,包括模型布局与加载、专家驻留(https://huggingface.co/papers?q=expert%20residency)、CPU-GPU执行、智能体状态复用(https://huggingface.co/papers?q=agentic%20state%20reuse)以及运行时内存管理(https://huggingface.co/papers?q=runtime%20memory%20management):智能体工作负载的执行模式持续变化,而边缘硬件则提供每台机器平衡度各异的异构资源。FreeToken并非采用固定的卸载策略(https://huggingface.co/papers?q=offloading%20strategy),而是持续将计算任务和模型状态映射到实际可用的资源上。FreeToken支持超过20种MoE模型以及实际的编码和工具使用智能体,运行在硬件范围从8GB笔记本GPU到单个工作站GPU的设备上。更重要的是,它改变了这些机器实际能够服务的模型规模:从笔记本上运行35B模型,到游戏桌面电脑上运行284B模型,乃至在单个工作站GPU上运行753B的GLM-5.2。FreeToken将开放权重转化为可部署的本地软件,使用户已拥有的机器成为实践前沿规模智能的实用平台。我们在 flashml.ai 发布了该系统。
查看 arXiv 页面 (https://arxiv.org/abs/2608.16157)查看 PDF (https://arxiv.org/pdf/2608.16157)项目页面 (https://www.flashml.ai/)GitHub (https://github.com/FlashML-org/FreeToken)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16157)
在您的智能体中获取此论文:
hf papers read 2608\.16157
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.16157 即可从本页链接该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.16157 即可从本页链接该数据集。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.16157 即可从本页链接该 Space。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection)即可从本页链接它。
相似文章
FreeToken: 高效边缘原生 MoE 服务(24分钟阅读)
FreeToken 是一个边缘原生的 Mixture of Experts 服务系统,通过自适应管理异构边缘设备的资源,高效地在消费级硬件上运行大型开源权重模型。
尝试预测下一个token会用到哪些MoE专家来加速CPU/GPU offload,得到了一些实际数据,这真的可实现吗还是我在浪费时间(30tg/s -> 150-200tg/s)
探索通过预测下一个token将使用的MoE专家来改进CPU/GPU offload,实现了30->150-200 tg/s的加速,并质疑实现可行性。
先共享,再路由剩余:一种面向Token自适应MoE计算的统一框架
本文提出UniF-MoE,一种用于Token自适应混合专家计算的统一框架,该框架首先共享专家间的可复用计算,然后路由剩余的残余需求,从而在DomainBed和GLUE基准上提升性能,同时减少激活计算量、延迟和内存占用。
我以为在标准智能手机上运行大规模模型已经非常了不起了,但
bigedgeonmoe开源代码库的创建者使得在移动设备和消费级PC上运行大规模MoE模型(高达120B参数)成为可能,在中端手机上实现了Qwen 35B模型每秒6个token的速度。
LFM2.5 230M 使用自定义 WebGPU 内核在浏览器中以 1,400 tok/s 运行
LFM2.5 230M 模型使用自定义 WebGPU 内核在浏览器中实现每秒 1,400 个 token,展示了高效的本地推理。