Freetokens项目令人印象深刻
摘要
一个新的名为FreeToken的开源项目已经发布,包含一篇研究论文和GitHub仓库,测试显示在消费级硬件上,其token处理速度可达约100个token每秒。
一个新项目昨天发布,我今天有机会测试它。论文:https://arxiv.org/abs/2608.16157 GitHub:https://github.com/FlashML-org/FreeToken 我使用以下配置进行了初步测试:RTX 5080 (16 GB) DDR6 64GB AMD Ryzen 9 9950X3D 在QWEN3.6-35B-A3B NVFP4(20GB - 无法放入我的显存)上,我得到了100个token/秒。你已经尝试过了吗?(下面是一个1028个token的提示示例 - 约110个token/秒)https://preview.redd.it/x21sl7oo2wkh1.png?width=833&format=png&auto=webp&s=7372da17978de714ac95d464f340bb24017cab80
相似文章
Gigatoken: 一个新的开源分词器,比Tiktoken快约100倍,比Huggingface快500-1000倍
Gigatoken 是一个开源分词器,通过SIMD和缓存优化,相对于HuggingFace分词器实现了高达1000倍的加速,相对于Tiktoken实现了100倍加速。它支持作为现有分词器API的直接替代。
FreeToken:高效边缘原生MoE服务与带宽自适应执行
FreeToken是一个边缘原生服务系统,它将计算和模型状态动态映射到异构本地硬件上,以在个人机器上运行大型开放权重模型,使得在单个GPU上高效执行高达753B参数的模型成为可能。
FreeToken: 高效边缘原生 MoE 服务(24分钟阅读)
FreeToken 是一个边缘原生的 Mixture of Experts 服务系统,通过自适应管理异构边缘设备的资源,高效地在消费级硬件上运行大型开源权重模型。
Gigatoken (GitHub Repo)
Gigatoken 是一个即插即用的替代 tokenizer,声称相比 HuggingFace 的 tokenizer 速度提升高达 1000 倍,支持许多常见的 tokenizer 和 CPU。
N tokens per second 到底有多快?
一个网页工具,让用户直观体验不同LLM token生成速率(例如5–800 tok/s)在代码、文本、推理和智能体模式下的表现,帮助内化基准测试中的性能数据。