Freetokens项目令人印象深刻

Reddit r/LocalLLaMA 工具

摘要

一个新的名为FreeToken的开源项目已经发布,包含一篇研究论文和GitHub仓库,测试显示在消费级硬件上,其token处理速度可达约100个token每秒。

一个新项目昨天发布,我今天有机会测试它。论文:https://arxiv.org/abs/2608.16157 GitHub:https://github.com/FlashML-org/FreeToken 我使用以下配置进行了初步测试:RTX 5080 (16 GB) DDR6 64GB AMD Ryzen 9 9950X3D 在QWEN3.6-35B-A3B NVFP4(20GB - 无法放入我的显存)上,我得到了100个token/秒。你已经尝试过了吗?(下面是一个1028个token的提示示例 - 约110个token/秒)https://preview.redd.it/x21sl7oo2wkh1.png?width=833&format=png&auto=webp&s=7372da17978de714ac95d464f340bb24017cab80
查看原文

相似文章

FreeToken:高效边缘原生MoE服务与带宽自适应执行

Hugging Face Daily Papers

FreeToken是一个边缘原生服务系统,它将计算和模型状态动态映射到异构本地硬件上,以在个人机器上运行大型开放权重模型,使得在单个GPU上高效执行高达753B参数的模型成为可能。

Gigatoken (GitHub Repo)

TLDR AI

Gigatoken 是一个即插即用的替代 tokenizer,声称相比 HuggingFace 的 tokenizer 速度提升高达 1000 倍,支持许多常见的 tokenizer 和 CPU。

N tokens per second 到底有多快?

Hacker News Top

一个网页工具,让用户直观体验不同LLM token生成速率(例如5–800 tok/s)在代码、文本、推理和智能体模式下的表现,帮助内化基准测试中的性能数据。