10 tokens per second 到底有多快?
摘要
Simon Willison 探讨了 10 tokens per second 速度对于大型语言模型的实际意义,提供了关于这种速度感觉有多快以及其对可用性的影响的背景信息。
暂无内容
查看缓存全文
缓存时间: 2026/05/20 18:38
# 10 tokens per second到底有多快?
来源:https://simonwillison.net/2026/May/20/tokens-per-second/
本文是Simon Willison的**链接博文**,发布于 **2026年5月20日**(https://simonwillison.net/2026/May/20/)
ai2028(https://simonwillison.net/tags/ai/)generative-ai1795(https://simonwillison.net/tags/generative-ai/)llms1761(https://simonwillison.net/tags/llms/)
### 月度简报
赞助我 **$10/月**,即可获得当月最重要LLM进展的邮件摘要。
花钱让我少给你发邮件!
赞助与订阅(https://github.com/sponsors/simonw/)
相似文章
N tokens per second 到底有多快?
一个网页工具,让用户直观体验不同LLM token生成速率(例如5–800 tok/s)在代码、文本、推理和智能体模式下的表现,帮助内化基准测试中的性能数据。
直观感受每秒 X 个 token 的实际速度
作者介绍了一款基于 Web 的脚本,旨在通过模拟文本、代码和推理生成的速率,帮助用户直观理解本地大语言模型(LLM)部署中的每秒 token 数(tokens per second)性能。
思路:在CPU上,解码速度取决于每个token的活跃参数,而非总参数。我的目标是尝试在中等配置PC(无GPU)上以100tok/s运行一个10B模型。
提出了CPU解码速度取决于每个token的活跃参数而非总参数的见解,并提出一个使用三元权重和细粒度MoE的10B参数模型,以在中等配置PC上实现高token速率。报告了沙箱测量结果,显示在8.3M模型上速度从176 tok/s提升到848 tok/s,且质量损失极小。
Token 最大化
讨论在大型语言模型中最大化 Token 使用以提高效率和输出质量的策略与技术。
GigaToken:语言模型分词速度提升约1000倍
GigaToken 是一个超快速的分词器库,声称比 HuggingFace 分词器快达 1000 倍,支持大多数常见的大语言模型分词器,并提供即插即用的兼容性。