@xueyu1125: 想跑本地大模型,如果能达到 50 token/s,才比较可用 提供下顶尖模型 API 输出速度参考(Gemini Flash 300+) DeepSeek V4 Flash:99.5 token/s GPT-5.6 Sol:68.1 to…
摘要
讨论本地大模型运行所需的token速度标准,并提供了多个顶级AI模型的API输出速度对比。
查看缓存全文
缓存时间: 2026/08/18 18:37
想跑本地大模型,如果能达到 50 token/s,才比较可用🤣
提供下顶尖模型 API 输出速度参考(Gemini Flash 300+) DeepSeek V4 Flash:99.5 token/s GPT-5.6 Sol:68.1 token/s Grok 4.6:56.5 token/s Claude Opus 4.8 Anthropic:54.4 token/s https://t.co/WY50yLUEuz
相似文章
@aehyok: 分享一个开源项目 FreeToken 专门让超大 MoE 模型在消费级电脑上运行的本地推理引擎。 Qwen3.6 35B → 8GB RTX 4060 笔记本电脑 @ 39 tok/s DeepSeek-V4-Flash 284B → R…
FreeToken is an open-source local inference engine designed to run large Mixture-of-Experts (MoE) models on consumer-grade computers, offering significantly faster performance than alternatives like Ollama with easy installation and native GUI.
@berryxia: 我靠,肉眼都跟不上这个速度了! Daniel Han,UnslothAI创始人,YC S24,之前在NVIDIA做ML,刚刚把Qwen3.6的实验MTP GGUF放出来了。 27B模型单GPU直接跑到140 tokens/s。 35B-A…
UnslothAI创始人Daniel Han发布了Qwen3.6的实验性MTP GGUF版本,在消费级GPU上实现27B模型140 tokens/s、35B-A3B版本220 tokens/s,速度提升1.4倍且精度零损失。
@nicebabycat: https://x.com/nicebabycat/status/2091726637155103126
本文详细测试了Ling-3.0-tiny模型在Apple M5芯片Mac上的本地部署与性能,展示了在无独立显卡时以47 token/s的速度运行7.9B参数模型的可行性。
@RookieRicardoR: 国产模型再次突破,比肩 Claude 4.6,Gemini 3.1 Pro 等顶尖模型。 刚测完 Qwen3.7-Max,说几点真实感受。 昨晚 API 上线第一时间就充了值,选了三个题目(见视频)来测试 Qwen3.7-Max 的前端能…
用户测试了Qwen3.7-Max,认为其在前端、算力和Agent能力上比肩Claude 4.6和Gemini 3.1 Pro等顶尖模型,推理能力显著提升,且迭代速度月更,已成为国产第一梯队。
@svpino: DeepSeek-V4-Flash 在 Mac M5 Pro 上运行速率达到 5.71 token/秒。每天,我们都能在消费级硬件上运行更好的模型…
这条推文强调了 DeepSeek-V4-Flash 在 Mac M5 Pro 上以每秒 5.71 个 token 的速率运行,突显了消费级硬件上本地 AI 推理的进步,并提到了腾讯的开源 Palm-Infra 用于 Apple Silicon 优化。