throughput

标签

Cards List
#throughput

RTX 5090 搭配 Qwen3.6 能否达到 > 3,000 tok/s?欢迎来拍砖(open-dllm)

Reddit r/LocalLLaMA · 2026-05-16

Open-dLLM 将 Qwen3.6 适配为使用扩散式生成,在 RTX 5090 上对于短序列实现了超过 3,000 tok/s 的吞吐量,相关代码已在 GitHub 上发布。

0 人收藏 0 人点赞
#throughput

@QuixiAI:@Kimi_Moonshot K2.6 在我的 mi300x 上跑出了 56 tps(单请求),接下来做吞吐测试

X AI KOLs Following · 2026-04-21 缓存

Kimi K2.6 在单张 MI300X GPU 上达到 56 token/s,用户计划进一步测试整体吞吐。

0 人收藏 0 人点赞
#throughput

@sanbuphy: K2.6 成功在 Mac 本地下载并部署了 Qwen3.5-0.8B 模型,通过使用小众 Zig 语言实现并优化模型推理,证明了新模型的泛化能力。经过 4,000 多次工具调用,超过 12 小时的不间断运行,K2.6 模型共迭代了 14 …

X AI KOLs Timeline · 2026-04-21 缓存

K2.6在Mac本地成功部署Qwen3.5-0.8B模型,使用Zig语言实现推理优化,经过14轮迭代将吞吐量从约15 tokens/s提升至约193 tokens/s,比LM Studio快20%。

0 人收藏 0 人点赞
#throughput

slow → fast computers

YouTube AI Channels · 2026-06-25 缓存

文章介绍了《系统性能》书中关于延迟、吞吐量、缓存层级等核心概念,并引用了Jeff Dean等专家的延迟数字资源,强调动手实践对性能工程的重要性。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈