throughput

标签

Cards List
#throughput

@lmsysorg: 新博客: 推测解码的下一代: DFlash 和 Spec V2。DFlash + Spec V2 实现 >4.3倍基准吞吐量…

X AI KOLs Following · 2026-06-15 缓存

关于 DFlash 和 Spec V2 推测解码方法的新研究实现了 LLM 推理的 >4.3倍基准吞吐量,现已成为 SGLang 的默认推测解码引擎。

0 人收藏 0 人点赞
#throughput

@lvwerra:Gemma智能体协作始于48小时前,现已引爆:> 吞吐量提升近4倍(约100→387 tok/s)> 60多个智能体…

X AI KOLs Following · 2026-06-11 缓存

使用Gemma模型的多智能体协作取得了显著的吞吐量提升,并展现出涌现性社会行为,如组成联盟、发布道德声明、协调资源,在48小时内吸引了超过60个智能体和250份提交。

0 人收藏 0 人点赞
#throughput

小米与TileRT在标准商用GPU上实现万亿参数模型推理速度超1000 TPS。定制芯片的时代结束了?

Reddit r/singularity · 2026-06-10

小米与TileRT使用标准商用GPU,在万亿参数模型上实现了每秒超过1000个token的推理速度,这显示了定制芯片之外的一个重要替代方案。

0 人收藏 0 人点赞
#throughput

2倍 tok/s(在1块MI50上从19.4 tok/s提升到38.1 tok/s)尝试类似推测解码的假设……但不是用额外的侧模型,而是利用我可以同时运行多个计算,就好像内存里加载了两份Qwen3.6-27B一样——小量化不占用所有可用算力。

Reddit r/LocalLLaMA · 2026-06-09 缓存

打包双推理(PTI)是一种通过单批解码中运行多个token序列来实现约2倍LLM吞吐量的技术,它利用了llama.cpp中的权重共享,无需草稿模型或额外VRAM。

0 人收藏 0 人点赞
#throughput

@msimoni: 我一直在思考的一件事:以类似S3的对象存储为原语,你可以构建一个具有无限吞吐量的事务数据库…

X AI KOLs Timeline · 2026-05-30

一条推文讨论了使用类似S3的对象存储和内容寻址构建具有无限吞吐量的事务数据库的想法,其中块被并行写入,根哈希定期更新。

0 人收藏 0 人点赞
#throughput

Amazon 推出了“Resilient Network Graphs”(RNG),一种数据中心网络,可将硬件需求降低 69%,并将吞吐量提升 33%。

X AI KOLs Following · 2026-05-30 缓存

Amazon 推出了“Resilient Network Graphs”(RNG),这是一种数据中心网络设计,可将硬件需求降低 69%,并将吞吐量提升 33%。自去年悄然部署以来,现已成为大多数 AWS 工作负载的默认网络。

0 人收藏 0 人点赞
#throughput

Qwen 3.6 在双 RTX PRO 6000 上的基准测试

Reddit r/LocalLLaMA · 2026-05-25

使用 VLLM 在双 RTX PRO 6000 GPU 上对 Qwen 3.6 27B 和 35B 模型进行基准测试,生成吞吐量高达每秒 3500 个令牌。

0 人收藏 0 人点赞
#throughput

RTX 5090 搭配 Qwen3.6 能否达到 > 3,000 tok/s?欢迎来拍砖(open-dllm)

Reddit r/LocalLLaMA · 2026-05-16

Open-dLLM 将 Qwen3.6 适配为使用扩散式生成,在 RTX 5090 上对于短序列实现了超过 3,000 tok/s 的吞吐量,相关代码已在 GitHub 上发布。

0 人收藏 0 人点赞
#throughput

@QuixiAI:@Kimi_Moonshot K2.6 在我的 mi300x 上跑出了 56 tps(单请求),接下来做吞吐测试

X AI KOLs Following · 2026-04-21 缓存

Kimi K2.6 在单张 MI300X GPU 上达到 56 token/s,用户计划进一步测试整体吞吐。

0 人收藏 0 人点赞
#throughput

@sanbuphy: K2.6 成功在 Mac 本地下载并部署了 Qwen3.5-0.8B 模型,通过使用小众 Zig 语言实现并优化模型推理,证明了新模型的泛化能力。经过 4,000 多次工具调用,超过 12 小时的不间断运行,K2.6 模型共迭代了 14 …

X AI KOLs Timeline · 2026-04-21 缓存

K2.6在Mac本地成功部署Qwen3.5-0.8B模型,使用Zig语言实现推理优化,经过14轮迭代将吞吐量从约15 tokens/s提升至约193 tokens/s,比LM Studio快20%。

0 人收藏 0 人点赞
#throughput

slow → fast computers

YouTube AI Channels · 2026-06-25 缓存

文章介绍了《系统性能》书中关于延迟、吞吐量、缓存层级等核心概念,并引用了Jeff Dean等专家的延迟数字资源,强调动手实践对性能工程的重要性。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈