throughput

标签

Cards List
#throughput

DSpark:基于置信度调度的半自回归推测解码

Hugging Face Daily Papers · 2026-07-06 缓存

DSpark 是一个推测解码框架,结合了半自回归草稿生成与置信度调度验证,以加速大语言模型推理,并在高并发场景下提升吞吐量。

0 人收藏 0 人点赞
#throughput

@wafer_ai: 突发:这些工程师成功在 @AMD MI355X 上以每节点 2626 tok/s 和单流 213 tok/s 的速度运行 GLM 5.2

X AI KOLs Timeline · 2026-07-03 缓存

工程师成功在 AMD MI355X 上部署 GLM 5.2,达到每节点 2626 tok/s 和单流 213 tok/s 的性能,相当于 B200 吞吐量的约 80%,而成本不到 Blackwell 的一半。

0 人收藏 0 人点赞
#throughput

@AnjneyMidha: 非常酷

X AI KOLs Following · 2026-06-30 缓存

Etched 宣布在成功完成 A0 流片后走出隐身模式,拥有超过 10 亿美元的客户合同和 8 亿美元融资,声称其首批机架将于今年夏天发货,推理性能达到业界最先进水平。

0 人收藏 0 人点赞
#throughput

@gabriel1:推理将成为全球最大的市场,智能的需求无限,Etched 正在带来 AI 夏天

X AI KOLs Timeline · 2026-06-30 缓存

AI 推理硬件初创公司 Etched 在获得 8 亿美元融资并签署超过 10 亿美元客户合同后结束隐身模式。首批机架将于今年夏季发货,声称在吞吐量、延迟和能效方面达到业界领先水平。

0 人收藏 0 人点赞
#throughput

@dzhulgakov:来自 @deepseek_ai 的 DSpark 巧妙融合了多种投机解码思路,将吞吐量提升 1.5 到 5 倍…

X AI KOLs Following · 2026-06-27 缓存

来自 DeepSeek AI 的 DSpark 集成了投机解码思路,在生产系统中实现 1.5 到 5 倍的吞吐量提升。本推文从基础开始讲解了 10 个关键思路。

0 人收藏 0 人点赞
#throughput

@Hikari_07_jp:我终于让 DeepSeek-V4-Flash MTP 投机解码在 2× RTX PRO 6000 上实际运行了,单流吞吐量提升 38%。它……

X AI KOLs Timeline · 2026-06-24 缓存

通过修复加载器中量化格式路由错误,在 2× RTX PRO 6000 上实现了 DeepSeek-V4-Flash MTP 投机解码,吞吐量提升 38%。

0 人收藏 0 人点赞
#throughput

@PyTorch: SGLang 为 DeepSeek-V4 提供了首日支持,而 @lmsysorg 与 @NVIDIAAI 工程团队的合作…

X AI KOLs Following · 2026-06-23 缓存

SGLang 为 DeepSeek-V4 提供了首日支持,LMSys 与 NVIDIA 工程团队的合作在生产环境中实现了高达 5 倍的吞吐量提升,相关改进已在 SemiAnalysis InferenceX 仪表盘上展示。

0 人收藏 0 人点赞
#throughput

8-16张MI50上Minimax M3模型,峰值吞吐量19 tps

Reddit r/LocalLLaMA · 2026-06-21

报告在8-16张MI50 GPU上运行的Minimax M3模型达到每秒19个token的峰值吞吐量。

0 人收藏 0 人点赞
#throughput

@seiji_________: 今天,我们激动地宣布,与 Google Cloud 的 GKE 团队(@googlecloud)合作,一项重大里程碑……

X AI KOLs Following · 2026-06-18 缓存

Ray Serve LLM 在 Ray 2.56 中,对预填充密集型工作负载实现了高达 4 倍的吞吐量提升,对解码密集型工作负载实现了 24 倍的提升,在生产基准测试中与基于 Rust 的路由框架(如 vllm-router)性能相当,这是与 Google Cloud GKE 团队合作宣布的。

0 人收藏 0 人点赞
#throughput

Kimi K2.7 Code High Speed 的成本为2倍,吞吐量约为5倍,因此我只将部分代理路由到它

Reddit r/AI_Agents · 2026-06-18

Kimi K2.7 Code High Speed 模型提供5倍吞吐量,成本仅为2倍,从而在代理系统内进行选择性路由

0 人收藏 0 人点赞
#throughput

AI推理工程指南(阅读时间约17分钟)

TLDR AI · 2026-06-16 缓存

本指南解释了AI推理工程这一学科,涵盖了预填充和解码阶段的划分、从封闭模型到开放模型的转变,以及针对延迟、吞吐量和成本的优化技术。

0 人收藏 0 人点赞
#throughput

DFlash与Spec V2解码(14分钟阅读)

TLDR AI · 2026-06-16 缓存

Z Lab、SGLang和Modal发布DFlash,这是一种针对Qwen 3.5 397B-A17B的新型投机解码模型,采用块扩散和KV注入技术,相较于基线实现超过4倍吞吐量提升,相较于原生MTP实现1.5倍提升。

0 人收藏 0 人点赞
#throughput

@charles_irl: 许多人迟来地意识到智能必须开放。开放智能要成功,开发者必须携手合…

X AI KOLs Following · 2026-06-15 缓存

Modal、SGLang 和 Z Lab 之间的合作将 DFlash 推测方案集成到 SGLang 中,为阿里巴巴的 Qwen 397B-A17B 模型实现了高达 4.3 倍的吞吐量提升,推动了开放智能的发展。

0 人收藏 0 人点赞
#throughput

@lmsysorg: 新博客: 推测解码的下一代: DFlash 和 Spec V2。DFlash + Spec V2 实现 >4.3倍基准吞吐量…

X AI KOLs Following · 2026-06-15 缓存

关于 DFlash 和 Spec V2 推测解码方法的新研究实现了 LLM 推理的 >4.3倍基准吞吐量,现已成为 SGLang 的默认推测解码引擎。

0 人收藏 0 人点赞
#throughput

@lvwerra:Gemma智能体协作始于48小时前,现已引爆:> 吞吐量提升近4倍(约100→387 tok/s)> 60多个智能体…

X AI KOLs Following · 2026-06-11 缓存

使用Gemma模型的多智能体协作取得了显著的吞吐量提升,并展现出涌现性社会行为,如组成联盟、发布道德声明、协调资源,在48小时内吸引了超过60个智能体和250份提交。

0 人收藏 0 人点赞
#throughput

小米与TileRT在标准商用GPU上实现万亿参数模型推理速度超1000 TPS。定制芯片的时代结束了?

Reddit r/singularity · 2026-06-10

小米与TileRT使用标准商用GPU,在万亿参数模型上实现了每秒超过1000个token的推理速度,这显示了定制芯片之外的一个重要替代方案。

0 人收藏 0 人点赞
#throughput

2倍 tok/s(在1块MI50上从19.4 tok/s提升到38.1 tok/s)尝试类似推测解码的假设……但不是用额外的侧模型,而是利用我可以同时运行多个计算,就好像内存里加载了两份Qwen3.6-27B一样——小量化不占用所有可用算力。

Reddit r/LocalLLaMA · 2026-06-09 缓存

打包双推理(PTI)是一种通过单批解码中运行多个token序列来实现约2倍LLM吞吐量的技术,它利用了llama.cpp中的权重共享,无需草稿模型或额外VRAM。

0 人收藏 0 人点赞
#throughput

@msimoni: 我一直在思考的一件事:以类似S3的对象存储为原语,你可以构建一个具有无限吞吐量的事务数据库…

X AI KOLs Timeline · 2026-05-30

一条推文讨论了使用类似S3的对象存储和内容寻址构建具有无限吞吐量的事务数据库的想法,其中块被并行写入,根哈希定期更新。

0 人收藏 0 人点赞
#throughput

Amazon 推出了“Resilient Network Graphs”(RNG),一种数据中心网络,可将硬件需求降低 69%,并将吞吐量提升 33%。

X AI KOLs Following · 2026-05-30 缓存

Amazon 推出了“Resilient Network Graphs”(RNG),这是一种数据中心网络设计,可将硬件需求降低 69%,并将吞吐量提升 33%。自去年悄然部署以来,现已成为大多数 AWS 工作负载的默认网络。

0 人收藏 0 人点赞
#throughput

Qwen 3.6 在双 RTX PRO 6000 上的基准测试

Reddit r/LocalLLaMA · 2026-05-25

使用 VLLM 在双 RTX PRO 6000 GPU 上对 Qwen 3.6 27B 和 35B 模型进行基准测试,生成吞吐量高达每秒 3500 个令牌。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈