sglang

标签

Cards List
#sglang

针对双GH200优化的DSv4-Flash:SGLang上PP达10,000 tok/s,TG超过300 tok/s

Reddit r/LocalLLaMA · 2026-08-04 缓存

DeepSeek V4 Flash在双GH200工作站上的详细基准测试,比较了SGLang和vLLM在1M上下文长度下使用DSpark投机解码的表现,发现SGLang更快,约为317 tok/s对比276 tok/s。

0 人收藏 0 人点赞
#sglang

@modal:DeepSeek-V4-Flash 总参数为 284B,每个 token 激活 13B。结合混合压缩注意力机…

X AI KOLs Following · 2026-08-03 缓存

DeepSeek-V4-Flash 是一个 284B 参数的 MoE 模型,每 token 激活 13B 参数,采用混合压缩注意力机制,可降低 1M token 上下文的 KV 缓存需求。可使用 Modal 上的 SGLang 提供服务,在单个 B300 上实现快速解码。

0 人收藏 0 人点赞
#sglang

@googledevs: 重大消息:@Google 和 @RadixArk 合作,将 @sgl_project 引入 Google Cloud TPU!今天即可在 TPU 上运行 SGLang,通过…

X AI KOLs Timeline · 2026-07-30 缓存

Google Cloud 和 RadixArk 合作,将开源推理框架 SGLang 引入 Google Cloud TPU,初期通过 SGL-JAX,后续推出 SGL-torchtpu 提供原生 PyTorch 支持,让开发者能够无缝在 GPU 和 TPU 上运行生产工作负载。

0 人收藏 0 人点赞
#sglang

自托管Kimi K3:硬件成本增加20%,任务解决能力提升20%

Hacker News Top · 2026-07-29 缓存

最新基准测试显示,在8个B300节点上自托管Kimi K3实现了86.4%的任务解决率,硬件成本大约比在B200节点上运行的GLM-5.2高出20%,尽管吞吐量较低。

0 人收藏 0 人点赞
#sglang

面向V100用户:SGLang运行Qwen+Dflash和Laguna

Reddit r/LocalLLaMA · 2026-07-27

修改SGLang以在V100 GPU上支持Qwen和Laguna模型,使用自定义的FlashAttention和Marlin内核,在4xV100硬件上获得了不错的吞吐量。

0 人收藏 0 人点赞
#sglang

@PyTorch: 如何从每一美元的人工智能投入中获得更多有用的工作——而不仅仅是更多的令牌?本周三上午11:50在@AMD #Advancing…

X AI KOLs Timeline · 2026-07-21 缓存

PyTorch Foundation CTO Matt White将在AMD的AdvancingAI活动上发表演讲,探讨如何使用vLLM和SGLang等开源工具优化AI推理经济学,倡导使用规模合适的模型和智能路由,以改善每美元智能。

0 人收藏 0 人点赞
#sglang

KDFlow:面向大语言模型的用户友好且高效的知识蒸馏框架

arXiv cs.CL · 2026-07-20 缓存

KDFlow是一种新颖的大语言模型知识蒸馏框架,采用解耦架构,使用SGLang进行教师推理,FSDP2进行学生训练,相比现有框架实现了1.44倍至6.36倍的加速。

0 人收藏 0 人点赞
#sglang

这里为您提供最流行硬件的模型配方

Reddit r/LocalLLaMA · 2026-07-11 缓存

一份精选的LLM推理配方和性能基准测试集合,涵盖NVIDIA RTX Pro 6000 Blackwell、H100、AMD Strix Halo和RTX 5090等热门硬件配置,并包含详细的批量大小、量化方法及吞吐量数据。

0 人收藏 0 人点赞
#sglang

针对 Qwen 的最快推测解码

Reddit r/LocalLLaMA · 2026-07-11

一种针对 Qwen 模型的最快推测解码的新实现已可用,通过 Hugging Face 分支在 sglang 中得到支持,后续将在 uzu 引擎中获得支持。

0 人收藏 0 人点赞
#sglang

在RTX GPU上探索FlashAttention-3/4优化

Reddit r/LocalLLaMA · 2026-07-09

本文探讨了FlashAttention-3/4优化是否对RTX GPU有益,得出结论:由于消费级显卡的硬件限制,FA-2已是天花板。

0 人收藏 0 人点赞
#sglang

@Alacritic_Super: 如果你想掌握LLM推理,从这三篇论文开始。它们介绍了许多驱动当今…的核心理念。

X AI KOLs Timeline · 2026-07-08 缓存

这个线程推荐了三篇掌握LLM推理的关键论文:PagedAttention、Sarathi-Serve和SGLang,它们介绍了高效的内存管理、分块预填充和结构化生成技术,这些技术被用于现代推理引擎如vLLM和TensorRT-LLM中。

0 人收藏 0 人点赞
#sglang

@mingyilu123: SGLang 现支持 DSpark,这是我见过的对推测解码最实用的改进之一

X AI KOLs Timeline · 2026-07-06 缓存

SGLang 现已集成 DSpark,这是一种置信驱动的推测解码方法,仅验证高置信度的草稿令牌,从而提升高负载下的推理效率。

0 人收藏 0 人点赞
#sglang

@h100envy: 前伯克利博士,在 xAI 领导 SGLang 团队,解释了如何在 23 分钟内用 10 万块 GPU 为 Grok 提供服务——比价值 2000 美元的……更好

X AI KOLs Timeline · 2026-07-06 缓存

一位在 xAI 领导 SGLang 团队的前伯克利博士,解释了如何使用分离预填充/解码、专家分片以及通信/计算重叠,在 10 万块 GPU 上为 Grok 提供服务,以实现碾压 DeepSeek API 的价格。

0 人收藏 0 人点赞
#sglang

GLM 5.2 FP8 with FP8 KV - Terminal-Bench 2.1 = 79.8 (有一个超时未重新运行)

Reddit r/LocalLLaMA · 2026-07-05

在 H200 上测试 GLM 5.2 的 FP8 量化及 FP8 KV 缓存,在 Terminal-Bench 2.1 上得到 79.8% 的分数,有一个超时未重新运行。

0 人收藏 0 人点赞
#sglang

智能体辅助的SGLang开发(18分钟阅读)

TLDR AI · 2026-07-03 缓存

本文探讨了智能体工具如何用于编码SGLang的开发工作流,将调试、基准测试和性能分析转化为可执行的技能和可复现的实验,像KDA-Pilot这样的努力已经产生了合并的PR。

0 人收藏 0 人点赞
#sglang

@amitiitbhu: SGLang 是如何工作的?在此阅读:https://outcomeschool.com/blog/how-does-sglang-work…

X AI KOLs Timeline · 2026-06-30 缓存

一篇教育性博客文章,解释了 SGLang 的工作原理,包括其运行时、前端语言、RadixAttention 机制以及与 vLLM 的比较。

0 人收藏 0 人点赞
#sglang

@VukRosic99: GLM 5.2 后训练代码已开源 (slime) Megatron-LM 进行训练。SGLang 生成 rollout。单数据缓冲…

X AI KOLs Timeline · 2026-06-27 缓存

GLM 5.2 后训练代码已开源,使用 Megatron-LM 进行训练,SGLang 生成 rollout,形成一个持续强化学习循环,权重同步。

0 人收藏 0 人点赞
#sglang

@Ex0byt: 更新:通往GLM-5.2之路:我们快到了,各位!未量化、未剪枝的DeepSeek-v4-Flash。单台……上11 tok/s

X AI KOLs Timeline · 2026-06-23 缓存

关于在单台DGX Spark上使用sglang推理和自定义mega-kernel以11 tok/s运行未量化的DeepSeek-v4-Flash模型的更新,正在向GLM-5.2迈进。

0 人收藏 0 人点赞
#sglang

@PyTorch: SGLang 为 DeepSeek-V4 提供了首日支持,而 @lmsysorg 与 @NVIDIAAI 工程团队的合作…

X AI KOLs Following · 2026-06-23 缓存

SGLang 为 DeepSeek-V4 提供了首日支持,LMSys 与 NVIDIA 工程团队的合作在生产环境中实现了高达 5 倍的吞吐量提升,相关改进已在 SemiAnalysis InferenceX 仪表盘上展示。

0 人收藏 0 人点赞
#sglang

@vanstriendaniel: OCR模型又来了!百度公司的Unlimited-OCR是其中比较有趣的一个。你可以无需太多…

X AI KOLs Following · 2026-06-23 缓存

这篇文章展示了如何在Hugging Face Jobs上将百度的Unlimited-OCR模型作为临时的、兼容OpenAI的端点提供服务,支持多页文档解析,具有表格转HTML和公式转LaTeX提取等功能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈