sglang

标签

Cards List
#sglang

@Ex0byt: 更新:通往GLM-5.2之路:我们快到了,各位!未量化、未剪枝的DeepSeek-v4-Flash。单台……上11 tok/s

X AI KOLs Timeline ↗ · 2026-06-23 缓存

关于在单台DGX Spark上使用sglang推理和自定义mega-kernel以11 tok/s运行未量化的DeepSeek-v4-Flash模型的更新,正在向GLM-5.2迈进。

0 人收藏 0 人点赞
#sglang

@PyTorch: SGLang 为 DeepSeek-V4 提供了首日支持,而 @lmsysorg 与 @NVIDIAAI 工程团队的合作…

X AI KOLs Following ↗ · 2026-06-23 缓存

SGLang 为 DeepSeek-V4 提供了首日支持,LMSys 与 NVIDIA 工程团队的合作在生产环境中实现了高达 5 倍的吞吐量提升,相关改进已在 SemiAnalysis InferenceX 仪表盘上展示。

0 人收藏 0 人点赞
#sglang

@vanstriendaniel: OCR模型又来了!百度公司的Unlimited-OCR是其中比较有趣的一个。你可以无需太多…

X AI KOLs Following ↗ · 2026-06-23 缓存

这篇文章展示了如何在Hugging Face Jobs上将百度的Unlimited-OCR模型作为临时的、兼容OpenAI的端点提供服务,支持多页文档解析,具有表格转HTML和公式转LaTeX提取等功能。

0 人收藏 0 人点赞
#sglang

@Mayhem4Markets: https://x.com/Mayhem4Markets/status/2069090022117019928

X AI KOLs Following ↗ · 2026-06-22 缓存

两大主流LLM服务框架SGLang和vLLM的详细技术对比,涵盖KV缓存管理(RadixAttention vs PagedAttention)的架构差异、吞吐量、延迟以及自托管环境的部署考量。

0 人收藏 0 人点赞
#sglang

@TheAhmadOsman: 为什么我关注你硬件的推理引擎/软件栈? - 2x RTX 3090s: ~14.5 tok/s → ~64 tok/s 提升到…

X AI KOLs Following ↗ · 2026-06-21 缓存

不同硬件上推理引擎性能对比:在2x RTX 3090s上从基线迁移到TP=2的vLLM,性能从~14.5 tok/s提升至~64 tok/s;在RTX PRO 6000上迁移到Sglang,性能从~32 tok/s提升至~110 tok/s。推荐在CUDA/多GPU场景使用vLLM/Sglang,在边缘设备使用llama.cpp。

0 人收藏 0 人点赞
#sglang

@h100envy: Ying Sheng 共同撰写了 SGLang,该推理引擎现在在 xAI 上为 Grok 服务,运行在十万个 GPU 上。她还构建了 Fle…

X AI KOLs Timeline ↗ · 2026-06-19 缓存

Ying Sheng 共同撰写了 SGLang,该推理引擎现在在 xAI 上用十万个 GPU 为 Grok 服务,相比 DeepSeek 的 API 实现了 5 倍的成本削减;她还构建了 FlexGen,并参与构建了 Chatbot Arena。

0 人收藏 0 人点赞
#sglang

@didier_lopes: 难以置信,Z. ai 竟然将其强化学习基础设施开源了。GLM-5.2 的整个 OPD 后训练只用了…

X AI KOLs Following ↗ · 2026-06-19 缓存

Z. ai 将其强化学习基础设施 slime 框架开源,该框架使 GLM-5.2 的 OPD 后训练在约两天内高效完成。slime 是一个用于强化学习扩展的 LLM 后训练框架,集成了 Megatron 和 SGLang,并已通过 GLM、Qwen、DeepSeek 和 Llama 等前沿模型的实战测试。

0 人收藏 0 人点赞
#sglang

我的 GLM-5.2-FP8 HGX-H200 SGLang Docker 部署配置

Reddit r/LocalLLaMA ↗ · 2026-06-17

一位用户分享他们使用SGLang在HGX-H200硬件上运行GLM-5.2-FP8模型的Docker部署配置,实现了262k上下文和70 tokens/s的推理速度。

0 人收藏 0 人点赞
#sglang

什么是推测性解码?(在paperswithco.de上热门)[R]

Reddit r/MachineLearning ↗ · 2026-06-17

推测性解码是一种推理优化技术,它使用快速草稿模型提出未来 token,并由较大模型并行验证,从而提高 LLM 的生成速度。文章强调了它在 Papers with Code 上的热门状态,以及最近的 SGLang 博客文章,该文章介绍了使用 DFlash 模型实现的最先进延迟。

0 人收藏 0 人点赞
#sglang

@charles_irl: 许多人迟来地意识到智能必须开放。开放智能要成功,开发者必须携手合…

X AI KOLs Following ↗ · 2026-06-15 缓存

Modal、SGLang 和 Z Lab 之间的合作将 DFlash 推测方案集成到 SGLang 中,为阿里巴巴的 Qwen 397B-A17B 模型实现了高达 4.3 倍的吞吐量提升,推动了开放智能的发展。

0 人收藏 0 人点赞
#sglang

@lmsysorg: 新博客: 推测解码的下一代: DFlash 和 Spec V2。DFlash + Spec V2 实现 >4.3倍基准吞吐量…

X AI KOLs Following ↗ · 2026-06-15 缓存

关于 DFlash 和 Spec V2 推测解码方法的新研究实现了 LLM 推理的 >4.3倍基准吞吐量,现已成为 SGLang 的默认推测解码引擎。

0 人收藏 0 人点赞
#sglang

@zhijianliu_: 这正是 DFlash 的用武之地。我们的块扩散起草器 + KV注入,现在正在前沿规模上运行——感谢…

X AI KOLs Following ↗ · 2026-06-15 缓存

DFlash,一个带有KV注入的块扩散起草器,现在正在前沿规模上运行,相比基线实现了高达4.3倍的吞吐量提升,集成了Modal和SGLang以用于Qwen 397B。

0 人收藏 0 人点赞
#sglang

@TheAhmadOsman: 如何学习这一切?第一步:从服务引擎视角开始 - vLLM:PagedAttention、连续批处理...

X AI KOLs Following ↗ · 2026-06-08 缓存

一份关于学习AI推理引擎内部机制的详细指南,涵盖vLLM和SGLang等服务引擎、使用Triton和CUTLASS的低层GPU内核编程,以及一系列旨在培养实践能力的小型项目。

0 人收藏 0 人点赞
#sglang

@charles_irl: 祝贺我的同事 @nanjiangwill 将这个重要技术合并到 slime 中!

X AI KOLs Following ↗ · 2026-05-30 缓存

增量压缩权重同步技术已合并到 slime 中,实现 Megatron ↔ SGLang 分离式部署的无损增量同步,增强大规模强化学习。

0 人收藏 0 人点赞
#sglang

@grapeot: LLM 推理系统到底是怎么跑的?SGLang Omni 团队最近公开了一篇很少见的文章——把一个顶级推理系统团队的完整决策链路摊在明面上。我顺着原文梳理了一篇科普,从自回归decode、KV cache、continuous batchi…

X AI KOLs Timeline ↗ · 2026-05-30

本文基于SGLang Omni团队的内部决策文章,从自回归解码、KV缓存、连续批处理等基础概念出发,深入浅出地介绍了LLM推理系统的运作原理。

0 人收藏 0 人点赞
#sglang

@wey_gu: 听他表达太过瘾了 — 朱邦华: SGLang,强化学习,英伟达收购,二次创业,清华,伯克利,LMSYS,Chatbot Arena,善于放弃

X AI KOLs Timeline ↗ · 2026-05-22 缓存

分享与SGLang/RadixArk CTO朱邦华的深度访谈,涵盖其从清华到伯克利、创建NexusFlow后被英伟达收购、再次创业成立RadixArk的故事,涉及SGLang、强化学习、英伟达收购等话题。

0 人收藏 0 人点赞
#sglang

在混合Blackwell/Ada集群上对vLLM、SGLang和llama.cpp进行基准测试

Reddit r/LocalLLaMA ↗ · 2026-05-17

本文在混合Blackwell/Ada GPU集群上对vLLM、SGLang和llama.cpp进行长上下文预填充基准测试,发现vLLM在异构设置上显著优于其他引擎,而SGLang由于FP4支持限制,在使用Ada显卡时会崩溃。

0 人收藏 0 人点赞
#sglang

用一个 Python 字典将多模态推理性能提升超 10%

Hacker News Top ↗ · 2026-05-06 缓存

Modal 的工程师对 SGLang 调度器在多模态 VLM 工作负载下进行了性能分析,发现将开销较大的 GPU 显存记录操作替换为一个简单的 Python 字典缓存后,吞吐量提升了 16%,延迟降低了超过 13%。该修复已合并至 SGLang v0.5.10。

0 人收藏 0 人点赞
#sglang

z-lab/gemma-4-31B-it-DFlash

Hugging Face Models Trending ↗ · 2026-04-30 缓存

Z-lab 发布了 DFlash,这是一种用于 Gemma-4-31B-it 的投机解码草稿模型,采用轻量级块扩散并行生成多个 token,相较于自回归基线实现了最高 5.8 倍的加速。

0 人收藏 0 人点赞
#sglang

@0xSero:GLM-5.1-478B-NVFP4 跑在:4×RTX Pro 6000、SGLang,最大 37 万 token(1.75× 满上下文),p10 27.7 | p90 45…

X AI KOLs Timeline ↗ · 2026-04-21 缓存

一份 478B 参数的量化 GLM-5.1 模型在 4 块 RTX Pro 6000 上用 SGLang 运行,支持 37 万 token 上下文,解码最高 45 tok/s,预填充 1340 tok/s,并现场演示操控 Figma。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈