sglang

标签

Cards List
#sglang

@sgl_project:我们在 Qwen3.8-27B 手册中更新了 RTX 5090 / RTX Pro 6000 的配置指南 http://docs.sglang.io/cookboo…

X AI KOLs Timeline ↗ · 2026-08-17 缓存

SGLang 已更新其在 RTX 5090 和 RTX Pro 6000 硬件上部署 Qwen3.8-27B 模型的配置指南,为不同配置添加了变体,并提供了调优选项。

0 人收藏 0 人点赞
#sglang

@akshay_pachaar: LLM工程师手册(每天30分钟,10周,50课)一个面向LLM推理服务的路线图,一切都指向一个服务,而不是分散在多个演示中。

X AI KOLs Following ↗ · 2026-08-14 缓存

一个为期10周、每天30分钟的工程师学习LLM推理服务的路线图,涵盖vLLM、SGLang、负载测试、量化以及优化技术,以构建一个可复现的基准测试。

0 人收藏 0 人点赞
#sglang

@sgl_project: 小型模型之王回归了!来自@Alibaba_Qwen的Qwen3.8-27B已经开源,SGLang已经实现了首日支持:-…

X AI KOLs Timeline ↗ · 2026-08-14 缓存

Qwen3.8-27B,一个来自阿里巴巴的270亿参数多模态AI模型,现在已经开源,并在SGLang中提供了首日支持,提供高推理速度和在编码与办公任务上的卓越性能。

0 人收藏 0 人点赞
#sglang

针对双GH200优化的DSv4-Flash:SGLang上PP达10,000 tok/s,TG超过300 tok/s

Reddit r/LocalLLaMA ↗ · 2026-08-04 缓存

DeepSeek V4 Flash在双GH200工作站上的详细基准测试,比较了SGLang和vLLM在1M上下文长度下使用DSpark投机解码的表现,发现SGLang更快,约为317 tok/s对比276 tok/s。

0 人收藏 0 人点赞
#sglang

@modal:DeepSeek-V4-Flash 总参数为 284B,每个 token 激活 13B。结合混合压缩注意力机…

X AI KOLs Following ↗ · 2026-08-03 缓存

DeepSeek-V4-Flash 是一个 284B 参数的 MoE 模型,每 token 激活 13B 参数,采用混合压缩注意力机制,可降低 1M token 上下文的 KV 缓存需求。可使用 Modal 上的 SGLang 提供服务,在单个 B300 上实现快速解码。

0 人收藏 0 人点赞
#sglang

@googledevs: 重大消息:@Google 和 @RadixArk 合作,将 @sgl_project 引入 Google Cloud TPU!今天即可在 TPU 上运行 SGLang,通过…

X AI KOLs Timeline ↗ · 2026-07-30 缓存

Google Cloud 和 RadixArk 合作,将开源推理框架 SGLang 引入 Google Cloud TPU,初期通过 SGL-JAX,后续推出 SGL-torchtpu 提供原生 PyTorch 支持,让开发者能够无缝在 GPU 和 TPU 上运行生产工作负载。

0 人收藏 0 人点赞
#sglang

自托管Kimi K3:硬件成本增加20%,任务解决能力提升20%

Hacker News Top ↗ · 2026-07-29 缓存

最新基准测试显示,在8个B300节点上自托管Kimi K3实现了86.4%的任务解决率,硬件成本大约比在B200节点上运行的GLM-5.2高出20%,尽管吞吐量较低。

0 人收藏 0 人点赞
#sglang

面向V100用户:SGLang运行Qwen+Dflash和Laguna

Reddit r/LocalLLaMA ↗ · 2026-07-27

修改SGLang以在V100 GPU上支持Qwen和Laguna模型,使用自定义的FlashAttention和Marlin内核,在4xV100硬件上获得了不错的吞吐量。

0 人收藏 0 人点赞
#sglang

@PyTorch: 如何从每一美元的人工智能投入中获得更多有用的工作——而不仅仅是更多的令牌?本周三上午11:50在@AMD #Advancing…

X AI KOLs Timeline ↗ · 2026-07-21 缓存

PyTorch Foundation CTO Matt White将在AMD的AdvancingAI活动上发表演讲,探讨如何使用vLLM和SGLang等开源工具优化AI推理经济学,倡导使用规模合适的模型和智能路由,以改善每美元智能。

0 人收藏 0 人点赞
#sglang

KDFlow:面向大语言模型的用户友好且高效的知识蒸馏框架

arXiv cs.CL ↗ · 2026-07-20 缓存

KDFlow是一种新颖的大语言模型知识蒸馏框架,采用解耦架构,使用SGLang进行教师推理,FSDP2进行学生训练,相比现有框架实现了1.44倍至6.36倍的加速。

0 人收藏 0 人点赞
#sglang

这里为您提供最流行硬件的模型配方

Reddit r/LocalLLaMA ↗ · 2026-07-11 缓存

一份精选的LLM推理配方和性能基准测试集合,涵盖NVIDIA RTX Pro 6000 Blackwell、H100、AMD Strix Halo和RTX 5090等热门硬件配置,并包含详细的批量大小、量化方法及吞吐量数据。

0 人收藏 0 人点赞
#sglang

针对 Qwen 的最快推测解码

Reddit r/LocalLLaMA ↗ · 2026-07-11

一种针对 Qwen 模型的最快推测解码的新实现已可用,通过 Hugging Face 分支在 sglang 中得到支持,后续将在 uzu 引擎中获得支持。

0 人收藏 0 人点赞
#sglang

在RTX GPU上探索FlashAttention-3/4优化

Reddit r/LocalLLaMA ↗ · 2026-07-09

本文探讨了FlashAttention-3/4优化是否对RTX GPU有益,得出结论:由于消费级显卡的硬件限制,FA-2已是天花板。

0 人收藏 0 人点赞
#sglang

@Alacritic_Super: 如果你想掌握LLM推理,从这三篇论文开始。它们介绍了许多驱动当今…的核心理念。

X AI KOLs Timeline ↗ · 2026-07-08 缓存

这个线程推荐了三篇掌握LLM推理的关键论文:PagedAttention、Sarathi-Serve和SGLang,它们介绍了高效的内存管理、分块预填充和结构化生成技术,这些技术被用于现代推理引擎如vLLM和TensorRT-LLM中。

0 人收藏 0 人点赞
#sglang

@mingyilu123: SGLang 现支持 DSpark,这是我见过的对推测解码最实用的改进之一

X AI KOLs Timeline ↗ · 2026-07-06 缓存

SGLang 现已集成 DSpark,这是一种置信驱动的推测解码方法,仅验证高置信度的草稿令牌,从而提升高负载下的推理效率。

0 人收藏 0 人点赞
#sglang

@h100envy: 前伯克利博士,在 xAI 领导 SGLang 团队,解释了如何在 23 分钟内用 10 万块 GPU 为 Grok 提供服务——比价值 2000 美元的……更好

X AI KOLs Timeline ↗ · 2026-07-06 缓存

一位在 xAI 领导 SGLang 团队的前伯克利博士,解释了如何使用分离预填充/解码、专家分片以及通信/计算重叠,在 10 万块 GPU 上为 Grok 提供服务,以实现碾压 DeepSeek API 的价格。

0 人收藏 0 人点赞
#sglang

GLM 5.2 FP8 with FP8 KV - Terminal-Bench 2.1 = 79.8 (有一个超时未重新运行)

Reddit r/LocalLLaMA ↗ · 2026-07-05

在 H200 上测试 GLM 5.2 的 FP8 量化及 FP8 KV 缓存,在 Terminal-Bench 2.1 上得到 79.8% 的分数,有一个超时未重新运行。

0 人收藏 0 人点赞
#sglang

智能体辅助的SGLang开发(18分钟阅读)

TLDR AI ↗ · 2026-07-03 缓存

本文探讨了智能体工具如何用于编码SGLang的开发工作流,将调试、基准测试和性能分析转化为可执行的技能和可复现的实验,像KDA-Pilot这样的努力已经产生了合并的PR。

0 人收藏 0 人点赞
#sglang

@amitiitbhu: SGLang 是如何工作的?在此阅读:https://outcomeschool.com/blog/how-does-sglang-work…

X AI KOLs Timeline ↗ · 2026-06-30 缓存

一篇教育性博客文章,解释了 SGLang 的工作原理,包括其运行时、前端语言、RadixAttention 机制以及与 vLLM 的比较。

0 人收藏 0 人点赞
#sglang

@VukRosic99: GLM 5.2 后训练代码已开源 (slime) Megatron-LM 进行训练。SGLang 生成 rollout。单数据缓冲…

X AI KOLs Timeline ↗ · 2026-06-27 缓存

GLM 5.2 后训练代码已开源,使用 Megatron-LM 进行训练,SGLang 生成 rollout,形成一个持续强化学习循环,权重同步。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈