sglang

标签

Cards List
#sglang

@shao__meng: https://x.com/shao__meng/status/2101835798316495007

X AI KOLs Timeline ↗ · 3天前 缓存

Baseten出版的《Inference Engineering》是一本系统化的书籍,讲解从CUDA到生产部署的AI推理优化技术,帮助工程师在生产环境中高效运行开源模型。

0 人收藏 0 人点赞
#sglang

@NFT_Chen: 太棒了!立即通过本地化决策引擎将任何LLM转换为Jev模型!LLM2Jev带来Jev的统一Ch…

X AI KOLs Timeline ↗ · 4天前 缓存

LLM2Jev是一个开源工具,它将本地HuggingFace模型适配为使用Choice、Score和Noul框架执行结构化决策,提供仅预填充推理,并与Transformers和SGLang集成。

0 人收藏 0 人点赞
#sglang

@_avichawla: https://x.com/_avichawla/status/2101563610644496464

X AI KOLs Timeline ↗ · 4天前 缓存

本文介绍了如何使用开源LLMs和SGLang构建本地决策引擎,以实现对固定选项的高效评分和概率分布,而无需生成完整文本,与像Jev这样的系统相比。

0 人收藏 0 人点赞
#sglang

@YichiZ03: zero-to-sglang 刚刚达到 1,000 GitHub 星标!感谢大家的支持!我们的新章节:Chapter 2.1: mini-sglang — W…

X AI KOLs Timeline ↗ · 4天前 缓存

zero-to-sglang 课程已经达到 1,000 GitHub 星标,并发布了涵盖 mini-sglang 和请求旅程的新章节,包括代码讲解。

0 人收藏 0 人点赞
#sglang

昨天用一台NVIDIA DGX Spark,搭配Qwen3.8-Flash-Next(NVFP4,262K上下文)搭建的项目

Reddit r/LocalLLaMA ↗ · 5天前

一位开发者在单台NVIDIA DGX Spark上,使用Qwen3.8-Flash-Next模型在8小时内构建了一个项目,生成了约1万行代码,并消耗了80万token。

0 人收藏 0 人点赞
#sglang

我们打造了一款开源GPU性能分析工具,可直接将AI代理指向其中,省去手动解析追踪记录的麻烦。

Reddit r/LocalLLaMA ↗ · 2026-09-17

本文介绍了一款开源GPU性能分析工具,它能以JSON格式提供性能指标数据,帮助AI代理自动完成针对vLLM、SGLang等基于CUDA的AI引擎的性能调优,无需人工进行手动轨迹分析。

0 人收藏 0 人点赞
#sglang

@JiaZhihao: 我认为这归结为一个经典的系统权衡:通用性与专业化。vLLM/SGLang 覆盖了巨大的…空间

X AI KOLs Timeline ↗ · 2026-09-16 缓存

这篇文章讨论了AI推理引擎中通用性与专业化的权衡,以vLLM和SGLang为例,并指出编码代理正在降低创建专用引擎的工程成本。

0 人收藏 0 人点赞
#sglang

@radixark: SGLang-Diffusion 支持快速、可扩展的多模态生成推理。最新的 VDN-H3 工作使 @MiniMa…

X AI KOLs Timeline ↗ · 2026-09-14 缓存

SGLang-Diffusion 与 MiniMax 的 VDN-H3 支持快速、可扩展的视频生成,在 8× B200 GPU 上,仅需 9.0 秒即可生成 14.4 秒的 768p 视频,实现比实时更快的推理。

0 人收藏 0 人点赞
#sglang

@akshay_pachaar: RadixAttention,清晰解释。(SGLang如何使前缀缓存高效)前缀缓存听起来简单,直到……

X AI KOLs Timeline ↗ · 2026-09-12 缓存

本文解释了RadixAttention,这是SGLang中的一项技术,使用基数树来高效缓存和重用AI服务中跨分支请求的重叠KV缓存。

0 人收藏 0 人点赞
#sglang

Qwen3.8-Flash-Next在llama.cpp vs SGLang vs FreeToken中的比较:完整上下文下首token时间从35秒到258秒。我对即将引入引擎的新PR的研究发现。

Reddit r/LocalLLaMA ↗ · 2026-09-08

在完整上下文下对SGLang、llama.cpp和FreeToken在Qwen3.8-Flash-Next上的基准测试显示,SGLang实现最快的首token时间为35.4秒,而llama.cpp基线耗时258.4秒,推测解码提供了性能提升。

0 人收藏 0 人点赞
#sglang

边距而非窗口:无训练的每步有损推测解码

arXiv cs.CL ↗ · 2026-09-04 缓存

AdaptiveSpec是一种无训练的每步推测解码方法,它自适应调整令牌验证和草稿树形状以提升LLM推理吞吐量,在基准测试中提高性能高达56%的同时保持高准确性。

0 人收藏 0 人点赞
#sglang

@sgl_project: 我们刚刚为 DeepSeek-V4-Flash-Vision 和 DeepSeek-V4-Flash-0731 在 2x DGX Spark 上添加了指南。 https://docs.sglang.io/coo…

X AI KOLs Timeline ↗ · 2026-09-03 缓存

SGLang 已经为 DeepSeek-V4-Flash-Vision 和 DeepSeek-V4-Flash-0731 模型在 2x DGX Spark 硬件上添加了部署指南,支持多种配置和优化。

0 人收藏 0 人点赞
#sglang

Qwen3.8-Flash-Next NVFP4 第3天对4xV100的支持

Reddit r/LocalLLaMA ↗ · 2026-08-30

RadixArk/Qwen3.8-Flash-Next-NVFP4 现已在 SGLang-V100 中得到支持,使得在 4xV100 GPU 上能够进行全上下文操作,性能指标显示高吞吐量,上下文处理能力高达 256k tokens。

0 人收藏 0 人点赞
#sglang

Qwen 3.8 Flash Next n-gram查找表卸载至SSD并在SGLang中流式传输

Reddit r/LocalLLaMA ↗ · 2026-08-29 缓存

Qwen3.8 Flash-Next的一个新检查点能将n-gram查找表卸载至SSD,在保持SGLang推理速度的同时,减少48 GB的内存使用。

0 人收藏 0 人点赞
#sglang

@pallavishekhar_: 学习LLM推理工程 - Prefill vs Decode - KV Cache - PagedAttention - Flash Attention - Continuous Batching…

X AI KOLs Timeline ↗ · 2026-08-28 缓存

LLM推理工程关键概念的教育概述,涵盖KV cache、PagedAttention、Flash Attention和连续批处理等技术,以优化推理性能。

0 人收藏 0 人点赞
#sglang

加速MiniMax-H3(阅读时间12分钟)

TLDR AI ↗ · 2026-08-28 缓存

本文基准测试了MiniMax-H3视频生成在8×H200 GPU上使用SGLang Diffusion的加速效果,通过SSIM衡量质量,最高实现6.24倍速度提升。

0 人收藏 0 人点赞
#sglang

@josh_tobin_: 自动化研究的一个有趣小胜利:我们发现并帮助修复了一些可能影响推理性能的边界情况…

X AI KOLs Timeline ↗ · 2026-08-27 缓存

Josh Tobin 报道了自动化研究中的一项成功,其中 AI 识别并帮助修复了可能影响 vLLM 和 SGLang 推理性能的边界情况,特别是在 FlashInfer 库中。

0 人收藏 0 人点赞
#sglang

LFM2.5-DSpark使推理速度最高提升3.2倍

Hugging Face Blog ↗ · 2026-08-20 缓存

Liquid AI 发布了LFM2.5系列的DSpark草稿模型检查点,使推理速度在GPU和设备上最高提升3.2倍,质量损失极小,并在首日就支持llama.cpp和SGLang等开源工具。

0 人收藏 0 人点赞
#sglang

@sgl_project:SGLang很荣幸能成为Miles的原生rollout引擎。我们致力于让token持续流转,让GPU保持忙碌状态...

X AI KOLs Timeline ↗ · 2026-08-18 缓存

SGLang正式宣布成为Miles v0.1的原生rollout引擎。Miles是一个针对大语言模型与多模态模型的开源强化学习框架,旨在提升大规模强化学习训练中的吞吐量、缓存效率与稳定性。

0 人收藏 0 人点赞
#sglang

@sgl_project:我们在 Qwen3.8-27B 手册中更新了 RTX 5090 / RTX Pro 6000 的配置指南 http://docs.sglang.io/cookboo…

X AI KOLs Timeline ↗ · 2026-08-17 缓存

SGLang 已更新其在 RTX 5090 和 RTX Pro 6000 硬件上部署 Qwen3.8-27B 模型的配置指南,为不同配置添加了变体,并提供了调优选项。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈