标签
Baseten出版的《Inference Engineering》是一本系统化的书籍,讲解从CUDA到生产部署的AI推理优化技术,帮助工程师在生产环境中高效运行开源模型。
LLM2Jev是一个开源工具,它将本地HuggingFace模型适配为使用Choice、Score和Noul框架执行结构化决策,提供仅预填充推理,并与Transformers和SGLang集成。
本文介绍了如何使用开源LLMs和SGLang构建本地决策引擎,以实现对固定选项的高效评分和概率分布,而无需生成完整文本,与像Jev这样的系统相比。
zero-to-sglang 课程已经达到 1,000 GitHub 星标,并发布了涵盖 mini-sglang 和请求旅程的新章节,包括代码讲解。
一位开发者在单台NVIDIA DGX Spark上,使用Qwen3.8-Flash-Next模型在8小时内构建了一个项目,生成了约1万行代码,并消耗了80万token。
本文介绍了一款开源GPU性能分析工具,它能以JSON格式提供性能指标数据,帮助AI代理自动完成针对vLLM、SGLang等基于CUDA的AI引擎的性能调优,无需人工进行手动轨迹分析。
这篇文章讨论了AI推理引擎中通用性与专业化的权衡,以vLLM和SGLang为例,并指出编码代理正在降低创建专用引擎的工程成本。
SGLang-Diffusion 与 MiniMax 的 VDN-H3 支持快速、可扩展的视频生成,在 8× B200 GPU 上,仅需 9.0 秒即可生成 14.4 秒的 768p 视频,实现比实时更快的推理。
本文解释了RadixAttention,这是SGLang中的一项技术,使用基数树来高效缓存和重用AI服务中跨分支请求的重叠KV缓存。
在完整上下文下对SGLang、llama.cpp和FreeToken在Qwen3.8-Flash-Next上的基准测试显示,SGLang实现最快的首token时间为35.4秒,而llama.cpp基线耗时258.4秒,推测解码提供了性能提升。
AdaptiveSpec是一种无训练的每步推测解码方法,它自适应调整令牌验证和草稿树形状以提升LLM推理吞吐量,在基准测试中提高性能高达56%的同时保持高准确性。
SGLang 已经为 DeepSeek-V4-Flash-Vision 和 DeepSeek-V4-Flash-0731 模型在 2x DGX Spark 硬件上添加了部署指南,支持多种配置和优化。
RadixArk/Qwen3.8-Flash-Next-NVFP4 现已在 SGLang-V100 中得到支持,使得在 4xV100 GPU 上能够进行全上下文操作,性能指标显示高吞吐量,上下文处理能力高达 256k tokens。
Qwen3.8 Flash-Next的一个新检查点能将n-gram查找表卸载至SSD,在保持SGLang推理速度的同时,减少48 GB的内存使用。
LLM推理工程关键概念的教育概述,涵盖KV cache、PagedAttention、Flash Attention和连续批处理等技术,以优化推理性能。
本文基准测试了MiniMax-H3视频生成在8×H200 GPU上使用SGLang Diffusion的加速效果,通过SSIM衡量质量,最高实现6.24倍速度提升。
Josh Tobin 报道了自动化研究中的一项成功,其中 AI 识别并帮助修复了可能影响 vLLM 和 SGLang 推理性能的边界情况,特别是在 FlashInfer 库中。
Liquid AI 发布了LFM2.5系列的DSpark草稿模型检查点,使推理速度在GPU和设备上最高提升3.2倍,质量损失极小,并在首日就支持llama.cpp和SGLang等开源工具。
SGLang正式宣布成为Miles v0.1的原生rollout引擎。Miles是一个针对大语言模型与多模态模型的开源强化学习框架,旨在提升大规模强化学习训练中的吞吐量、缓存效率与稳定性。
SGLang 已更新其在 RTX 5090 和 RTX Pro 6000 硬件上部署 Qwen3.8-27B 模型的配置指南,为不同配置添加了变体,并提供了调优选项。