标签
推文报告称,AMD Strix Halo 上的 Ling 3.0 Flash 在使用 ROCm 优化格式时明显快于 Qwen-122b,但指出在某些测试框架中工具调用功能异常。
一项详细基准测试,比较了 Qwen3.6 27B 在 GGUF、NVFP4、AWQ、AutoRound 和 FP8 格式下的 16 种量化,测量与未量化参考的 KL 散度。纯权重的 GGUF 量化通常在质量-大小权衡上表现最佳,而 vLLM 量化则差异显著。
发现 DeepSeek V4 flash 在 vLLM 本地部署中的 KV 缓存失效 Bug:切换 Session 后前缀缓存命中率为 0,导致重新 Prefill,耗时从约 1 秒暴涨到约 100 秒。根因疑为 vLLM 重用 free queue 块时调用 _maybe_evict_cached_block() 删除了缓存索引。
本文介绍了两个配置标志,它们将官方Ling-3.0-flash INT4在单个DGX Spark上的推理速度从20.8 tok/s提升到38.7 tok/s,同时提醒需要使用特定的vLLM分支,并指出在长上下文性能方面的权衡。
通过打补丁的驱动和vLLM环境变量为消费级Nvidia GPU启用PCI-E点对点(P2P),如基准测试所示,可免费获得约25%的预填充吞吐量提升。
OasisKV是一个以内存为中心的LLM推理系统,通过使用来自推测解码的前瞻令牌预取稀疏且重要的KV块,将完整KV缓存存储与HBM解耦,与密集vLLM相比实现了高达2.1倍的吞吐量提升,且精度损失极小。
用户在使用 vLLM 在两台 DGX Spark 机器上部署 DeepSeek-V4-Flash-0731 时,寻求社区关于降低 VRAM 占用和释放操作系统 RAM 的建议,分享了详细的配置和内存测量数据。
伯克利 Sky Computing Lab 开源的 vLLM 是一个高性能 LLM 推理与服务库,通过 PagedAttention 和连续批处理大幅提升吞吐量、降低显存浪费,并兼容 OpenAI API 和多种硬件。
深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。
作者将vLLM的服务栈移植到C++20,生成一个66 MiB的二进制文件,推理时无Python,可逐token与vLLM核对,且在测试硬件上吞吐量具竞争力。
技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。
一份技术指南,演示如何使用开源工具在单个 GPU 上部署五个专用的小型模型(SLM、OCR、NER、重排序器、目标检测器),涵盖内存管理、批处理以及 Superlinked Inference Engine。
vLLM 大会即将于 8 月 24 日至 26 日在旧金山举行,由 Inferact 在 Ray Summit 主办,届时将有来自主要 AI 基础设施公司的演讲者。
Kimi K3 完整模型在 16x GB10 集群上运行,平均每秒处理 20+ 个 token,并计划发布 vllm 镜像和说明。
关于在单张 RTX 5090 + 256GB DDR5 台式机上使用 vLLM 配合 CPU/内存卸载运行 DeepSeek-V4-Flash-0731 完整 100 万 token 上下文的技术报告,实现了约 800 tokens/秒的预填充速度和约 15 tokens/秒的解码速度。
DeepSeek V4 Flash在双GH200工作站上的详细基准测试,比较了SGLang和vLLM在1M上下文长度下使用DSpark投机解码的表现,发现SGLang更快,约为317 tok/s对比276 tok/s。
This repository provides configuration, patches, and tuning to run the DeepSeek V4 Flash 304B checkpoint on a single AMD MI300X in production, achieving 168 tok/s decode without quantization. It includes correctness overlays for vLLM ROCm, AITER tuning tables, and a hybrid KV cache strategy.
VIDRAFT 团队分享了他们在 Fast Gemma 挑战赛中使用的已验证的最先进推理优化配方,在单个 A10G 上使用完全公开的基于 vLLM 的配置,实现了 510.58 TPS,PPL 为 2.39。
据报道,一个四行修复将 DeepSeek-V4-Flash 的预填充速度从 10K 上下文下的 127 t/s 提升至 312 t/s,从 40K 上下文下的 91 t/s 提升至 283 t/s,解码速度保持不变。该补丁通过 club-3090 项目分享,该项目用于在 RTX 3090 上提供 LLM 服务。
一条推文串分享了一份精心挑选的 LLM 推理学习资源清单,涵盖分词、GPU 硬件、量化与推测解码等优化技术,以及 vLLM 和 SGLang 等推理引擎,并附有 NVIDIA 架构师演讲的总结。