vllm

标签

Cards List
#vllm

Ling 3.0 Flash 在 Strix Halo 上的表现

Reddit r/LocalLLaMA · 10小时前

推文报告称,AMD Strix Halo 上的 Ling 3.0 Flash 在使用 ROCm 优化格式时明显快于 Qwen-122b,但指出在某些测试框架中工具调用功能异常。

0 人收藏 0 人点赞
#vllm

我将 Qwen3.6 27B 的 GGUF 量化与 NVFP4、AWQ、AutoRound 和 FP8 进行了对比

Reddit r/LocalLLaMA · 14小时前

一项详细基准测试,比较了 Qwen3.6 27B 在 GGUF、NVFP4、AWQ、AutoRound 和 FP8 格式下的 16 种量化,测量与未量化参考的 KL 散度。纯权重的 GGUF 量化通常在质量-大小权衡上表现最佳,而 vLLM 量化则差异显著。

0 人收藏 0 人点赞
#vllm

@YRSM_Simon: 发现了 deepseek v4 flash vllm 本地部署的一个bug。 同一个 Session 秒回,切到另一个 Session 再切回来,直接重新 Prefill,kv cache 失效。 蹲了一整晚,100% 复现: A 第一次…

X AI KOLs Following · 昨天 缓存

发现 DeepSeek V4 flash 在 vLLM 本地部署中的 KV 缓存失效 Bug:切换 Session 后前缀缓存命中率为 0,导致重新 Prefill,耗时从约 1 秒暴涨到约 100 秒。根因疑为 vLLM 重用 free queue 块时调用 _maybe_evict_cached_block() 删除了缓存索引。

0 人收藏 0 人点赞
#vllm

两个标志将官方Ling-3.0-flash INT4在单个DGX Spark上的推理速度从20.8提升到38.7 tok/s

Reddit r/LocalLLaMA · 昨天

本文介绍了两个配置标志,它们将官方Ling-3.0-flash INT4在单个DGX Spark上的推理速度从20.8 tok/s提升到38.7 tok/s,同时提醒需要使用特定的vLLM分支,并指出在长上下文性能方面的权衡。

0 人收藏 0 人点赞
#vllm

为消费级Nvidia显卡启用PCI-E P2P将带来超乎你想象的收益

Reddit r/LocalLLaMA · 2天前

通过打补丁的驱动和vLLM环境变量为消费级Nvidia GPU启用PCI-E点对点(P2P),如基准测试所示,可免费获得约25%的预填充吞吐量提升。

0 人收藏 0 人点赞
#vllm

OasisKV:利用前瞻稀疏预取将解码中KV缓存扩展到HBM之外

Hugging Face Daily Papers · 3天前 缓存

OasisKV是一个以内存为中心的LLM推理系统,通过使用来自推测解码的前瞻令牌预取稀疏且重要的KV块,将完整KV缓存存储与HBM解耦,与密集vLLM相比实现了高达2.1倍的吞吐量提升,且精度损失极小。

0 人收藏 0 人点赞
#vllm

在 2x DGX Spark 上部署 DeepSeek v4 Flash 0731 — 5-7 GB 操作系统余量,你会如何降低 VRAM 占用并增加操作系统可用 RAM?

Reddit r/LocalLLaMA · 3天前

用户在使用 vLLM 在两台 DGX Spark 机器上部署 DeepSeek-V4-Flash-0731 时,寻求社区关于降低 VRAM 占用和释放操作系统 RAM 的建议,分享了详细的配置和内存测量数据。

0 人收藏 0 人点赞
#vllm

@CycleDecoded: 别再用原生 HuggingFace硬扛本地大模型推理了,显存直接爆满,吞吐量慢得像乌龟爬! 伯克利实验室出品的 vLLM,用搞操作系统内存分页(PagedAttention)的那套黑科技,直接把 GPU 显存压榨到了极限,KV Cache…

X AI KOLs Timeline · 4天前 缓存

伯克利 Sky Computing Lab 开源的 vLLM 是一个高性能 LLM 推理与服务库,通过 PagedAttention 和连续批处理大幅提升吞吐量、降低显存浪费,并兼容 OpenAI API 和多种硬件。

0 人收藏 0 人点赞
#vllm

深入vLLM:高吞吐量LLM推理系统剖析(2025)

Hacker News Top · 4天前 缓存

深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。

0 人收藏 0 人点赞
#vllm

我将vLLM的服务栈移植到C++20:66 MiB二进制,推理时无Python,输出与vLLM逐token核对

Reddit r/LocalLLaMA · 4天前

作者将vLLM的服务栈移植到C++20,生成一个66 MiB的二进制文件,推理时无Python,可逐token与vLLM核对,且在测试硬件上吞吐量具竞争力。

0 人收藏 0 人点赞
#vllm

2 x 5070ti Qwen 27B 完整配置/统计

Reddit r/LocalLLaMA · 4天前

技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。

0 人收藏 0 人点赞
#vllm

@akshay_pachaar: https://x.com/akshay_pachaar/status/2084992645966016757

X AI KOLs Timeline · 5天前 缓存

一份技术指南,演示如何使用开源工具在单个 GPU 上部署五个专用的小型模型(SLM、OCR、NER、重排序器、目标检测器),涵盖内存管理、批处理以及 Superlinked Inference Engine。

0 人收藏 0 人点赞
#vllm

@robertnishihara: 这是*年度*vLLM 盛会。推理是基础设施中发展最快的部分之一。这是了解前沿/最新发展的最佳活…

X AI KOLs Following · 5天前 缓存

vLLM 大会即将于 8 月 24 日至 26 日在旧金山举行,由 Inferact 在 Ray Summit 主办,届时将有来自主要 AI 基础设施公司的演讲者。

0 人收藏 0 人点赞
#vllm

Kimi K3 完整模型在 16x GB10 集群上运行,速度超过 20 tps

Reddit r/LocalLLaMA · 6天前

Kimi K3 完整模型在 16x GB10 集群上运行,平均每秒处理 20+ 个 token,并计划发布 vllm 镜像和说明。

0 人收藏 0 人点赞
#vllm

[Deepseek-V4-Flash-0731] 在单张RTX5090 + DDR5桌面配置下,通过VLLM CPU/内存卸载实现完整1M上下文,~800 tps预填充 & 15+ tps解码 [智能体编码]

Reddit r/LocalLLaMA · 6天前

关于在单张 RTX 5090 + 256GB DDR5 台式机上使用 vLLM 配合 CPU/内存卸载运行 DeepSeek-V4-Flash-0731 完整 100 万 token 上下文的技术报告,实现了约 800 tokens/秒的预填充速度和约 15 tokens/秒的解码速度。

0 人收藏 0 人点赞
#vllm

针对双GH200优化的DSv4-Flash:SGLang上PP达10,000 tok/s,TG超过300 tok/s

Reddit r/LocalLLaMA · 6天前 缓存

DeepSeek V4 Flash在双GH200工作站上的详细基准测试,比较了SGLang和vLLM在1M上下文长度下使用DSpark投机解码的表现,发现SGLang更快,约为317 tok/s对比276 tok/s。

0 人收藏 0 人点赞
#vllm

DeepSeek V4 Flash on a Single AMD MI300X

Hacker News Top · 6天前 缓存

This repository provides configuration, patches, and tuning to run the DeepSeek V4 Flash 304B checkpoint on a single AMD MI300X in production, achieving 168 tok/s decode without quantization. It includes correctness overlays for vLLM ROCm, AITER tuning tables, and a hybrid KV cache strategy.

0 人收藏 0 人点赞
#vllm

Fast Gemma 的已验证推理优化配方(7 分钟阅读)

TLDR AI · 2026-08-04 缓存

VIDRAFT 团队分享了他们在 Fast Gemma 挑战赛中使用的已验证的最先进推理优化配方,在单个 A10G 上使用完全公开的基于 vLLM 的配置,实现了 510.58 TPS,PPL 为 2.39。

0 人收藏 0 人点赞
#vllm

@malikwas1f:四行修复让 DeepSeek-V4-Flash 的预填充速度在 10K 下从 127 提升至 312 t/s,在 40K 下从 91 提升至 283 t/s,并通过了召回率检查……

X AI KOLs Timeline · 2026-08-03 缓存

据报道,一个四行修复将 DeepSeek-V4-Flash 的预填充速度从 10K 上下文下的 127 t/s 提升至 312 t/s,从 40K 上下文下的 91 t/s 提升至 283 t/s,解码速度保持不变。该补丁通过 club-3090 项目分享,该项目用于在 RTX 3090 上提供 LLM 服务。

0 人收藏 0 人点赞
#vllm

@divaagurlxw: 我花了几个月时间学习 LLM 推理。以下是我遇到过的最佳资源。1. 基础……

X AI KOLs Timeline · 2026-08-02 缓存

一条推文串分享了一份精心挑选的 LLM 推理学习资源清单,涵盖分词、GPU 硬件、量化与推测解码等优化技术,以及 vLLM 和 SGLang 等推理引擎,并附有 NVIDIA 架构师演讲的总结。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈