vllm

标签

Cards List
#vllm

问题:为什么 vLLM 的预填充速度远超其他推理引擎?

Reddit r/LocalLLaMA ↗ · 2026-09-01

用户分享了基准测试结果,显示 vLLM 的预填充性能显著快于 llama.cpp 和其他引擎,并质疑这种速度差异背后的技术原因。

0 人收藏 0 人点赞
#vllm

MTP 已发布 Qwen3.8-Flash-Next-GGUF

Reddit r/LocalLLaMA ↗ · 2026-09-01 缓存

Qwen3.8-Flash-Next-GGUF 模型的 MTP 已发布,并提供了与 llama.cpp、vLLM 和 Ollama 等推理工具集成的详细部署说明。

0 人收藏 0 人点赞
#vllm

Qwen3.8-Flash-Next-NVFP4 对比 Qwen3.8-27B-FP 测试结果

Reddit r/LocalLLaMA ↗ · 2026-08-31

本文详细测试了Qwen3.8-Flash-Next-NVFP4与Qwen3.8-27B-FP8两款AI模型在各类任务中的性能表现,结果显示Flash-Next版本在速度与失败率方面更具优势,但在处理多步骤符号任务时表现较弱。

0 人收藏 0 人点赞
#vllm

Qwen3.8-Flash-Next 将 4xR9700 变成一个本地AI强机!使用优化的vLLM,单请求120 t/s 生成速度和12k t/s 预填充

Reddit r/LocalLLaMA ↗ · 2026-08-30

文章报道,Qwen3.8-Flash-Next 模型在配置了 4 个 AMD R9700 GPU 的系统上,使用优化的 vLLM 和自定义 Docker 镜像,实现了每秒 120 个 token 的生成速度和每秒 12k 个 token 的预填充速度。

0 人收藏 0 人点赞
#vllm

@wquguru: https://x.com/wquguru/status/2093634146082152683

X AI KOLs Timeline ↗ · 2026-08-29 缓存

本文是一份关于大语言模型部署的详细指南,涵盖了延迟、吞吐、显存等关键指标,并以实际案例说明如何优化性能和选择硬件。

0 人收藏 0 人点赞
#vllm

@pallavishekhar_: 学习LLM推理工程 - Prefill vs Decode - KV Cache - PagedAttention - Flash Attention - Continuous Batching…

X AI KOLs Timeline ↗ · 2026-08-28 缓存

LLM推理工程关键概念的教育概述,涵盖KV cache、PagedAttention、Flash Attention和连续批处理等技术,以优化推理性能。

0 人收藏 0 人点赞
#vllm

@josh_tobin_: 自动化研究的一个有趣小胜利:我们发现并帮助修复了一些可能影响推理性能的边界情况…

X AI KOLs Timeline ↗ · 2026-08-27 缓存

Josh Tobin 报道了自动化研究中的一项成功,其中 AI 识别并帮助修复了可能影响 vLLM 和 SGLang 推理性能的边界情况,特别是在 FlashInfer 库中。

0 人收藏 0 人点赞
#vllm

ExFold:统一专家折叠框架实现无训练MoE预填充-解码加速

arXiv cs.LG ↗ · 2026-08-27 缓存

ExFold是一个统一的无训练框架,通过将被排除专家的贡献折叠到保留专家中,加速MoE模型推理,实现高达1.41倍的加速,同时保持高质量。

0 人收藏 0 人点赞
#vllm

@vllm_project: 这个权重传输引擎是vLLM原生的。任何基于Ray的训练器都可以通过单个WeightSource迭代器来采用它。…

X AI KOLs Following ↗ · 2026-08-26 缓存

vLLM引入了一个原生的分片权重传输引擎,使用Ray Direct Transport (RDT)来在大规模在线强化学习环境中进行高效的权重同步,从而提升像Kimi K2这样的模型的性能。

0 人收藏 0 人点赞
#vllm

采用 QUASAR QAD 的完全量化 NVFP4 Qwen3.8-27B

Reddit r/LocalLLaMA ↗ · 2026-08-26 缓存

这是 Qwen3.8-27B AI 模型的完全量化 4-bit NVFP4 版本,采用 QUASAR 方法进行训练,以在保持高质量的同时减小模型大小。

0 人收藏 0 人点赞
#vllm

Qwen 3.8 27b:工具与定向搜索在非编程专业领域的应用

Reddit r/LocalLLaMA ↗ · 2026-08-25

用户评测显示,Qwen 3.8 27b 在房地产和金融领域的专业资格考试中表现卓越,借助工具和引导式搜索,得分高达98.44%。

0 人收藏 0 人点赞
#vllm

LLMs可以通过利用推理引擎控制宿主机器

Hacker News Top ↗ · 2026-08-24 缓存

本文探讨了恶意LLMs如何利用推理引擎如vLLM中的漏洞来执行任意代码并控制宿主机器,并引用真实世界的CVEs。

0 人收藏 0 人点赞
#vllm

Hot Chips 2026: 高带宽闪存(HBF)技术应用

Hacker News Top ↗ · 2026-08-24 缓存

在Hot Chips 2026上的一场演讲探讨了高带宽闪存(HBF)技术及其在机器学习领域的潜在应用,重点介绍了利用vLLM将模型权重和KV缓存存储在HBF中以提升容量的方案。

0 人收藏 0 人点赞
#vllm

@Aayush__Saini_:加入@vllm_project-sr项目担任主要维护者,与来自Meta、Google和AMD的团队合作 : ) 来自印度的首位……

X AI KOLs Following ↗ · 2026-08-24 缓存

Aayush Saini 已加入 vLLM 项目担任主要维护者,成为 vLLM 社区中来自印度的首位人士,与来自 Meta、Google 和 AMD 的团队合作。

0 人收藏 0 人点赞
#vllm

Qwen 3.8 27B Aider 得分

Reddit r/LocalLLaMA ↗ · 2026-08-24

用户使用 Aider 对 Qwen 3.8 27B 进行基准测试,发现其得分为 72.9,与 Gemini 2.5 Pro 相当,并通过 vLLM 在 MacBook 上进行本地推理,优于其他最先进模型。

0 人收藏 0 人点赞
#vllm

Ling Tiny:速度之王

Reddit r/LocalLLaMA ↗ · 2026-08-23

Ling Tiny 已替代 Gemma4-12B 作为辅助模型在 4060Ti GPU 上,提供了惊人的速度;用户应避免使用 MTP,并使用 vLLM fork 来支持 BailingMoE3。

0 人收藏 0 人点赞
#vllm

@malikwas1f:在 2× RTX 3090 上聚合吞吐量 308 tok/s — 无 NVLink,Qwen3.8-27B 在 vLLM 上运行,32 个并发流。足够支撑一整个集群……

X AI KOLs Timeline ↗ · 2026-08-23 缓存

一份性能报告和指南,介绍如何在双 RTX 3090 GPU 上使用 vLLM 运行 Qwen3.8-27B 模型,实现每秒 308 个令牌的吞吐量,支持 32 个并发流,并提供 GitHub 仓库用于本地部署配置。

0 人收藏 0 人点赞
#vllm

我使用8块B300部署了Kimi K3(2.8T参数)。速率92令牌/秒,每百万令牌190美元

Reddit r/LocalLLaMA ↗ · 2026-08-23

本文描述了使用8块B300 GPU托管具有2.8万亿参数的Kimi K3 AI模型,实现了每秒92个令牌,成本为每百万令牌190美元,同时与Unsloth的动态GGUF量化方法进行了比较。

0 人收藏 0 人点赞
#vllm

我终于从Windows切换到Linux,并获得了30-50%的速度提升。

Reddit r/LocalLLaMA ↗ · 2026-08-23

用户从Windows切换到Linux,并将llamacpp替换为vllm,在AI推理中实现了30-50%的速度提升。

0 人收藏 0 人点赞
#vllm

单卡 RTX 5090:Qwen3.8-27B NVFP4 在 vLLM 中实现真实 262K 上下文长度 — 短上下文速度达 77 tok/s,128K 上下文时为 64.7 tok/s

Reddit r/LocalLLaMA ↗ · 2026-08-22

本文展示了在NVIDIA RTX 5090显卡上使用vLLM框架运行Qwen3.8-27B模型的实际部署流程与性能基准测试,涵盖262K令牌上下文窗口的配置细节与各项关键指标。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈