标签
用户分享了基准测试结果,显示 vLLM 的预填充性能显著快于 llama.cpp 和其他引擎,并质疑这种速度差异背后的技术原因。
Qwen3.8-Flash-Next-GGUF 模型的 MTP 已发布,并提供了与 llama.cpp、vLLM 和 Ollama 等推理工具集成的详细部署说明。
本文详细测试了Qwen3.8-Flash-Next-NVFP4与Qwen3.8-27B-FP8两款AI模型在各类任务中的性能表现,结果显示Flash-Next版本在速度与失败率方面更具优势,但在处理多步骤符号任务时表现较弱。
文章报道,Qwen3.8-Flash-Next 模型在配置了 4 个 AMD R9700 GPU 的系统上,使用优化的 vLLM 和自定义 Docker 镜像,实现了每秒 120 个 token 的生成速度和每秒 12k 个 token 的预填充速度。
本文是一份关于大语言模型部署的详细指南,涵盖了延迟、吞吐、显存等关键指标,并以实际案例说明如何优化性能和选择硬件。
LLM推理工程关键概念的教育概述,涵盖KV cache、PagedAttention、Flash Attention和连续批处理等技术,以优化推理性能。
Josh Tobin 报道了自动化研究中的一项成功,其中 AI 识别并帮助修复了可能影响 vLLM 和 SGLang 推理性能的边界情况,特别是在 FlashInfer 库中。
ExFold是一个统一的无训练框架,通过将被排除专家的贡献折叠到保留专家中,加速MoE模型推理,实现高达1.41倍的加速,同时保持高质量。
vLLM引入了一个原生的分片权重传输引擎,使用Ray Direct Transport (RDT)来在大规模在线强化学习环境中进行高效的权重同步,从而提升像Kimi K2这样的模型的性能。
这是 Qwen3.8-27B AI 模型的完全量化 4-bit NVFP4 版本,采用 QUASAR 方法进行训练,以在保持高质量的同时减小模型大小。
用户评测显示,Qwen 3.8 27b 在房地产和金融领域的专业资格考试中表现卓越,借助工具和引导式搜索,得分高达98.44%。
在Hot Chips 2026上的一场演讲探讨了高带宽闪存(HBF)技术及其在机器学习领域的潜在应用,重点介绍了利用vLLM将模型权重和KV缓存存储在HBF中以提升容量的方案。
Aayush Saini 已加入 vLLM 项目担任主要维护者,成为 vLLM 社区中来自印度的首位人士,与来自 Meta、Google 和 AMD 的团队合作。
用户使用 Aider 对 Qwen 3.8 27B 进行基准测试,发现其得分为 72.9,与 Gemini 2.5 Pro 相当,并通过 vLLM 在 MacBook 上进行本地推理,优于其他最先进模型。
Ling Tiny 已替代 Gemma4-12B 作为辅助模型在 4060Ti GPU 上,提供了惊人的速度;用户应避免使用 MTP,并使用 vLLM fork 来支持 BailingMoE3。
一份性能报告和指南,介绍如何在双 RTX 3090 GPU 上使用 vLLM 运行 Qwen3.8-27B 模型,实现每秒 308 个令牌的吞吐量,支持 32 个并发流,并提供 GitHub 仓库用于本地部署配置。
本文描述了使用8块B300 GPU托管具有2.8万亿参数的Kimi K3 AI模型,实现了每秒92个令牌,成本为每百万令牌190美元,同时与Unsloth的动态GGUF量化方法进行了比较。
用户从Windows切换到Linux,并将llamacpp替换为vllm,在AI推理中实现了30-50%的速度提升。
本文展示了在NVIDIA RTX 5090显卡上使用vLLM框架运行Qwen3.8-27B模型的实际部署流程与性能基准测试,涵盖262K令牌上下文窗口的配置细节与各项关键指标。