让 Volta 再次快起来

Reddit r/LocalLLaMA 工具

摘要

这篇文章介绍了 1Cat-vLLM,这是一个针对 NVIDIA V100 GPU 优化的 vLLM 分支,并将其性能与 llama.cpp 进行比较,用于服务像 Qwen3.6-35b 这样的大型语言模型。

对于拥有 V100 显卡的人,我想向你推荐 1Cat-vLLM,这是一个针对这些显卡进行优化服务的 vLLM 分支。展示 Qwen3.6-35b 的统计数据,比较了 Strix Halo 与高度优化的 llama.cpp 分支 (pwilkin) 和使用 1Cat 的 V100。这不是直接的比较,但我决定展示 llama-benchy 的原始数据,让大家了解性能。在我看来,对于十年老的 GPU 来说,这仍然非常好。欢迎任何其他优化建议!
查看原文

相似文章

vLLM v0.28.0

Hacker News Top

vLLM v0.28.0 是用于快速高效 LLM 推理和服务的开源库的更新版本,具有 PagedAttention 等增强功能和广泛的硬件支持。

Qwen3.6 27B 在 vLLM 中的表现比在 llama.cpp 中更差

Reddit r/LocalLLaMA

一名用户报告称,Qwen3.6-27B 模型在使用 llama.cpp 时比使用 vLLM 表现更好且更可靠,并指出尽管进行了大量配置,vLLM 仍出现工具调用错误和“被切除脑叶”的行为。