让 Volta 再次快起来
摘要
这篇文章介绍了 1Cat-vLLM,这是一个针对 NVIDIA V100 GPU 优化的 vLLM 分支,并将其性能与 llama.cpp 进行比较,用于服务像 Qwen3.6-35b 这样的大型语言模型。
对于拥有 V100 显卡的人,我想向你推荐 1Cat-vLLM,这是一个针对这些显卡进行优化服务的 vLLM 分支。展示 Qwen3.6-35b 的统计数据,比较了 Strix Halo 与高度优化的 llama.cpp 分支 (pwilkin) 和使用 1Cat 的 V100。这不是直接的比较,但我决定展示 llama-benchy 的原始数据,让大家了解性能。在我看来,对于十年老的 GPU 来说,这仍然非常好。欢迎任何其他优化建议!
相似文章
Show HN: Tiny-vLLM – 使用C++和CUDA的高性能LLM推理引擎
Tiny-vLLM是一个高性能的LLM推理引擎,采用C++和CUDA实现,提供连续批处理和PagedAttention等特性,并作为教育资源。
vLLM v0.28.0
vLLM v0.28.0 是用于快速高效 LLM 推理和服务的开源库的更新版本,具有 PagedAttention 等增强功能和广泛的硬件支持。
@no_stp_on_snek: 当所有人都在讨论 @SpaceXAI、@AnthropicAI 和 @OpenAI 的更新(但 @GoogleAI 呢?)... 我去测试了…
Unsloth 的 NVFP4 量化模型在 vLLM 和 llama.cpp 之间推理性能的详细比较,重点说明了 vLLM 在预填充速度上的优势,但 llama.cpp 在单流智能体工作负载中的解码和缓存优势。
Qwen3.6 27B 在 vLLM 中的表现比在 llama.cpp 中更差
一名用户报告称,Qwen3.6-27B 模型在使用 llama.cpp 时比使用 vLLM 表现更好且更可靠,并指出尽管进行了大量配置,vLLM 仍出现工具调用错误和“被切除脑叶”的行为。
如果你有3090或其他30xx显卡用于本地大语言模型,我有些东西要给你
本文介绍了一个针对NVIDIA Ampere架构GPU(如3090)优化的llama.cpp自定义分支,能够在大上下文窗口下为27B参数模型实现每秒超过90个令牌的速度,使得本地推理速度快于API速度。