标签
一份性能报告和指南,介绍如何在双 RTX 3090 GPU 上使用 vLLM 运行 Qwen3.8-27B 模型,实现每秒 308 个令牌的吞吐量,支持 32 个并发流,并提供 GitHub 仓库用于本地部署配置。