speed-benchmark

标签

Cards List
#speed-benchmark

我将 Qwen3.8-27B 在 RTX 3090 上优化至单请求 99 tps 和批量请求 1150 tps

Reddit r/LocalLLaMA · 昨天

作者在 RTX 3090 GPU 上优化了 Qwen3.8-27B 模型的推理,通过各种量化和优化技术,实现了单请求高达 99 tps 和批量处理 1150 tps 的性能,并在 GitHub 上发布了更新的代码。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈