单张3090上为Qwen3.8 27B实现95+ TPS,支持100K生成与262K上下文

Reddit r/LocalLLaMA 工具

摘要

LlamAmpere v0.4发布,包含Ampere特定优化,在单张NVIDIA 3090 GPU上为Qwen3.8-27B模型实现超过95 TPS的速度,并支持262K上下文。

大家好!前一段时间我发布了关于LlamAmpere的帖子,这是一个针对Ampere架构优化的Llama.cpp分支(虽然它已同步到主分支,也将支持其他硬件)。感谢所有尝试并分享了30xx系列显卡结果的用户。我很高兴地宣布,今天早上我推送了v0.4版本。在测试的4.6bpw模型上,速度比上一个版本提升了约10%,同时最大上下文长度也增加了10%以上(技术上可以超过262K,但我尚未测试支持YaRN的自定义内核或图)。最接近的竞争来自vLLM,速度差距在10%以内,但最大上下文长度较低。与其他测试的llama.cpp选项相比,它显著更快。https://preview.redd.it/u70q7lew1bsh1.png?width=1080&format=png&auto=webp&s=a732113292448cdec9ba98e27c0855a25e5e3434 还有一些针对其他量化/格式的改进,例如EXL3速度显著提升(约为测试的4-XS-M量化速度的80%)。它的KLD略低,但在任务级别上我尚未发现统计显著性,因此我目前坚持使用XS-M模型(基于Swift-qwen的蒸馏构建,比标准训练更节省token,性能损失约1%)。4.3 bpw的EXL3模型如果你有兴趣进行2+并发预测,能提供更多空间。这些格式和IQ2/3代码簿量化的改进对12/16/20GB显存的用户最为有用。这些测量是在temp=1下进行的,与一些人们声称的temp=0和/或短生成下的虚荣速度不同。一如既往,请分享您的结果和配置细节,以便我持续改进!分支在这里:https://github.com/JakeATX/llamAmpere/blob/main/QWEN_AMPERE.md#build-and-run 使用的模型:https://huggingface.co/jakeatx/ATX-Swift-Qwen3.8-27B-Uncensored-IQ4_XS-M-GGUF 构建命令:git clone -b v0.4 https://github.com/JakeATX/llamAmpere.git llamAmpere cmake -S . -B build-sm86 -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=86 cmake --build build-sm86 -j8 --target llama-server 构建和启动(Linux):git clone -b v0.4 https://github.com/JakeATX/llamAmpere.git llamAmpere cmake -S . -B build-sm86 -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=86 cmake --build build-sm86 -j8 --target llama-server curl -L -o ATX-Swift-Qwen3.8-27B-Uncensored-IQ4_XS-M.gguf \ https://huggingface.co/jakeatx/ATX-Swift-Qwen3.8-27B-Uncensored-IQ4_XS-M-GGUF/resolve/main/ATX-Swift-Qwen3.8-27B-Uncensored-IQ4_XS-M.gguf -m ATX-Swift-Qwen3.8-27B-Uncensored-IQ4_XS-M.gguf -c 262144 \ -ngl 99 -fa on -ctk turbo5 -ctv turbo4 -b 4096 -ub 1024 -t 8 -tb 8 --parallel 1 cd ./build-sm86/bin/llama-server 之前,人们曾对量化KV缓存,尤其是TQ,表示担忧。简而言之,对于像Qwen这样的混合注意力模型,任何合理的KV量化策略都会被权重量化所主导。我们在这里使用的KV量化(TQ5/TQ4)的KLD小于从8位权重移动到4.6位权重时所见的1/3(并且KLD只是部分可加的,因此一些增量误差会抵消)。在任务级别上,当与8/8 KV进行测试时,此KV量化没有统计显著性(只是句子长度的微小变化)。我将在下一个版本中添加KVaRN,但使用比当前其他地方可用的更好的编解码器,因此在发布前需要更多测试。v0.5将主要专注于12GB显卡,但这应该具有全局生成速度提升,因此即使您不在24GB显卡上,也请分享您的结果。享受吧!
查看原文

相似文章

Qwen3.6:35b UD Q4_K_M 在 Nvidia P40 上实现 80 tok/s

Reddit r/LocalLLaMA

一位用户分享在单个 Nvidia P40 上使用 TheTom 的 TurboQuant 版 llama.cpp,以 Q4_K_M 量化方式和 100k 上下文运行 Qwen3.6 35B 模型,实现了 80 tok/s,并强调了多种优化。