Qwen 3.6 27B 在 262K 上下文以内表现稳定。使用 Rope/Yarn 缩放,你们最高达到了多少?

Reddit r/LocalLLaMA 新闻

摘要

用户分享了将 Qwen 3.6 27B 推至 262K 上下文并获得连贯结果的体验,并讨论了使用 Rope/Yarn 缩放进一步扩展的方法,以及在 RTX 3090 Ti 上的 kv-cache 交换策略。

配置:i7 12700K | RTX 3090 TI | 96GB RAM Qwen 3.6 27B Q3/Q5 KXL UD 我整周都在将 Qwen 3.6 27B 推至 200K 上下文以上,它表现得非常出色。我印象深刻。今天达到了 262K 的上限,它仍然运行良好且连贯。我计划尝试 Yarn 看看能否推得更高。你们最高推到了多少?质量保持得如何?注意:如果你好奇为什么上下文这么高,是因为 mcp 工具和启动会话时的内存/摘要膨胀(40-50K),我们正在积极通过 mcp broker 服务器以及其他一些优化来解决。模型切换:因为有人问过:我从 Q5 kv 8/8 开始,直到 115K,然后降到 kv 4/4 直到 200K,再降到 Q3 kv 4/4 直到 262K。每次都很稳定,在我的 RTX 3090 TI 上速度也很稳定。
查看原文

相似文章

在32GB显存上以Q8量化使用Qwen3.6-27,接近100K上下文

Reddit r/LocalLLaMA

用户分享了他们在拥有32GB显存的RTX 5090上,使用Q8量化的Qwen3.6-27B模型尝试达到115K上下文长度的配置与实验过程,并给出了基准测试结果,以及上下文长度与kv-cache量化之间的权衡。

48GB VRAM + Qwen 3.6 27B 的最佳设置

Reddit r/LocalLLaMA

一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。

三元 Qwen3.6 27B 在 3090 上测试!

Reddit r/LocalLLaMA

用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。