Qwen 3.6 27B 在 262K 上下文以内表现稳定。使用 Rope/Yarn 缩放,你们最高达到了多少?
摘要
用户分享了将 Qwen 3.6 27B 推至 262K 上下文并获得连贯结果的体验,并讨论了使用 Rope/Yarn 缩放进一步扩展的方法,以及在 RTX 3090 Ti 上的 kv-cache 交换策略。
配置:i7 12700K | RTX 3090 TI | 96GB RAM Qwen 3.6 27B Q3/Q5 KXL UD 我整周都在将 Qwen 3.6 27B 推至 200K 上下文以上,它表现得非常出色。我印象深刻。今天达到了 262K 的上限,它仍然运行良好且连贯。我计划尝试 Yarn 看看能否推得更高。你们最高推到了多少?质量保持得如何?注意:如果你好奇为什么上下文这么高,是因为 mcp 工具和启动会话时的内存/摘要膨胀(40-50K),我们正在积极通过 mcp broker 服务器以及其他一些优化来解决。模型切换:因为有人问过:我从 Q5 kv 8/8 开始,直到 115K,然后降到 kv 4/4 直到 200K,再降到 Q3 kv 4/4 直到 262K。每次都很稳定,在我的 RTX 3090 TI 上速度也很稳定。
相似文章
在32GB显存上以Q8量化使用Qwen3.6-27,接近100K上下文
用户分享了他们在拥有32GB显存的RTX 5090上,使用Q8量化的Qwen3.6-27B模型尝试达到115K上下文长度的配置与实验过程,并给出了基准测试结果,以及上下文长度与kv-cache量化之间的权衡。
@sachindetrax: 262K 上下文长度,运行于 16GB RTX 5070 Ti 显卡上。Qwen 3.8 27B Q3 模型达到约 25 tok/s,同时一个自适应 llama.cpp 分支在 RAM 和 VRAM 之间流式传输 KV 缓存…
llama.cpp 的一个自适应 KV 缓存流式传输分支,使得在 16GB RTX 5070 Ti GPU 上运行 Qwen 3.8 27B 模型并支持 262K 上下文成为可能,通过在内存与显存间高效管理,实现了约 25 tok/s 的速度。
48GB VRAM + Qwen 3.6 27B 的最佳设置
一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。
三元 Qwen3.6 27B 在 3090 上测试!
用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。
(NInfer分支) 我为Qwen-3.8 27B在双5090显卡上实现1M上下文的尝试
一位开发者分支了NInfer,这是一个C++20/CUDA推理引擎,添加了张量并行和YaRN绳索缩放,使得Qwen3.8-27B能够在双5090显卡上运行1M token上下文,并在特定解码场景中优于vLLM。