试了 Qwen3.6-27B-UD-Q6_K_XL.gguf 配 CloudeCode,真不敢相信居然能用
摘要
用户报告称,在 RTX 5090 本地运行 Qwen3-27B-UD-Q6_K_XL.gguf,200K 上下文速度约 50 tok/s,编码表现出乎意料地可用,标志着本地模型质量大幅跃升。
于是我在 RTX 5090 上用 llama.cpp 跑了 Qwen3-27B-UD-Q6\_K\_XL.gguf,上下文开到 200K。速度大概 50 tok/s,还行吧,我对这块不熟,也许还能再调。重点是,我很久没碰本地模型写代码了,真不敢相信现在已经能用了?当然跟 Opus 4.7 的顶级体验还有差距,但咱们确实越来越近了。https://preview.redd.it/3pbvuks69twg1.png?width=2556&format=png&auto=webp&s=0ed498974c33bd33d807bf1b91e310c346f1e69c 我挑了个挺难的活儿,不是简单的 CRUD,想看看它能不能先给出个靠谱点的方案,结果一次就过了。当然这只是初印象,还没真拿去日常开发,但至少目前看来比我之前试的模型强太多,那些模型动不动就胡言乱语。
相似文章
@cniongolo: 我不确定大家是否已经意识到,你实际上可以在双 GPU 上运行 Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-MTP-GGUF…
演示了在双路 Nvidia RTX PRO 6000 Blackwell GPU 上,使用 Hugging Face Inference 运行自定义 Qwen 模型(Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-MTP-GGUF),达到每秒约 195 个 token 的处理速度。
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。
@cyrilXBT: 太不可思议了。Qwen 3.8 27B 现在在本地 RTX 4060 上仅用 8GB 显存就能愉快运行。你看到的这是一个 64k 上下文…
一位用户分享称,Qwen 3.8 27B 模型通过 Unsloth 的 IQ4_XS 量化,在仅有 8GB 显存的 RTX 4060 上本地运行,实现了 64k 上下文窗口和令人印象深刻的性能指标。
首次本地LLM调优尝试:在RTX 5080 16GB上实现Qwen3.8-27B真实Q4_K_M量化,上下文长度约50-61K时速度为13.2 tok/s
一位用户详细描述了他们首次在RTX 5080 16GB上对Qwen3.8-27B模型进行Q4_K_M量化的调优尝试,通过选择性将FFN张量卸载到CPU,在50-61K上下文长度下实现了约13.2 tokens per second的速度,以提升性能。
实验:Qwen3.8-2.4T-A95B 在 RTX 5090 + RTX 5060 Ti 上本地运行,约 0.80 tok/s
一个实验,使用 llama.cpp 在双消费级 GPU(RTX 5090 + 5060 Ti)上本地运行 Qwen3.8-2.4T-A95B MoE 模型,启用 MTP 推测解码后达到约 0.8 tok/s。