试了 Qwen3.6-27B-UD-Q6_K_XL.gguf 配 CloudeCode,真不敢相信居然能用

Reddit r/LocalLLaMA 模型

摘要

用户报告称,在 RTX 5090 本地运行 Qwen3-27B-UD-Q6_K_XL.gguf,200K 上下文速度约 50 tok/s,编码表现出乎意料地可用,标志着本地模型质量大幅跃升。

于是我在 RTX 5090 上用 llama.cpp 跑了 Qwen3-27B-UD-Q6\_K\_XL.gguf,上下文开到 200K。速度大概 50 tok/s,还行吧,我对这块不熟,也许还能再调。重点是,我很久没碰本地模型写代码了,真不敢相信现在已经能用了?当然跟 Opus 4.7 的顶级体验还有差距,但咱们确实越来越近了。https://preview.redd.it/3pbvuks69twg1.png?width=2556&format=png&auto=webp&s=0ed498974c33bd33d807bf1b91e310c346f1e69c 我挑了个挺难的活儿,不是简单的 CRUD,想看看它能不能先给出个靠谱点的方案,结果一次就过了。当然这只是初印象,还没真拿去日常开发,但至少目前看来比我之前试的模型强太多,那些模型动不动就胡言乱语。
查看原文

相似文章