Qwen 3.8 27b搭配DeepSeek Harness令人惊叹!!目前体验与性能。

Reddit r/LocalLLaMA 新闻

摘要

用户分享了使用Qwen 3.8 27b模型搭配DeepSeek Harness的积极体验,赞扬其稳定性和长上下文处理能力,但提到速度限制,并期待未来的模型发布。

https://preview.redd.it/wkg27e152qjh1.png?width=853&format=png&auto=webp&s=2e3f8b11ea6393041f501e95c5835f9bea0245dd 所以,我一直在尝试不同的harness和编程代理搭配新的Qwen 3.8,尝试了很多之后,我对DeepSeek Harness印象深刻,搭配Qwen后,得到了一些令人惊叹的结果,真的感觉手里有了有价值的东西。它稳定运行,不出错,也不失败。我已经运行了10个小时,即使上下文达到90k,它也能自动压缩,不会丢失位置和任务。处理了1000万个输入token,它始终不偏离目标,每个问题都一次性解决。唯一的缺点是速度,当上下文增长时,我的显卡(RTX 3090)以230w功耗运行,平均速度约为37 token/s。在干净的新提示下,大约50 token/s,在Unsloth Studio的新聊天窗口中,大约56-60 token/s。我使用的量化是UD q4 k xl + vision F16,上下文设置为92k,启用了MTP和ngram,GPU层数设置为66,没有CPU offloading。根据我在该子版块了解到的信息,思考模式默认使用xHigh thinking(至少在llama.ccp中),这就是为什么结果如此出色,但它确实思考时间很长,有时会思考20分钟才开始写。我不确定如何调整思考,但我对xHigh和稍长的等待时间感到满意。我现在需要并祈祷Qwen能推出35b moe模型,因为这个密集模型无法全天候作为伴侣代理运行(即使我的显卡性能不错)。密集模型意味着没有CPU offloading,只能在16GB以上显存上运行,最好有Blackwell GPU,我听说有人用5090搭配vllm可以达到150-200 token/s。
查看原文

相似文章

Qwen/Qwen3.6-27B

Hugging Face Models Trending

Qwen 在 Hugging Face 上发布了开源权重模型 Qwen3.6-27B,该模型具备更高的稳定性、强大的智能体编程能力以及思维链保留特性,有助于提升开发者的工作效率。