Qwen3.8-27B 思考模式 xhigh 与关闭思考模式 - Apple M5 Max

Reddit r/LocalLLaMA 新闻

摘要

在MacBook Pro M5 Max上的基准测试显示,禁用Qwen3.8-27B的思考模式会严重降低输出质量,而xhigh思考模式则使用5.5倍更多的令牌并运行6倍更长时间。

我在我的MacBook Pro M5 Max上使用oMLX进行了一些基准测试:关闭Qwen3.8-27B的思考模式对输出质量有重大影响。开启xhigh思考模式会消耗5.5倍的令牌并运行6倍更长时间。Qwen3.8-27B在工作中投入的思考量确实巨大——这一点已经有很多讨论。完全关闭思考模式的影响很大——在质量上,它基本上使模型落后于Qwen3.6-35B-A3B和其他提供更高Tok/s的MoE模型。详情请见:比较基准测试运行 | llm-bench.io
查看原文

相似文章

Qwen 3.8 27B 表现优异,但默认启用过度推理模式

Simon Willison's Blog

Qwen 3.8 27B 是阿里巴巴通义千问实验室推出的一款强大的开源270亿参数多模态大语言模型。它在基准测试中表现突出,但被批评默认启用过度推理模式,这在消费级硬件上拖慢了运行速度。

ThinkingCap-Qwen3.6-27B 值得一看

Reddit r/LocalLLaMA

用户报告称,与 Qwen3.5-27B 相比,ThinkingCap-Qwen3.6-27B 的每秒 token 数(tps)有所提升,且质量未受影响,建议将其作为日常主力模型使用,直至 Qwen 推出下一个版本。