Qwen3.8-27B 思考模式 xhigh 与关闭思考模式 - Apple M5 Max
摘要
在MacBook Pro M5 Max上的基准测试显示,禁用Qwen3.8-27B的思考模式会严重降低输出质量,而xhigh思考模式则使用5.5倍更多的令牌并运行6倍更长时间。
我在我的MacBook Pro M5 Max上使用oMLX进行了一些基准测试:关闭Qwen3.8-27B的思考模式对输出质量有重大影响。开启xhigh思考模式会消耗5.5倍的令牌并运行6倍更长时间。Qwen3.8-27B在工作中投入的思考量确实巨大——这一点已经有很多讨论。完全关闭思考模式的影响很大——在质量上,它基本上使模型落后于Qwen3.6-35B-A3B和其他提供更高Tok/s的MoE模型。详情请见:比较基准测试运行 | llm-bench.io
相似文章
Qwen3.8-27B中'medium'和'xhigh'推理努力度的区别确实非常惊人。
用户观察到,在Qwen3.8-27B中将推理努力度设置为'xhigh'时,生成的思考标记比'medium'多得多,标记使用量差异显著。
Qwen 3.8 27B 表现优异,但默认启用过度推理模式
Qwen 3.8 27B 是阿里巴巴通义千问实验室推出的一款强大的开源270亿参数多模态大语言模型。它在基准测试中表现突出,但被批评默认启用过度推理模式,这在消费级硬件上拖慢了运行速度。
@_akhaliq: bottlecapai/ThinkingCap-Qwen3.6-27B —— Qwen3.6-27B 具备平均减少50%思考令牌、最佳情况减少90%以上的能力
bottlecapai 发布了 ThinkingCap-Qwen3.6-27B,这是 Qwen3.6-27B 的微调版本,平均减少50%的思考令牌,最佳情况下减少90%,提升了效率。
在128 GB M5 Max上运行Qwen3.8-Flash-Next(79 GB,2-bit)以350K上下文持续3.5小时——速度与上下文深度权衡,100轮对话,一张图表
本文报告了在MacBook Pro M5 Max上运行Qwen3.8-Flash-Next模型的情况,对100轮对话中速度与上下文深度进行基准测试,并深入分析性能及长上下文下角色混淆等问题。
ThinkingCap-Qwen3.6-27B 值得一看
用户报告称,与 Qwen3.5-27B 相比,ThinkingCap-Qwen3.6-27B 的每秒 token 数(tps)有所提升,且质量未受影响,建议将其作为日常主力模型使用,直至 Qwen 推出下一个版本。