Qwen3.8-27B中'medium'和'xhigh'推理努力度的区别确实非常惊人。

Reddit r/LocalLLaMA 新闻

摘要

用户观察到,在Qwen3.8-27B中将推理努力度设置为'xhigh'时,生成的思考标记比'medium'多得多,标记使用量差异显著。

我目前正在使用Unsloth的UD-Q4_K_XL测试Qwen3.8-27B,运行在新构建的llama.cpp上。我有一块22GB的RTX 2080TI,使用q8_0量化可以容纳100k上下文,并且通过MTP和--spec-draft-n-max 4设置,我得到大约40令牌/秒,略低于Qwen3.6-27B,但仍然可用。我一直尝试使用llama.cpp的webui测试一些确实愚蠢的单次提示,要求模型创建完全功能的HTML克隆,如Flappy Bird和Pac-Man等,而改变推理努力度带来的差异至少可以说是令人惊讶的。将其设置为'medium'似乎几乎没有思考,最多几千标记,甚至少于3.6-27B。而当使用'xhigh'时,我至少得到1.5万到2万思考标记,Pac-Man示例甚至达到了4万标记。我很清楚我可以在llama.cpp中限制推理预算,但我想知道这是预期的模型行为还是有什么地方出了问题。你们中有谁看到了这个现象吗?
查看原文

相似文章

不流行观点:Qwen 3.8 27b 不是过度思考者

Reddit r/LocalLLaMA

文章认为,Qwen 3.8 27b 增加的推理令牌使用量与其他中国AI模型如 GLM 和 DeepSeek 相似,用户的挫败感源于硬件限制。它建议使用推理预算可以保持性能优于 Qwen 3.6。

Qwen 3.8 27B 表现优异,但默认启用过度推理模式

Simon Willison's Blog

Qwen 3.8 27B 是阿里巴巴通义千问实验室推出的一款强大的开源270亿参数多模态大语言模型。它在基准测试中表现突出,但被批评默认启用过度推理模式,这在消费级硬件上拖慢了运行速度。

DeepSeek-V4-Flash-0731:当“Low”高于“High”

Reddit r/LocalLLaMA

一位开发者对 DeepSeek-V4-Flash-0731 的四种推理努力模式(无、低、高、最大)进行了基准测试,发现低模式出人意料地冗长,并且 OpenRouter 存在一个影响推理努力模式的 bug。