Qwen3.8-27B中'medium'和'xhigh'推理努力度的区别确实非常惊人。
摘要
用户观察到,在Qwen3.8-27B中将推理努力度设置为'xhigh'时,生成的思考标记比'medium'多得多,标记使用量差异显著。
我目前正在使用Unsloth的UD-Q4_K_XL测试Qwen3.8-27B,运行在新构建的llama.cpp上。我有一块22GB的RTX 2080TI,使用q8_0量化可以容纳100k上下文,并且通过MTP和--spec-draft-n-max 4设置,我得到大约40令牌/秒,略低于Qwen3.6-27B,但仍然可用。我一直尝试使用llama.cpp的webui测试一些确实愚蠢的单次提示,要求模型创建完全功能的HTML克隆,如Flappy Bird和Pac-Man等,而改变推理努力度带来的差异至少可以说是令人惊讶的。将其设置为'medium'似乎几乎没有思考,最多几千标记,甚至少于3.6-27B。而当使用'xhigh'时,我至少得到1.5万到2万思考标记,Pac-Man示例甚至达到了4万标记。我很清楚我可以在llama.cpp中限制推理预算,但我想知道这是预期的模型行为还是有什么地方出了问题。你们中有谁看到了这个现象吗?
相似文章
不流行观点:Qwen 3.8 27b 不是过度思考者
文章认为,Qwen 3.8 27b 增加的推理令牌使用量与其他中国AI模型如 GLM 和 DeepSeek 相似,用户的挫败感源于硬件限制。它建议使用推理预算可以保持性能优于 Qwen 3.6。
Qwen 3.8 27B 表现优异,但默认启用过度推理模式
Qwen 3.8 27B 是阿里巴巴通义千问实验室推出的一款强大的开源270亿参数多模态大语言模型。它在基准测试中表现突出,但被批评默认启用过度推理模式,这在消费级硬件上拖慢了运行速度。
试试这个针对 27B 的“high”推理模式(已在 VLLM 上测试)
作者在 VLLM 上对 27B 模型进行了实验,通过混合 low 和 xhigh 模式的提示,创建了一个“high”推理模式,从而获得了更高效、更愉快的推理输出。
DeepSeek-V4-Flash-0731:当“Low”高于“High”
一位开发者对 DeepSeek-V4-Flash-0731 的四种推理努力模式(无、低、高、最大)进行了基准测试,发现低模式出人意料地冗长,并且 OpenRouter 存在一个影响推理努力模式的 bug。
Qwen3.6-27B 推测解码在更大量化下性能提升
Qwen3.6-27B 模型在使用更大量化级别时,推测解码性能提升,推理效率增强。