试试这个针对 27B 的“high”推理模式(已在 VLLM 上测试)
摘要
作者在 VLLM 上对 27B 模型进行了实验,通过混合 low 和 xhigh 模式的提示,创建了一个“high”推理模式,从而获得了更高效、更愉快的推理输出。
经过大量调整,我得出结论,27B 缺少一个介于 low 和 xhigh 之间的推理模式。“medium”模式实际上并不是中等,它会删除模型的显式指令。启用 medium 时,模型表现非常不同——对我来说,它似乎退化得更像 3.6,并失去了一些 3.8 的提升。模型中的 low 和 high 模式行为似乎几乎完全通过推理指令中的特定关键词触发,并且表现得惊人地二元化。你可以在推理指令中添加所有想要的额外指令,并调整提示,但模型大多忽略这些变化。你可以要求中等努力,但它就是不这样做。由于这种奇怪的行为,我尝试混合 low 和 xhigh 提示中的词语,直到模型输出长度更合理的推理。它似乎效果很好,最终结果是一个 high 推理模式,推理块通常只有 xhigh 推理的 1/5 大小。输出质量似乎不错,更接近 xhigh 而不是 low 或 medium,而且推理肯定短得多,这使得模型使用起来更愉快。尝试下面的聊天模板修改,将“high”添加到你的推理努力中,看看你能否进一步改进,或者它是否会降低模型性能 -- 在 reasoning_effort 中添加 high -- {%- if resolved_reasoning_effort not in ('xhigh', 'high', 'medium', 'low') %} {{- raise_exception('Unexpected reasoning effort ' ~ reasoning_effort ~ '. Supported types are xhigh (default), high, medium, and low.') }} {%- endif %} -- 为 high 添加新的混合提示,混合 low 和 xhigh 的提示 -- {%- elif resolved_reasoning_effort == 'high' %} {%- set reasoning_instructions = 'Reasoning effort is set to halfway between low and xhigh. Please think careful but brief, validate key assumptions but keep it brief, and move quickly to the conclusion without unnecessary elaboration.' %}
相似文章
Qwen3.8-27B中'medium'和'xhigh'推理努力度的区别确实非常惊人。
用户观察到,在Qwen3.8-27B中将推理努力度设置为'xhigh'时,生成的思考标记比'medium'多得多,标记使用量差异显著。
DeepSeek-V4-Flash-0731:当“Low”高于“High”
一位开发者对 DeepSeek-V4-Flash-0731 的四种推理努力模式(无、低、高、最大)进行了基准测试,发现低模式出人意料地冗长,并且 OpenRouter 存在一个影响推理努力模式的 bug。
VibeThinker: 在推理上击败Opus 4.5的3B参数模型,采用新颖的SFT+GRPO方法
本技术报告介绍了VibeThinker-3B,一个3B参数的密集模型,在AIME26和LiveCodeBench等基准测试上实现了前沿水平的推理性能,通过结合基于课程的SFT、多领域RL和离线自蒸馏,匹配或超越了DeepSeek V3.2和GLM-5等更大的模型。
医疗模型:Reasoning-Medical-27B (Qwen3.6-27B微调)
Reasoning-Medical-27B 是一个基于 Qwen3.6-27B 微调的高级医学推理模型,使用 GRPO 和 Unsloth 优化方法,在 37 万个问答示例上通过思维链推理进行训练。
@PKUCXK: 你可以在思考模式(通过网页/应用)中尝试以下两个提示,以获得在某些领域(如计数)更好的模型体验…
Xiaokang Chen 分享了两个提示词「Think with Grounding」和「Think with Pointing」,用于在思考模式下提升模型在计数等领域的表现。这些提示词利用边界框和点,使多模态大模型的推理过程更接近人类思维。