试试这个针对 27B 的“high”推理模式(已在 VLLM 上测试)

Reddit r/LocalLLaMA 新闻

摘要

作者在 VLLM 上对 27B 模型进行了实验,通过混合 low 和 xhigh 模式的提示,创建了一个“high”推理模式,从而获得了更高效、更愉快的推理输出。

经过大量调整,我得出结论,27B 缺少一个介于 low 和 xhigh 之间的推理模式。“medium”模式实际上并不是中等,它会删除模型的显式指令。启用 medium 时,模型表现非常不同——对我来说,它似乎退化得更像 3.6,并失去了一些 3.8 的提升。模型中的 low 和 high 模式行为似乎几乎完全通过推理指令中的特定关键词触发,并且表现得惊人地二元化。你可以在推理指令中添加所有想要的额外指令,并调整提示,但模型大多忽略这些变化。你可以要求中等努力,但它就是不这样做。由于这种奇怪的行为,我尝试混合 low 和 xhigh 提示中的词语,直到模型输出长度更合理的推理。它似乎效果很好,最终结果是一个 high 推理模式,推理块通常只有 xhigh 推理的 1/5 大小。输出质量似乎不错,更接近 xhigh 而不是 low 或 medium,而且推理肯定短得多,这使得模型使用起来更愉快。尝试下面的聊天模板修改,将“high”添加到你的推理努力中,看看你能否进一步改进,或者它是否会降低模型性能 -- 在 reasoning_effort 中添加 high -- {%- if resolved_reasoning_effort not in ('xhigh', 'high', 'medium', 'low') %} {{- raise_exception('Unexpected reasoning effort ' ~ reasoning_effort ~ '. Supported types are xhigh (default), high, medium, and low.') }} {%- endif %} -- 为 high 添加新的混合提示,混合 low 和 xhigh 的提示 -- {%- elif resolved_reasoning_effort == 'high' %} {%- set reasoning_instructions = 'Reasoning effort is set to halfway between low and xhigh. Please think careful but brief, validate key assumptions but keep it brief, and move quickly to the conclusion without unnecessary elaboration.' %}
查看原文

相似文章

DeepSeek-V4-Flash-0731:当“Low”高于“High”

Reddit r/LocalLLaMA

一位开发者对 DeepSeek-V4-Flash-0731 的四种推理努力模式(无、低、高、最大)进行了基准测试,发现低模式出人意料地冗长,并且 OpenRouter 存在一个影响推理努力模式的 bug。