Pi编码代理如何控制Qwen的思考长度?(Qwen 35B A3B,llama-server)

Reddit r/LocalLLaMA 新闻

摘要

讨论Pi编码代理如何在llama-server上控制Qwen 35B A3B模型的思考长度,而其他客户端却无法做到。

我通过llama-server运行Qwen 35B A3B,并将推理预算设置为-1(无限制)进行测试。在我尝试过的每个客户端中,模型在响应前都会无休止地思考。但使用Pi时,它只进行最低限度的思考,而且回答仍然相当准确——这是一个显著的差异。我的第一反应是系统提示的问题,于是我将Pi的默认系统提示复制到其他客户端中,但毫无变化——仍然疯狂思考。我还排除了思考级别控制的可能性,因为llama-server出于某种原因没有将Qwen宣传为具备思考能力的模型,因此这些控制旋钮在这里本不应适用。而且,当我尝试在Pi中设置思考长度时,它会提示“当前模型不支持思考”。那么,Pi在底层到底做了什么不同的事情来控制思考?它甚至没有截断,因为所有思考块都自然结束。额外问题:有些客户端如何在不重新加载模型的情况下,动态切换思考的开启和关闭?这是采样技巧、特殊标记注入,还是服务器层面的操作?
查看原文

相似文章

如何在编码代理中测试Qwen3.8-27B?

Reddit r/LocalLLaMA

用户详细描述了他们使用EvoX在编码代理设置中测试Qwen3.8-27B AI模型的实验,比较推理级别并征求关于测试设计的反馈。

Qwen 3.8 27b - PI AGENT 对比 OPENCODE

Reddit r/LocalLLaMA

一位用户使用Qwen 3.8 27b模型比较了PI Agent和OpenCode,发现PI Agent在智能体环境中更优,输出质量更高,令牌使用更少,上下文处理更佳。

我对Qwen 3.8在代理编码中的初步看法

Reddit r/LocalLLaMA

对使用Qwen 3.8模型进行代理编码的个人评测,称赞其处理复杂任务(如将llama.cpp与Godot集成)的能力,同时指出存在循环问题。