我们确实需要 llama.cpp 支持调整思考量

Reddit r/LocalLLaMA 工具

摘要

用户提倡 llama.cpp 为像 Qwen 3.8 27b 这样的 AI 模型支持可调整的思考模式,以提升特定任务的性能。

鉴于 Qwen 3.8 27b 是今年的长思考者,我们确实需要支持动态切换思考模式。我上次看到时,这个功能还在开发中,但进展不大。如果能通过下拉菜单切换到中等或低思考模式来处理较简单的任务,那就太好了。这会节省大量时间。
查看原文

相似文章

Qwen3.6 27B 在 vLLM 中的表现比在 llama.cpp 中更差

Reddit r/LocalLLaMA

一名用户报告称,Qwen3.6-27B 模型在使用 llama.cpp 时比使用 vLLM 表现更好且更可靠,并指出尽管进行了大量配置,vLLM 仍出现工具调用错误和“被切除脑叶”的行为。

Llama.cpp PR 带来 8% 速度提升

Reddit r/LocalLLaMA

一个 llama.cpp PR 将采样从 CPU 移至 GPU,在 RTX 5090 上为 Qwen3.6-35B 推理带来 8% 的 token 速度提升,在 Tesla P40 上约为 4%。

Qwen 3.6 27B:本地开发的理想之选

Hacker News Top

Qwen 3.6 27B 被赞誉为强大的本地 AI 模型,在通用智能方面超越预期,适用于代码生成等实际任务,并能通过 llama.cpp 轻松运行。