Ling 3.0 Tiny 成为 Hermes(Qwen 3.8 27B 作为主要模型)的优秀辅助模型

Reddit r/LocalLLaMA 新闻

摘要

一位用户分享了他们的设置,使用 Ling 3.0 Tiny 作为 Hermes(Qwen 3.8 27B)的辅助模型来处理简单任务,如上下文压缩和摘要生成,从而提高速度和效率,且不影响质量。

昨天刚把设置调整好。效果非常好,让 Hermes 中的 Qwen 3.8 使用感觉更快。我让 Qwen 专门使用 Ling Tiny 来处理简单任务,比如上下文压缩和摘要生成。(基本上是任何非智能关键任务)在我的硬件上,Ling 的 token/s 速度大约快 5 倍,并且提示处理能力超过 5K。它真的非常稳定。发帖希望有更多显存闲置的人考虑使用。Q6 配置加上 KV Q8 和 131K 上下文,显存使用低于 10GB。最酷的是我设置代理的方式使其能根据需要动态使用 Ling,如果感觉合适的话。我没有注意到整体 Hermes 代理的质量下降。我的任务完成等待时间肯定减少了。我的助手有了一个助手。哈哈
查看原文

相似文章