问题: UkisAI Swift Ternary Bonsai 2 27B?
摘要
Jovan 来自 UkisAI,讨论了他们 Swift Qwen3.8 27B 模型的改进,并寻求社区反馈以创建 Bonsai 2 的 Swift 版本,以解决过度思考循环和高令牌使用问题。
社区大家好,我是来自 UkisAI 的 Jovan,我们是 Swift Qwen3.8 27B 背后的团队,这个 Qwen 模型改进了令牌使用和过度思考错误。我们估计可以对 Bonsai 2 进行大幅改进,因为我们的测试表明它深受过度思考循环和高令牌使用的影响,从而影响其性能。我想问你们:你们是否希望有一个 Bonsai 2 的 Swift 版本?如果是,哪个尺寸最相关?1 位、2 位还是两者都要?感谢大家对 Swift 的精彩反馈。我们很高兴你们喜欢它。我们的下载量一夜之间从 10 万跳到了 15 万(包括社区量化)。为了提供上下文,这是我们的模型:https://www.reddit.com/r/LocalLLaMA/s/iCIbhxO8ue https://huggingface.co/ukisai/Swift-Qwen3.8-27B-GGUF
相似文章
ukisai/Swift-Qwen3.8-27b
Swift-Qwen3.8-27B 是 UkisAI 基于 Qwen3.8-27B 开发的推理高效版本,可将思考令牌减少 58.3%,同时保持几乎相同的性能。
UkisAI Swift-Qwen3.8-27B / 思考量减少58.3%,速度提升1.95倍,同时保持xhigh准确率
UkisAI 对 Qwen 3.8 27B 模型进行了后训练,以减少不必要的思考令牌,从而在准确率损失不到1%的情况下,实现思考量降低58%和速度提升1.95倍,模型已开源并提供免费的研究API。
Prism-ML Bonsai Qwen 3.6 27B
Prism ML 发布了 Ternary-Bonsai-27B,这是 Qwen3.6-27B 的三元量化版本,在约 7.2 GB 的占用下保留了 FP16 智能的 95%,能够在笔记本电脑和单 GPU 上实现完整的 27B 级推理,在 Apple M5 Pro 上速度可达 26 tok/s。
谢谢 :) Swift Qwen 3.8 27B 现在已有超过10万次下载,在HuggingFace Trending上排名第一的微调模型和排名第九的模型。
UkisAI的Jovan感谢社区对Swift Qwen 3.8 27B成功的支持,这是一个通过高效思维模式将令牌使用量减少58.3%并提升速度1.95倍的开源模型。计划未来发布改进的检查点和模型。
Bonsai-27B 和 Ternary-Bonsai-27B 的更新(PR 相关)
更新了 Bonsai-27B 和 Ternary-Bonsai-27B 模型,详细介绍了在 llama.cpp 中 CPU、Metal、CUDA、Vulkan 后端的上游合并状态,并讨论了模型的局限性和路线图。