@no_stp_on_snek:turboquant+ 现已成为 LocalAI 的可切换后端,与 tinygrad 和 sglang 并列
摘要
LocalAI 新增 turboquant+ 后端,可在不升级硬件的情况下为 GGUF 模型提供更长上下文支持。
turboquant+ 现已成为 LocalAI 的可切换后端,与 tinygrad 和 sglang 并列。如果你在跑 GGUF 模型,又想在现有硬件上获得更长上下文,这是最简单的尝鲜方式。真香。https://github.com/TheTom/llama-cpp-turboquant…
相似文章
@no_stp_on_snek: 非常棒。对3090团队来说意义重大。而且TurboQuant+已经在很多推理引擎中实现了。
一条回复对Unsloth AI即将推出的Qwen3.8-27B模型表示赞赏,该模型将能在17GB内存/显存配置下运行,并指出TurboQuant+已集成到众多推理引擎中——这对RTX 3090用户来说是个好消息。
@no_stp_on_snek: 如果你想试试,可以在这里找到:
这是一个 llama.cpp 的分支,集成了 TurboQuant+,用于先进的 KV 缓存和权重量化,支持跨后端内核(Apple Silicon、NVIDIA CUDA、AMD ROCm、Vulkan),并被 LocalAI、Chronara 和 AtomicChat 用于生产环境。
@coffeecup2020: TurboQuant - Qwopus3.6-27B-v2-TQ3_4S.gguf 通过gpqa测试确认,这非常棒。https://huggingface.co/YTan…
TurboQuant 是 Qwopus3.6-27B-v2 模型的 GGUF 量化版本,经 GPQA 测试结果确认,并在 Hugging Face 上分享,感谢 Jackrong 和 KyleHessling。
@UnslothAI: GLM-5.2 现在可以本地运行!2-bit 模型在从 1.51TB 缩小到 238GB(-84% 大小)后保留了约 82% 的准确率…
UnslothAI 宣布 GLM-5.2,Z.ai 的最强开源模型,拥有 744B 参数,现在可以通过动态 GGUF 量化在本地运行,将大小减少约 84% 至 239GB,同时保留约 82% 的准确率。它适用于 256GB Mac 以及 RAM/VRAM 配置,并支持长上下文、推理和代理任务。
@malikwas1f: 哎呀哎呀,Beellama已经成功合并了Dflash+TurboQuant。这解锁了Q5量化。情况变得越来越好……
一个名为club-3090的GitHub仓库提供了在RTX 3090 GPU上本地运行大型语言模型的配方和配置,支持多种引擎和量化方法,如Dflash和TurboQuant,包括新解锁的Q5量化。