@no_stp_on_snek:turboquant+ 现已成为 LocalAI 的可切换后端,与 tinygrad 和 sglang 并列

X AI KOLs Following 工具

摘要

LocalAI 新增 turboquant+ 后端,可在不升级硬件的情况下为 GGUF 模型提供更长上下文支持。

turboquant+ 现已成为 LocalAI 的可切换后端,与 tinygrad 和 sglang 并列。如果你在跑 GGUF 模型,又想在现有硬件上获得更长上下文,这是最简单的尝鲜方式。真香。https://github.com/TheTom/llama-cpp-turboquant…
查看原文

相似文章

@no_stp_on_snek: 如果你想试试,可以在这里找到:

X AI KOLs Following

这是一个 llama.cpp 的分支,集成了 TurboQuant+,用于先进的 KV 缓存和权重量化,支持跨后端内核(Apple Silicon、NVIDIA CUDA、AMD ROCm、Vulkan),并被 LocalAI、Chronara 和 AtomicChat 用于生产环境。