turboquant

标签

Cards List
#turboquant

@no_stp_on_snek: 还有人谈论 mlx-swift-lm 吗?说我在休息一天……清理了鸡舍,锻炼了一下,然后…

X AI KOLs Following · 2026-07-16 缓存

作者描述了将 TurboQuant KV-cache 压缩集成到 Apple 的 mlx-swift-lm 中,实现了 2.7 倍压缩,质量与 8-bit 相当,并通过融合 Metal 内核将解码速度提升了 3-4 倍。

0 人收藏 0 人点赞
#turboquant

@coffeecup2020: 如果你的显卡支持Blackwell,请阅读!https://github.com/turbo-tan/llama.cpp-tq3… 已更新turbo4/turbo3 TQ3_4…

X AI KOLs Timeline · 2026-07-01 缓存

llama.cpp的一个分支引入了TurboQuant TQ3_4S量化方法,该方法映射到Blackwell FP4张量核心,在GB10上实现高达221%的提示处理加速,同时以Q3的大小保持接近Q4的质量。

0 人收藏 0 人点赞
#turboquant

@no_stp_on_snek: TurboQuant+ 更新。4.25→4.125 bpw,解码更快,KLD 降低,崩溃修复。需要测试者:最后阶段一直埋头…

X AI KOLs Following · 2026-06-27 缓存

TurboQuant+ 更新带来更低比特率(4.125 bpw)、更快的解码速度以及减少约 34-35% 的 KLD。开发者正在各种硬件后端上寻找测试者。

0 人收藏 0 人点赞
#turboquant

@BlackRainLabs: 使用TurboQuant,我能在GTX1060 3GB上以20 tokens/秒运行qwen 3.6 35b MoE。对于这么小又老的显卡来说,简直疯狂。…

X AI KOLs Following · 2026-06-22 缓存

使用TurboQuant,用户在GTX1060 3GB上以20 tokens/秒运行Qwen 3.6 35B MoE模型,展现了在陈旧硬件上令人印象深刻的性能。

0 人收藏 0 人点赞
#turboquant

@analogalok: Gemma 4 12B QAT(密集)在8GB显存和120k上下文下实现超过1000 tokens/秒的预填充速度 Gemma 4 12B QAT(密集),TurboQ…

X AI KOLs Following · 2026-06-18 缓存

Gemma 4 12B QAT(密集)使用TurboQuant在8GB RTX 4060上实现超过1000 tokens/秒的预填充速度,支持120k上下文,实现完整的GPU层卸载。相比之前的方法,预填充速度提升了42%。

0 人收藏 0 人点赞
#turboquant

@dr_cintas: 谷歌新算法将31GB内存压缩至4GB TurboVec是一款新的开源工具,用于存储数据……

X AI KOLs Timeline · 2026-06-05 缓存

谷歌的TurboVec是一款新的开源工具,能将AI搜索数据的内存占用从31GB降至4GB。它基于TurboQuant,实现比FAISS更快的搜索,可集成LangChain和LlamaIndex,并完全离线运行。

0 人收藏 0 人点赞
#turboquant

@no_stp_on_snek: 如果你想试试,可以在这里找到:

X AI KOLs Following · 2026-05-23 缓存

这是一个 llama.cpp 的分支,集成了 TurboQuant+,用于先进的 KV 缓存和权重量化,支持跨后端内核(Apple Silicon、NVIDIA CUDA、AMD ROCm、Vulkan),并被 LocalAI、Chronara 和 AtomicChat 用于生产环境。

0 人收藏 0 人点赞
#turboquant

这是我的KV缓存量化基准测试:TurboQuant被高估但被TCQ拯救,q5值得更多关注,对称q8可能浪费显存

Reddit r/LocalLLaMA · 2026-05-19

一项详细的基准测试,使用PPL和KLD指标在Qwen 3.6 27B上比较KV缓存量化方法(TurboQuant、TCQ、q4、q5、q8),发现TCQ改进了低位量化,不对称KV在相同大小下优于对称KV,且q8通常过于夸张。包含分析和数据,见链接文章。

0 人收藏 0 人点赞
#turboquant

在MLX中使用turboquant(及自定义内核)运行Gemma4 26b MoE

Reddit r/LocalLLaMA · 2026-05-15

一位开发者成功在Apple MacBook Air M5上使用MLX、turboquant和自定义内核运行了Gemma4 26b MoE,实现了比llama.cpp更快的提示处理和生成速度,且内存占用更低。实现方式包括本地部署说明。

0 人收藏 0 人点赞
#turboquant

@techwith_ram:一个1000万文档的语料库以float32格式占用31GB内存。大多数团队遇到这一瓶颈后会转向托管向量数据库。每月400美元……

X AI KOLs Timeline · 2026-05-14

turbovec 是一个开源的 Rust 向量索引,使用 Google Research 的 TurboQuant 算法,实现了16倍压缩,搜索速度比 FAISS 更快,并且集成了 LangChain、LlamaIndex 和 Haystack 等 RAG 框架。

0 人收藏 0 人点赞
#turboquant

TurboQuant+MTP在ROCm(Llama CPP)上的实现

Reddit r/LocalLLaMA · 2026-05-14

一位开发者成功在llama.cpp中让TurboQuant TBQ4 KV缓存和多Token预测在AMD ROCm上针对RDNA3 GPU运行,实现在24GB显存上支持64k上下文,并具有有竞争力的token速率。

0 人收藏 0 人点赞
#turboquant

在LLaMA.cpp + TurboQuant上为Qwen实现的多Token预测(MTP)

Reddit r/LocalLLaMA · 2026-05-14

在LLaMA.cpp上结合TurboQuant为Qwen实现了多Token预测,性能提升40%,接受率90%,在MacBook Pro M5 Max上本地运行。

0 人收藏 0 人点赞
#turboquant

受 TurboQuant 启发的 KV 缓存量化方案的统计推断与质量评估

arXiv cs.LG · 2026-05-12 缓存

本文分析了受 TurboQuant 启发的 KV 缓存量化方案,利用统计推断和新的 6D 误差框架来评估 KL 散度、几何误差等质量指标。

0 人收藏 0 人点赞
#turboquant

@no_stp_on_snek: 感谢 @_EldarKurtic、@mgoin_ 和 @RedHat_AI 关于 TurboQuant 的详尽报告。H100 上原生 F… 的数据

X AI KOLs Following · 2026-05-11

一次技术讨论验证了在配备 FP8 Tensor Core 的 NVIDIA H100 GPU 上 TurboQuant 的性能数据,并承诺将带来非 H100 测试的更多见解。

0 人收藏 0 人点赞
#turboquant

在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文

Reddit r/LocalLLaMA · 2026-05-10

作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。

0 人收藏 0 人点赞
#turboquant

@rumgewieselt:现在变得疯狂了……三块 1080 Ti(Pascal架构,33GB VRAM)Qwen 3.6 27B MTP 搭配 196K TurboQuant,持续 ~28-30 t/s

X AI KOLs Timeline · 2026-05-08 缓存

一位用户成功在三个 GTX 1080 Ti GPU 上对 27B 参数的 Qwen 模型进行本地推理,通过 TurboQuant 优化达到了约 28-30 tokens/秒的速度。

0 人收藏 0 人点赞
#turboquant

我们现在就能在 llama-server 里用 Google 的 TurboQuant(TQ)压缩 KV Cache 吗?还是还得等 PR?

Reddit r/LocalLLaMA · 2026-04-22

社区讨论:Google TurboQuant 压缩是否已可用于 llama-server 的 KV cache,还是仍在等待实现。

0 人收藏 0 人点赞
#turboquant

@no_stp_on_snek:turboquant+ 现已成为 LocalAI 的可切换后端,与 tinygrad 和 sglang 并列

X AI KOLs Following · 2026-04-20

LocalAI 新增 turboquant+ 后端,可在不升级硬件的情况下为 GGUF 模型提供更长上下文支持。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈