@analogalok: gemma-4-12B-agentic-fable5-composer2.5 V2 已发布。对基于 Fable 5 推理训练的模型进行了智能体升级。运行…

X AI KOLs Timeline 模型

摘要

Gemma 4 12B 的一个新微调版本,基于 Fable 5 的推理进行训练,在智能体编码基准测试中实现了显著提升(从15%到55%),并且可以使用 llama.cpp 的自定义分支在 8GB VRAM GPU 上本地运行。

gemma-4-12B-agentic-fable5-composer2.5 V2 已发布。 对基于 Fable 5 推理训练的模型进行了智能体升级。现在使用 TurboQuant llama.cpp 在单张 RTX 4060(8 GB VRAM)上运行,速度达到 30 token/秒,支持完整的 25000 上下文和推理: # 基准测试 v2 专为编码和智能体工作而构建:编写代码、运行命令、使用工具、调试、多步骤技术任务。最清晰的信号是 tau2 bench telecom,这是一个智能体工具使用基准测试,其诊断→修复→验证循环模拟了真实的终端/调试工作: tau2 bench telecom 数据: 基础 Gemma 4 12B:~15% 此微调版本:~55%(自行报告) 这是一个巨大的飞跃 # TheTom/llama-cpp-turboquant 标志: llama-server.exe -m gemma4-v2-Q4_K_M.gguf -ngl 99 -c 25000 --cache-type-k q8_0 --cache-type-v turbo3 --port 8080 标志说明: -ngl 99 → 完全 GPU 卸载 -c 25000 → 25K 上下文 --cache-type-k q8_0 --cache-type-v turbo3 → 混合精度 KV 缓存 — K 为 8位,V 通过 TurboQuant 约为 3位(Walsh Hadamard 旋转极化量化,Google 自家的 KV 压缩研究)。 甚至尚未合并到主线的 llama.cpp 中。目前通过分支运行。 无需 API。无需云端。只需 llama.cpp。嗯,它的分支和任何 6GB+ GPU。 如果你试过 yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF,可以试试这个并分享你的体验。
查看原文
查看缓存全文

缓存时间: 2026/06/22 03:36

gemma-4-12B-agentic-fable5-composer2.5 V2 已发布。这是基于 Fable 5 推理训练的模型的智能升级版本。目前正在使用 TurboQuant llama.cpp 在单块 RTX 4060(8 GB VRAM)上运行,完整 25000 上下文和推理下达到 30 tokens/秒:

基准测试

v2 专为编码和智能代理工作而构建:编写代码、运行命令、使用工具、调试、多步骤技术任务。最明确的信号是 tau2 bench telecom,一个智能工具使用基准,其“诊断→修复→验证”循环模拟了真实的终端/调试工作:

tau2 bench telecom 数据: 基础 Gemma 4 12B:约 15% 此微调版:约 55%。(自报) 这是一个巨大的飞跃。

TheTom/llama-cpp-turboquant 标志:

llama-server.exe -m gemma4-v2-Q4_K_M.gguf -ngl 99 -c 25000 --cache-type-k q8_0 --cache-type-v turbo3  --port 8080

标志说明:

  • -ngl 99 → 完全 GPU 卸载
  • -c 25000 → 25K 上下文
  • --cache-type-k q8_0 --cache-type-v turbo3 → 混合精度 KV 缓存 — K 为 8-bit,V 通过 TurboQuant(Walsh-Hadamard 旋转极坐标量化,Google 自己的 KV 压缩研究)约为 3-bit。

尚未合并到主线 llama.cpp。正在一个分支上运行。

无需 API。无需云端。只有 llama.cpp。嗯,实际上是它的一个分支,外加任何 6GB+ 的 GPU。

如果你试过 yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF,不妨看看这个,并分享你对这些模型的使用体验。

yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF · Hugging Face
GitHub - TheTom/llama-cpp-turboquant: LLM inference in C/C++

你也可以用主线 llama.cpp 运行它:移除两个 --cache-type 标志。

在 RTX 4060(8 GB VRAM)上,完整 250k 上下文下解码速度达到 20 tokens/秒。

  • 使用 turboquant 在 64k 上下文下达到 25 tokens/秒(足以运行 hermes agent)
  • 使用 turboquant 在 80-200k 上下文下达到 20 tokens/秒

RTX 4060 不睡觉,我也不睡觉,凌晨两点我们在一起跑代码。而且我热爱这种感觉。

他可能把描述复制到了名称字段里。

廉价硬件上的本地语言模型越来越智能。

老哥这名字感觉不一样哈。

轻松。比我这个解码吞吐量还高。

这个版本专门针对工具使用进行了调优。TypeScript 性能应该与基础模型类似。

谢谢老哥,半夜在 4060 上调 llama.cpp 参数基本上就是我现在的全部生活。

说实话不算没用。你甚至可以在 250k 上下文下运行它。

嘿!感谢你与社区分享这个。

相似文章

yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF

Hugging Face Models Trending

针对代码任务的 Gemma 4 12B 专注微调版本,从思维链数据(Composer 2.5 和 Fable 5)中蒸馏而来,并量化为 GGUF 格式,以在本地离线使用,仅需极低 VRAM 要求