@analogalok: gemma-4-12B-agentic-fable5-composer2.5 V2 已发布。对基于 Fable 5 推理训练的模型进行了智能体升级。运行…
摘要
Gemma 4 12B 的一个新微调版本,基于 Fable 5 的推理进行训练,在智能体编码基准测试中实现了显著提升(从15%到55%),并且可以使用 llama.cpp 的自定义分支在 8GB VRAM GPU 上本地运行。
查看缓存全文
缓存时间: 2026/06/22 03:36
gemma-4-12B-agentic-fable5-composer2.5 V2 已发布。这是基于 Fable 5 推理训练的模型的智能升级版本。目前正在使用 TurboQuant llama.cpp 在单块 RTX 4060(8 GB VRAM)上运行,完整 25000 上下文和推理下达到 30 tokens/秒:
基准测试
v2 专为编码和智能代理工作而构建:编写代码、运行命令、使用工具、调试、多步骤技术任务。最明确的信号是 tau2 bench telecom,一个智能工具使用基准,其“诊断→修复→验证”循环模拟了真实的终端/调试工作:
tau2 bench telecom 数据: 基础 Gemma 4 12B:约 15% 此微调版:约 55%。(自报) 这是一个巨大的飞跃。
TheTom/llama-cpp-turboquant 标志:
llama-server.exe -m gemma4-v2-Q4_K_M.gguf -ngl 99 -c 25000 --cache-type-k q8_0 --cache-type-v turbo3 --port 8080
标志说明:
-ngl 99→ 完全 GPU 卸载-c 25000→ 25K 上下文--cache-type-k q8_0 --cache-type-v turbo3→ 混合精度 KV 缓存 — K 为 8-bit,V 通过 TurboQuant(Walsh-Hadamard 旋转极坐标量化,Google 自己的 KV 压缩研究)约为 3-bit。
尚未合并到主线 llama.cpp。正在一个分支上运行。
无需 API。无需云端。只有 llama.cpp。嗯,实际上是它的一个分支,外加任何 6GB+ 的 GPU。
如果你试过 yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF,不妨看看这个,并分享你对这些模型的使用体验。
yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF · Hugging Face
GitHub - TheTom/llama-cpp-turboquant: LLM inference in C/C++
你也可以用主线 llama.cpp 运行它:移除两个 --cache-type 标志。
在 RTX 4060(8 GB VRAM)上,完整 250k 上下文下解码速度达到 20 tokens/秒。
- 使用 turboquant 在 64k 上下文下达到 25 tokens/秒(足以运行 hermes agent)
- 使用 turboquant 在 80-200k 上下文下达到 20 tokens/秒
RTX 4060 不睡觉,我也不睡觉,凌晨两点我们在一起跑代码。而且我热爱这种感觉。
他可能把描述复制到了名称字段里。
廉价硬件上的本地语言模型越来越智能。
老哥这名字感觉不一样哈。
轻松。比我这个解码吞吐量还高。
这个版本专门针对工具使用进行了调优。TypeScript 性能应该与基础模型类似。
谢谢老哥,半夜在 4060 上调 llama.cpp 参数基本上就是我现在的全部生活。
说实话不算没用。你甚至可以在 250k 上下文下运行它。
嘿!感谢你与社区分享这个。
相似文章
@MiaAI_lab:我使用Fable-5风格推理和助手轨迹对Gemma 4 12B进行了微调,并将其发布为Gemmable 4 12b。**可用…
Mia-AiLab发布了Gemmable 4 12B,这是Google Gemma 4 12B模型的微调版本,使用了Fable-5风格推理和助手轨迹,提供GGUF和MLX格式用于本地推理。
@HuggingModels: 认识 Gemma 4 12B Agentic Fable5:一个本地运行的 GGUF 模型,能像专家一样思考、推理和使用工具。它专为……
认识 Gemma 4 12B Agentic Fable5,一个本地运行的 GGUF 模型,专为编码、终端任务和代理工作流设计,下载量已超 20.6 万次。
yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF
Gemma-4-12B 的微调版本,针对本地编码和智能体任务进行了优化,在 tau2-bench 电信基准测试上相较基础模型实现了约 3.5 倍的性能提升。
yuxinlu1/gemma-4-12B-coder-fable5-composer2.5-v1-GGUF
针对代码任务的 Gemma 4 12B 专注微调版本,从思维链数据(Composer 2.5 和 Fable 5)中蒸馏而来,并量化为 GGUF 格式,以在本地离线使用,仅需极低 VRAM 要求
@analogalok: 在8GB显存上以20+ token/秒运行Gemma 4 26B MoE,支持250k上下文。如果你有8GB显存显卡,停下你正在做的事……
Alok演示了使用Unsloth的QAT量化以及llama.cpp中的-cmoe标志,在8GB显存上运行Gemma 4 26B MoE,实现了250k上下文下20 token/秒的速度,这标志着廉价本地AI的一个重要里程碑。