gguf

标签

Cards List
#gguf

Kimi K3 (Unsloth) IQ2-XXS 从 711GB 降至 478GB!!! 仅移除多语言来缩减体积

Reddit r/LocalLLaMA · 19小时前

Kimi K3 (IQ2-XXS) 的精简版纯英文 GGUF 通过移除多语言组件,将模型大小从 711GB 降至 478GB,早期测试表明它在编码任务上可能达到或超过标准 2-bit 版本。

0 人收藏 0 人点赞
#gguf

Qwen 3.6 27B 在 llama.cpp 中的标志/设置

Reddit r/LocalLLaMA · 昨天

一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。

0 人收藏 0 人点赞
#gguf

目前理论上的 LLM 量化最佳位宽是什么?[D]

Reddit r/MachineLearning · 2天前

一个讨论性问题,询问在固定内存预算下 LLM 量化的理论最佳位宽,并引用了 2025-2026 年关于 3-bit/2-bit 结果和缩放定律的研究。

0 人收藏 0 人点赞
#gguf

LFM2.5-2.6B 模型+KV缓存量化报告

Reddit r/LocalLLaMA · 2天前

关于使用多种 GGUF 和 KV 缓存量化方式对 LiquidAI 的 LFM2.5-2.6B 模型进行量化的详细报告,显示该模型可适配 8GB 树莓派且性能下降极小,但提醒不要使用 Q4_K_M。

0 人收藏 0 人点赞
#gguf

全新 Unsloth KImi K3 发布!Q1_0 (466GB)、TQ1_0 (509GB)、IQ1_M (649)、TQ2_0 (551GB)!!

Reddit r/LocalLLaMA · 2天前

Unsloth 发布了 Kimi K3 的新 GGUF 量化版本,大小从 466GB 到 649GB 不等,使大型模型能够高效部署。

0 人收藏 0 人点赞
#gguf

🟩 NVIDIA 的完整语音技术栈现已本地化。ASR + TTS + 编解码器,量化为 GGUF,通过 NeMo-Speech.cpp 在设备端运行

Reddit r/LocalLLaMA · 2天前

NVIDIA 的完整语音技术栈——ASR、TTS 和编解码器——现已量化为 GGUF,并通过 NeMo-Speech.cpp 在设备端本地运行,同时发布了 Magpie-TTS、Nemotron Speech Streaming 和 Parakeet 的新模型。

0 人收藏 0 人点赞
#gguf

使用 Q4_K MTP 草稿模型与 Gemma 4 31b 解码速度提升 10%

Reddit r/LocalLLaMA · 3天前

有用户报告,对于 Gemma 4 31b,将 f16 MTP 草稿模型量化到 Q4_K(而不是默认的 Q4_0)在双 3090 上解码速度大约提升 10%(从 65 TPS 到 72 TPS),而 Q2_K 表现更差。

0 人收藏 0 人点赞
#gguf

我如何仅用24GB内存运行193B参数模型

Reddit r/ArtificialInteligence · 3天前

介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。

0 人收藏 0 人点赞
#gguf

@YRSM_Simon:120 t/s!干得好,@UnslothAI

X AI KOLs Following · 3天前 缓存

Unsloth AI 宣布推出 DSpark,使 DeepSeek-V4-Flash GGUF 模型在本地运行速度提升约 1.4–2 倍,达到 120 tokens/s,且准确率无变化。

0 人收藏 0 人点赞
#gguf

Unsloth 的 Gemma 4 mmproj 在新版 llama.cpp 构建中悄然破坏了视觉与音频功能——还有人遇到这个问题吗?

Reddit r/LocalLLaMA · 3天前

一位开发者报告称,使用 Unsloth 的 GGUF 模型时,Gemma 4 的多模态功能在较新的 llama.cpp 构建中被破坏,原因是不兼容的 mmproj 文件。切换到 ggml-org 的官方模型后问题立即解决,这凸显了第三方量化器与 llama.cpp 更新之间反复出现的兼容性问题。

0 人收藏 0 人点赞
#gguf

最终优化:在1块RTX 3090上,DeepSeek-V4-Flash-0731在128K上下文下从约10 tok/s提升至约15 tok/s

Reddit r/LocalLLaMA · 3天前

详细测试和调优,以在RTX 3090上优化GGUF格式的DeepSeek-V4-Flash-0731,通过不同的量化和加载参数,在128K上下文下达到约15 tok/s。

0 人收藏 0 人点赞
#gguf

@HuggingModels:看看 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V7-GGUF。

X AI KOLs Timeline · 4天前 缓存

HuggingModels 宣布发布 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V7-GGUF,这是 Qwen 模型的微调和量化版本。

0 人收藏 0 人点赞
#gguf

jabbatheduck/DeepSeek-v4-flash-mini · Hugging Face

Reddit r/LocalLLaMA · 4天前 缓存

jabbatheduck 发布了 REAP 专家剪枝后的 DeepSeek-V4-Flash 检查点的 GGUF 量化版本,为消费级 GPU 上的内存受限推理进行了大幅压缩,同时保留了路由器和注意力的精度。

0 人收藏 0 人点赞
#gguf

构建一个媲美 Llama.cpp 的 Rust 推理引擎

Hacker News Top · 4天前 缓存

Ferrox 是一个纯 Rust 推理引擎,可加载 GGUF 模型,并在 CPU、Metal 或 CUDA 上运行本地 LLM,提供 CLI 和兼容 OpenAI 的服务器。它的目标是在不使用任何绑定、从零编写的情况下,达到与 llama.cpp 相当的性能。

0 人收藏 0 人点赞
#gguf

Qwen3-TTS 语音克隆现已进入 llama.cpp 主线——旧演示终于成为真正的支持

Reddit r/LocalLLaMA · 4天前

Qwen3-TTS 语音克隆已合并到 llama.cpp 主线,通过 llama-tts 二进制文件,利用短参考音频即可在本地实现文本转语音和语音克隆,支持多种语言。目前仍有限制,包括仅支持 Base 模型,且尚无服务器端点。

0 人收藏 0 人点赞
#gguf

DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s

Reddit r/LocalLLaMA · 4天前

一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。

0 人收藏 0 人点赞
#gguf

2.6B 参数模型支持工具调用和 128K 上下文,现可在手机上以 30 tok/s 运行

Reddit r/LocalLLaMA · 4天前

Liquid AI 发布了 LFM2.5-2.6B,这是一个 2.69B 参数模型,支持 128K 上下文和工具调用,专为多步骤智能体工作流优化,可在手机上以 30 tok/s 运行,Q4_K_M GGUF 文件约 1.67GB。不过,与更大的模型相比,其在编码和知识密集型任务上仍然较弱。

0 人收藏 0 人点赞
#gguf

Deepseek V4 Flash 2-bit 量化是我能在本地运行且在此 SQL 基准测试中达到 100% 的首个模型

Reddit r/LocalLLaMA · 5天前

一位用户报告称,DeepSeek V4 Flash 以 2-bit 量化 GGUF 形式在双 RTX 3080 上运行,是首个在真实世界 SQL 基准测试中取得 100% 得分的本地模型,与 Opus 4.7 和 GPT-5.5 等前沿模型持平。

0 人收藏 0 人点赞
#gguf

带更新模板的 DeepSeek V4 Flash 0731 GGUF(支持推理级别)

Reddit r/LocalLLaMA · 5天前 缓存

DeepSeek-V4-Flash-0731-GGUF 的 Hugging Face 页面,这是 DeepSeek V4 Flash 的 GGUF 量化版本,带有支持推理级别的更新模板,可直接用于 llama.cpp、vLLM、Ollama 及其他本地推理工具。

0 人收藏 0 人点赞
#gguf

@rohanpaul_ai:atomic[.]chat 刚刚发布了 DeepSeek V4 Flash 0731 的 14 个压缩量化构建版本。从无损 BF16 到 1 位,GGUF……

X AI KOLs Timeline · 5天前 缓存

atomic.chat 发布了 DeepSeek V4 Flash 0731 的 14 个量化 GGUF 构建版本,从无损 BF16 到 1 位。他们推荐在 128GB 硬件上使用 AD-IQ2_M,该版本在 83.6% 的情况下与原始模型的 token 选择一致。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈