gguf

标签

Cards List
#gguf

@atomic_chat_hq: 在本地运行1位Hy3,速度比其API快2.2倍,质量相同!我们为两个模型分配了相同的任务并比较…

X AI KOLs Following · 2026-07-14 缓存

腾讯的Hy3 295B模型现已提供1位和4位GGUF格式,相比云端API,本地推理速度提升2.2倍,同时保持质量,如在4块RTX 5090显卡(128GB显存)上所展示的。

0 人收藏 0 人点赞
#gguf

unsloth/inkling-GGUF

Hugging Face Models Trending · 2026-07-14 缓存

unsloth/inkling-GGUF 页面提供了 Inkling 的量化 GGUF 版本。Inkling 是 Thinking Machines 开发的一个 975B 参数的多模态 MoE 模型(41B 活跃),设计用于文本、图像和音频输入,拥有开放权重,并支持通过 Unsloth、SGLang 和 vLLM 等库进行本地部署。

0 人收藏 0 人点赞
#gguf

@EmperoAI: 感谢大家达到200万下载!我们刚刚发布了带有修复聊天模板的新GGUF量化,用于去…

X AI KOLs Timeline · 2026-07-14 缓存

Empero AI 发布了针对 Qwythos-9B-Claude-Mythos-5-1M 的新GGUF量化版本,带有修复的聊天模板,支持1M上下文和函数调用,在基准测试中优于基础 Qwen3.5-9B。

0 人收藏 0 人点赞
#gguf

MawForge:面向本地混合专家推理的内存受限专家物化

arXiv cs.LG · 2026-07-14 缓存

MawForge 提出了一种内存受限的方法,用于在受限的统一内存机器上服务大型混合专家(MoE)语言模型,通过将完整模型存储在磁盘上,并按需将专家张量物化到有限缓存中。在 MacBook Pro M5 Pro 上的实验表明,能够在 24GB 内存范围内有效服务 34GB 和 25GB 的模型,并分析了缓存大小权衡和推测解码结果。

0 人收藏 0 人点赞
#gguf

GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-GGUF

Hugging Face Models Trending · 2026-07-13 缓存

GnLOLot 发布了 MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking 模型的 GGUF 量化版本。该模型是一个 10 亿参数的思考模型,基于 Fable 5 数据微调,相比 V1 版本在工具调用/函数调用方面有所改进,旨在通过 llama.cpp 及兼容运行时进行本地部署。

0 人收藏 0 人点赞
#gguf

poolside/Laguna-S-2.1-GGUF

Hugging Face Models Trending · 2026-07-13 缓存

Poolside发布了Laguna S 2.1 AI模型的GGUF量化版本,包括一个DFlash投机解码草稿模型,支持通过llama.cpp进行高效的本地推理。

0 人收藏 0 人点赞
#gguf

LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF

Hugging Face Models Trending · 2026-07-13 缓存

LuffyTheFox 发布了 Qwen3.6-35B-A3B 模型的 GGUF 量化版本,使用 Genesis 算法进行去噪,以减少张量噪声并改进指令遵循能力,该模型基于一个未经审查的激进变体,并与 Hermes 微调数据合并。

0 人收藏 0 人点赞
#gguf

LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF

Hugging Face Models Trending · 2026-07-13 缓存

LuffyTheFox 发布了 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V5-GGUF,这是 Qwen 模型的一个修改版本,使用 Genesis 后训练算法通过自定义 SVD 对 GGUF 格式张量进行信号纯度修复和噪声降低。

0 人收藏 0 人点赞
#gguf

LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V3-GGUF

Hugging Face Models Trending · 2026-07-13 缓存

一种新的无审查GGUF模型,基于Qwen3.6-35B-A3B,采用数据重建和噪声抑制技术进行技术改进。通过一种新颖的修复方法,降低了拒绝率并提升了性能。

0 人收藏 0 人点赞
#gguf

交互式 Jacobian-Lens 可视化工具和实时引导器,用于 llama.cpp 上的 GGUF 模型

Reddit r/LocalLLaMA · 2026-07-12

交互式 Jacobian-Lens 可视化工具和实时引导器,适用于在 llama.cpp 上运行的 GGUF 模型,实现实时模型可解释性和控制。

0 人收藏 0 人点赞
#gguf

Hy3 (295B MoE) 和 NVIDIA Nemotron-Labs-Audex-30B-A3B (支持音频的 30B MoE) GGUF 量化版本

Reddit r/LocalLLaMA · 2026-07-11

腾讯 Hy3 295B MoE 模型和 NVIDIA 支持音频的 30B MoE 模型的 GGUF 量化版本已发布,附带详细的基准测试、imatrix 校准和完整的可复现数据。

0 人收藏 0 人点赞
#gguf

有没有人测试过量化对不同能力的影响?我的结果令人惊讶。

Reddit r/LocalLLaMA · 2026-07-09

作者分享了对不同量化级别(如Q4_K_M、Q5_K_M)如何分别影响模型能力的系统测试的惊人结果,显示数学准确度下降幅度大于知识类任务,并呼吁对不同量化级别的上下文衰减进行更严格的测试。

0 人收藏 0 人点赞
#gguf

empero-ai/Qwythos-9B-v2-GGUF

Hugging Face Models Trending · 2026-07-09 缓存

Qwythos-9B-v2-GGUF 是改进版 Qwythos-9B-v2 模型的 GGUF 量化版本,修复了循环行为问题,恢复了 MTP 头,并保留了推理能力。

0 人收藏 0 人点赞
#gguf

@HuggingModels: 是否曾想过拥有一个结合了Qwen的推理能力、Opus的创造力以及GLM的高效性的模型?欢迎认识Qwen-3.5-Opus-GLM-27B…

X AI KOLs Timeline · 2026-07-09 缓存

Qwen-3.5-Opus-GLM-27B是一个270亿参数的GGUF合并模型,融合了Qwen的推理能力、Opus的创造力以及GLM的高效性,专为无需云依赖的高性能本地AI设计。

0 人收藏 0 人点赞
#gguf

Step 3.7 Flash IQ4_XS GGUF 支持 preserve_thinking

Reddit r/LocalLLaMA · 2026-07-09 缓存

Step 3.7 Flash 现已提供 IQ4_XS GGUF 量化模型,通过 llama.cpp、vLLM、Ollama 及其他工具支持 preserve_thinking,实现高效的本地推理。

0 人收藏 0 人点赞
#gguf

llama.cpp: Hy3 PR 与 GGUFs

Reddit r/LocalLLaMA · 2026-07-07

Hy3 模型现已通过拉取请求在 llama.cpp 中得到支持,并提供 GGUF 量化版本。早期测试显示,在高端硬件上,Q2_K 模型能以 10-11 t/s 的速度生成连贯输出。

0 人收藏 0 人点赞
#gguf

@TraffAlex: 32GB VRAM的AI模型 — 前17名速查表 调用HuggingFace API,获取了真实的.gguf Q4大小。每个链接均为直接下载…

X AI KOLs Timeline · 2026-07-05 缓存

一份速查表,列出了使用GGUF Q4量化针对32GB VRAM优化的顶级AI模型,并提供来自HuggingFace的直接下载链接。包含Qwen、DeepSeek、Llama和Mistral系列的模型,以及关于量化和上下文设置的提示。

0 人收藏 0 人点赞
#gguf

高通推出GenieX,在其Windows笔记本电脑上运行LLM

Reddit r/LocalLLaMA · 2026-07-05

高通推出了GenieX,这是一个用于在Windows笔记本电脑上运行LLM的SDK,在Gemma 4 26B上实现了20 tok/s,并支持使用GGUF模型的llama.cpp。

0 人收藏 0 人点赞
#gguf

TensorSharp : 开源本地LLM推理引擎

Reddit r/ArtificialInteligence · 2026-07-04 缓存

TensorSharp是一个开源的.NET库,用于在本地运行LLM推理,支持GGUF模型,并提供CLI、Web聊天机器人和兼容OpenAI的API,支持多种后端选项(CUDA、Metal、CPU)。

0 人收藏 0 人点赞
#gguf

prism-ml/Bonsai-27B-gguf

Hugging Face Models Trending · 2026-07-04 缓存

Prism ML 发布了 Bonsai-27B-gguf,这是一个拥有 270 亿参数的语言模型,采用二进制(1.125 位)权重,实现了约 14 倍的尺寸缩减,同时保留了约 90% 的 FP16 推理性能。它可以在消费级硬件上运行,并具有高吞吐量。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈