gguf

标签

Cards List
#gguf

@aisearchio: Minimax H3 GGUFs 来了!Q2 仅有 8.49 GB,因此你可以在较低端的 GPU 上运行它。 https://huggingface.co/realrebela…

X AI KOLs Timeline · 6天前 缓存

宣布 MiniMax H3 的 GGUF 量化版本现已可用,其中 Q2 版本仅有 8.49 GB,适合较低端的 GPU。

0 人收藏 0 人点赞
#gguf

@no_stp_on_snek:延迟了,但终于来了。DeepSeek-V4-Flash-0731 的 GGUF 格式,每权重 2.88 比特,95 GiB,可在单台 128 GB 机器上运行……

X AI KOLs Following · 6天前 缓存

DeepSeek-V4-Flash-0731 以 GGUF 格式发布,每权重 2.88 比特(95 GiB),使 284B 参数的 MoE 模型可在 128 GB 机器上运行。附带详细的操作指南,以及所需的 TurboQuant llama.cpp 分支。

0 人收藏 0 人点赞
#gguf

realrebelai/MiniMax-H3_GGUFs

Hugging Face Models Trending · 6天前 缓存

提供 MiniMax-H3 模型的 GGUF 量化版本的 Hugging Face 仓库,用于 ComfyUI,包含目录结构和所需 VAE 的链接。

0 人收藏 0 人点赞
#gguf

DeepSeek V4 @ IQ3XXS 在 M1 Ultra 128GB 上的 LM Studio 中经补丁后可达 16 tok/s

Reddit r/LocalLLaMA · 6天前 缓存

一个 GitHub 补丁通过侧载 antirez 的 llama.cpp 分支,解决了结构布局漂移、解码拆分和代码签名问题,从而允许在 128GB Mac 上的 LM Studio 中运行 DeepSeek V4 Flash。

0 人收藏 0 人点赞
#gguf

@BrianRoemmele: Another day and another full frontier model running on your computer. Been teething DeepSeek V4 Flash on over 60 employ…

X AI KOLs Timeline · 2026-08-02 缓存

Brian Roemmele reports that DeepSeek V4 Flash (304B, 1M context) now runs locally on Apple Silicon via the ds4 engine, sharing GGUF quantized builds with a fresh imatrix. The Hugging Face repo provides installation instructions and notes that these files are ds4-specific, not for llama.cpp.

0 人收藏 0 人点赞
#gguf

huihui-ai/Huihui-DeepSeek-V4-Flash-0731-abliterated-GGUF

Hugging Face Models Trending · 2026-08-02 缓存

这是 Huihui-DeepSeek-V4-Flash-0731-abliterated-GGUF 的模型卡,它是 DeepSeek-V4-Flash 的 abliterated(无审查)GGUF 量化变体,专为与 llama.cpp 和 ds4 一起本地使用而设计。

0 人收藏 0 人点赞
#gguf

LiquidAI/LFM2.5-2.6B-GGUF

Hugging Face Models Trending · 2026-08-01 缓存

此 Hugging Face 模型卡片介绍了 LiquidAI 的 LFM2.5-2.6B 模型(GGUF 量化格式),并提供了通过 llama.cpp、vLLM、Ollama 等工具在本地运行的说明。

0 人收藏 0 人点赞
#gguf

IQ3 DS 发布

Reddit r/LocalLLaMA · 2026-07-31 缓存

Unsloth 发布了 DeepSeek-V4-Flash-0731 的 IQ3 GGUF 量化版本,支持通过 llama.cpp、Ollama、LM Studio 等工具进行本地推理。

0 人收藏 0 人点赞
#gguf

DeepSeek-V4-Flash-0731 unsloth gguf 在 A100 上

Reddit r/LocalLLaMA · 2026-07-31

展示了 DeepSeek-V4-Flash-0731 在单块 40GB A100 上以 unsloth GGUF 量化版本运行,速度为 17.7 tok/s,并将 6 个专家加载到显存中,从而实现了完整的智能体编码循环。

0 人收藏 0 人点赞
#gguf

unsloth/DeepSeek-V4-Flash-0731-GGUF

Reddit r/LocalLLaMA · 2026-07-31

Unsloth 预告了即将在 Hugging Face 上发布的 DeepSeek V4 Flash GGUF 量化模型。

0 人收藏 0 人点赞
#gguf

有人测试过 IQ1_M 342GB 剪枝版 Kimi K3 吗?能用吗?

Reddit r/LocalLLaMA · 2026-07-30 缓存

这是一个高度实验性的 GGUF 版本,基于 2.8T 参数的 Kimi K3 MoE 模型,剪枝了 55% 的专家并量化至约 2.15 bpw(319 GiB)。运行它需要特定的 llama.cpp PR 和自定义补丁,并包含详细的使用说明。

0 人收藏 0 人点赞
#gguf

PSA:llama.cpp 现在默认加载任何 draft-mtp 架构的 MTP 张量,即使 MTP 被禁用

Reddit r/LocalLLaMA · 2026-07-29

最新版本的 llama.cpp 现在会自动为 draft-mtp 架构加载 MTP 张量,即使未启用推测解码,这可能会增加其 GGUF 文件中捆绑了 MTP 块的用户的显存使用量。

0 人收藏 0 人点赞
#gguf

Kimi K3 在家用实验室的首批结果 ~ 4t/s

Reddit r/LocalLLaMA · 2026-07-29

用户分享了在家用实验室运行 Kimi K3 的首批结果,配置为 768GB DDR5 和 2x5090,使用 llama.cpp 分支和 Q2_K 量化,报告预填充速度为 50-70 tps,解码 tps 随时间增长。

0 人收藏 0 人点赞
#gguf

有人试过Q1 Kimi K3吗?(555GB)

Reddit r/LocalLLaMA · 2026-07-29 缓存

Kimi K3是一个庞大的2.9万亿参数混合专家模型,拥有1040亿活跃参数,100万上下文长度,原生支持MXFP4训练,现已提供从540GB到更小尺寸的GGUF量化版本,但运行需要强大的硬件。

0 人收藏 0 人点赞
#gguf

我成功运行了Kimi-k3......

Reddit r/LocalLLaMA · 2026-07-28

用户成功使用llama.cpp在高端硬件上运行Kimi-k3模型,实现了较低的每秒token数(提示评估0.41,生成0.23)。

0 人收藏 0 人点赞
#gguf

Laguna S 2.1 GGUF Q4_K_M 从 68GB 增加到 96GB?

Reddit r/LocalLLaMA · 2026-07-28

用户注意到 Laguna S 2.1 的 Q4_K_M 量化版本从 68GB 增加到了 96GB,可能是因为使用了更多的 FP16 层,并讨论了量化与上下文循环可能存在的问题。

0 人收藏 0 人点赞
#gguf

如果你在使用llama.cpp,请更新dsv4的聊天模板

Reddit r/LocalLLaMA · 2026-07-28

最近的llama.cpp提交破坏了旧版DeepSeek V4 gguf聊天模板中的preserve_thinking行为,导致在编码代理环境中出现问题。解决方法是使用--chat-template-file覆盖gguf模板,替换为新的模板。

0 人收藏 0 人点赞
#gguf

Kimi K3 纯文本 (llama.cpp)

Reddit r/LocalLLaMA · 2026-07-27 缓存

Kimi K3 纯文本模型现已获得 llama.cpp 支持,用户可通过这一 C++ 推理引擎在本地运行该开源大语言模型。

0 人收藏 0 人点赞
#gguf

Ling-3.0-flash 权重:SGLang 表示首日支持,vLLM 表示等开源后再支持,llama.cpp 已将 2.6 请求关闭为‘不计划’

Reddit r/LocalLLaMA · 2026-07-27

文章详细介绍了推理引擎对 Ling-3.0-flash 模型权重的当前支持状况:SGLang 承诺首日集成,vLLM 等待开源权重,llama.cpp 缺少对 Bailing MoE 变体的转换。文章指出发布模式是先开放免费 API,然后开源,正如 Ling-2.6-flash 那样。

0 人收藏 0 人点赞
#gguf

Qwen 3.6 27B 的量化是否会破坏 pelican?

Reddit r/LocalLLaMA · 2026-07-27 缓存

本文评估了 Qwen3.6-27B 模型的不同量化方式对输出质量的影响,使用了 KL 散度和 top-1 token 准确率,以及 SVG 绘图等可视化示例。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈