gguf

标签

Cards List
#gguf

如果你在使用llama.cpp,请更新dsv4的聊天模板

Reddit r/LocalLLaMA · 2026-07-28

最近的llama.cpp提交破坏了旧版DeepSeek V4 gguf聊天模板中的preserve_thinking行为,导致在编码代理环境中出现问题。解决方法是使用--chat-template-file覆盖gguf模板,替换为新的模板。

0 人收藏 0 人点赞
#gguf

Kimi K3 纯文本 (llama.cpp)

Reddit r/LocalLLaMA · 2026-07-27 缓存

Kimi K3 纯文本模型现已获得 llama.cpp 支持,用户可通过这一 C++ 推理引擎在本地运行该开源大语言模型。

0 人收藏 0 人点赞
#gguf

Ling-3.0-flash 权重:SGLang 表示首日支持,vLLM 表示等开源后再支持,llama.cpp 已将 2.6 请求关闭为‘不计划’

Reddit r/LocalLLaMA · 2026-07-27

文章详细介绍了推理引擎对 Ling-3.0-flash 模型权重的当前支持状况:SGLang 承诺首日集成,vLLM 等待开源权重,llama.cpp 缺少对 Bailing MoE 变体的转换。文章指出发布模式是先开放免费 API,然后开源,正如 Ling-2.6-flash 那样。

0 人收藏 0 人点赞
#gguf

Qwen 3.6 27B 的量化是否会破坏 pelican?

Reddit r/LocalLLaMA · 2026-07-27 缓存

本文评估了 Qwen3.6-27B 模型的不同量化方式对输出质量的影响,使用了 KL 散度和 top-1 token 准确率,以及 SVG 绘图等可视化示例。

0 人收藏 0 人点赞
#gguf

快速编码能力测试:4个 Qwen 3.6-35B GGUF 变体

Reddit r/LocalLLaMA · 2026-07-27

对 Qwen 3.6-35B 模型的四个 GGUF 变体的编码性能的快速评估。

0 人收藏 0 人点赞
#gguf

llama.cpp 发生了什么

Reddit r/LocalLLaMA · 2026-07-27

llama.cpp 的一次重大更新要求重新生成所有之前生成的 GGUF 文件,这表明模型格式发生了重大的不兼容变化。

0 人收藏 0 人点赞
#gguf

[audio.cpp] 0.4 版本发布:Higgs Audio v3 TTS 4B(10倍实时)+ Fish Audio S2 Pro 基于 C++/GGML,完整 GGUF 加载,Q8 速度与显存优化

Reddit r/LocalLLaMA · 2026-07-24

audio.cpp 0.4 版本为 Higgs Audio v3 TTS 4B(10倍实时)和 Fish Audio S2 Pro 添加了基于 C++/GGML 的推理,支持完整 GGUF 加载,并实现了 Q8 速度与显存优化。

0 人收藏 0 人点赞
#gguf

Laguna-S-2.1 "无限思考"循环似乎是量化伪影

Reddit r/LocalLLaMA · 2026-07-23

文章报告称,Laguna S 2.1 AI模型中的无限思考循环很可能是由量化伪影引起的。切换到MoE感知的APEX量化(例如Myric/Laguna-S-2.1-APEX-GGUF)并使用默认采样设置(温度0.7,top_p 0.95,top_k 20)解决了大多数情况下的循环问题。此外,将提示框定在工具调用周围可以防止过度思考。

0 人收藏 0 人点赞
#gguf

关于Laguna S-2.1的重要通知:使用更新后的聊天模板和GGUF文件

Reddit r/LocalLLaMA · 2026-07-23

Laguna S-2.1模型已更新,修复了yarn_attn_factor(已修正为1.0),并改进了聊天模板,修复了损坏的思维过程、保留了思维链,并支持工具调用。建议用户使用官方仓库中更新的GGUF文件。

0 人收藏 0 人点赞
#gguf

Laguna-S-2.1 运行在我6年前的旧游戏电脑上!

Reddit r/LocalLLaMA · 2026-07-22

Laguna-S-2.1 是一个量化AI模型,运行在配备RTX 3080的6年前旧游戏电脑上,解码速度达到10 token/秒,占用8.3 GB显存和52.2 GB主机内存。

0 人收藏 0 人点赞
#gguf

Unsloth 推出的 Laguna S 2.1 量化版本已发布

Reddit r/LocalLLaMA · 2026-07-22 缓存

Unsloth 发布了 Laguna S 2.1 Mixture-of-Experts 模型的 GGUF 量化版本。该模型是一个拥有 118B 参数(8B 激活参数)的编码模型,具备 1M 上下文窗口和智能体能力。量化版本支持高效的本地部署。

0 人收藏 0 人点赞
#gguf

在政治动荡前值得获取的模型

Reddit r/LocalLLaMA · 2026-07-21

一份精选的推荐AI模型列表(例如Qwen3.5、Gemma 4、Mistral Medium),适用于统一内存最高256GB的系统,涵盖创意、编程、智能体及通用聊天等使用场景。

0 人收藏 0 人点赞
#gguf

@QuixiAI: QuixiAI/embeddinggemma.c - 极速跨平台嵌入推理引擎。用C编写,可随处运行。推理…

X AI KOLs Following · 2026-07-20 缓存

QuixiAI发布embeddinggemma.c,一个用C编写的快速跨平台嵌入推理引擎,支持多种后端(CPU、Metal、CUDA、ROCm、SYCL)以及Matryoshka嵌入,并提供标准HTTP API。

0 人收藏 0 人点赞
#gguf

@Alacritic_Super: 需要一款不需要强大硬件就能运行的高性能本地大语言模型?来看看 Qwythos-9B。• 9B 参数 • 1M 令牌上下文 • 原生工具调用…

X AI KOLs Timeline · 2026-07-20 缓存

Qwythos-9B 是一款拥有 9B 参数、支持 1M 令牌上下文和原生工具调用的本地大语言模型,提供 GGUF 格式,适用于 Ollama、llama.cpp 和 LM Studio。其在关键基准测试中的表现显著超越其基础模型 Qwen3.5-9B。

0 人收藏 0 人点赞
#gguf

DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF

Hugging Face Models Trending · 2026-07-19 缓存

这是一个社区微调并合并的Qwen 3.5 9B版本,声称在关键基准测试中超越更大模型,支持多token预测,以GGUF格式提供。

0 人收藏 0 人点赞
#gguf

DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF

Hugging Face Models Trending · 2026-07-17 缓存

DavidAU 发布了 Qwen3.6-27B-Fable-Fusion-711,这是一个对 Qwen 3.6 27B 进行多阶段微调的模型,声称在 ARC-C 基准测试中超过 700 分,超越了基础模型并匹敌闭源模型,提供 GGUF 格式,适用于消费级硬件。

0 人收藏 0 人点赞
#gguf

@TheAhmadOsman:今晚RTX 3090用户将能运行Kimi_K3_3T_Q_0.001_K GGUF

X AI KOLs Following · 2026-07-16 缓存

Kimi K3模型的量化GGUF版本现已可用,针对RTX 3090 GPU运行进行了优化。

0 人收藏 0 人点赞
#gguf

@MaziyarPanahi:我在Mac Studio上体验了Thinking Machines的新Inkling,一个2分钟的问诊。患者因膝盖问题前来……

X AI KOLs Timeline · 2026-07-16 缓存

Thinking Machines的Inkling是一个975B参数模型,通过llama.cpp在Mac Studio上本地运行。它听取了一段问诊音频,从闲聊中的细微线索准确诊断出心力衰竭,展示了无需离开本机的先进医学推理能力。

0 人收藏 0 人点赞
#gguf

@dealignai:Bonsai-27b CRACK'd GGUF(移除拒绝回答),GGUF 用户们,拿去用吧 https://huggingface.co/dealignai/Bonsai-27b-Ternary-…

X AI KOLs Timeline · 2026-07-15

一个经过修改的 Bonsai-27b GGUF 版本已发布在 Hugging Face 上,移除了拒绝回答功能。

0 人收藏 0 人点赞
#gguf

Qwen 3.5 122B Heretic ROCmFP4 iMatrix

Reddit r/LocalLLaMA · 2026-07-15 缓存

Qwen 3.5 122B 模型的一种紧凑型、重要性校准的 ROCmFP4 量化版本,适用于高内存 AMD 系统,实现了更优的质量(KLD 降低 14%)和性能(28.45 tok/s)。需要 ROCmFPX 运行时,不兼容标准 llama.cpp。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈