gguf

标签

Cards List
#gguf

快速编码能力测试:4个 Qwen 3.6-35B GGUF 变体

Reddit r/LocalLLaMA · 2026-07-27

对 Qwen 3.6-35B 模型的四个 GGUF 变体的编码性能的快速评估。

0 人收藏 0 人点赞
#gguf

llama.cpp 发生了什么

Reddit r/LocalLLaMA · 2026-07-27

llama.cpp 的一次重大更新要求重新生成所有之前生成的 GGUF 文件,这表明模型格式发生了重大的不兼容变化。

0 人收藏 0 人点赞
#gguf

[audio.cpp] 0.4 版本发布:Higgs Audio v3 TTS 4B(10倍实时)+ Fish Audio S2 Pro 基于 C++/GGML,完整 GGUF 加载,Q8 速度与显存优化

Reddit r/LocalLLaMA · 2026-07-24

audio.cpp 0.4 版本为 Higgs Audio v3 TTS 4B(10倍实时)和 Fish Audio S2 Pro 添加了基于 C++/GGML 的推理,支持完整 GGUF 加载,并实现了 Q8 速度与显存优化。

0 人收藏 0 人点赞
#gguf

Laguna-S-2.1 "无限思考"循环似乎是量化伪影

Reddit r/LocalLLaMA · 2026-07-23

文章报告称,Laguna S 2.1 AI模型中的无限思考循环很可能是由量化伪影引起的。切换到MoE感知的APEX量化(例如Myric/Laguna-S-2.1-APEX-GGUF)并使用默认采样设置(温度0.7,top_p 0.95,top_k 20)解决了大多数情况下的循环问题。此外,将提示框定在工具调用周围可以防止过度思考。

0 人收藏 0 人点赞
#gguf

关于Laguna S-2.1的重要通知:使用更新后的聊天模板和GGUF文件

Reddit r/LocalLLaMA · 2026-07-23

Laguna S-2.1模型已更新,修复了yarn_attn_factor(已修正为1.0),并改进了聊天模板,修复了损坏的思维过程、保留了思维链,并支持工具调用。建议用户使用官方仓库中更新的GGUF文件。

0 人收藏 0 人点赞
#gguf

Laguna-S-2.1 运行在我6年前的旧游戏电脑上!

Reddit r/LocalLLaMA · 2026-07-22

Laguna-S-2.1 是一个量化AI模型,运行在配备RTX 3080的6年前旧游戏电脑上,解码速度达到10 token/秒,占用8.3 GB显存和52.2 GB主机内存。

0 人收藏 0 人点赞
#gguf

Unsloth 推出的 Laguna S 2.1 量化版本已发布

Reddit r/LocalLLaMA · 2026-07-22 缓存

Unsloth 发布了 Laguna S 2.1 Mixture-of-Experts 模型的 GGUF 量化版本。该模型是一个拥有 118B 参数(8B 激活参数)的编码模型,具备 1M 上下文窗口和智能体能力。量化版本支持高效的本地部署。

0 人收藏 0 人点赞
#gguf

在政治动荡前值得获取的模型

Reddit r/LocalLLaMA · 2026-07-21

一份精选的推荐AI模型列表(例如Qwen3.5、Gemma 4、Mistral Medium),适用于统一内存最高256GB的系统,涵盖创意、编程、智能体及通用聊天等使用场景。

0 人收藏 0 人点赞
#gguf

@QuixiAI: QuixiAI/embeddinggemma.c - 极速跨平台嵌入推理引擎。用C编写,可随处运行。推理…

X AI KOLs Following · 2026-07-20 缓存

QuixiAI发布embeddinggemma.c,一个用C编写的快速跨平台嵌入推理引擎,支持多种后端(CPU、Metal、CUDA、ROCm、SYCL)以及Matryoshka嵌入,并提供标准HTTP API。

0 人收藏 0 人点赞
#gguf

@Alacritic_Super: 需要一款不需要强大硬件就能运行的高性能本地大语言模型?来看看 Qwythos-9B。• 9B 参数 • 1M 令牌上下文 • 原生工具调用…

X AI KOLs Timeline · 2026-07-20 缓存

Qwythos-9B 是一款拥有 9B 参数、支持 1M 令牌上下文和原生工具调用的本地大语言模型,提供 GGUF 格式,适用于 Ollama、llama.cpp 和 LM Studio。其在关键基准测试中的表现显著超越其基础模型 Qwen3.5-9B。

0 人收藏 0 人点赞
#gguf

DavidAU/Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF

Hugging Face Models Trending · 2026-07-19 缓存

这是一个社区微调并合并的Qwen 3.5 9B版本,声称在关键基准测试中超越更大模型,支持多token预测,以GGUF格式提供。

0 人收藏 0 人点赞
#gguf

DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF

Hugging Face Models Trending · 2026-07-17 缓存

DavidAU 发布了 Qwen3.6-27B-Fable-Fusion-711,这是一个对 Qwen 3.6 27B 进行多阶段微调的模型,声称在 ARC-C 基准测试中超过 700 分,超越了基础模型并匹敌闭源模型,提供 GGUF 格式,适用于消费级硬件。

0 人收藏 0 人点赞
#gguf

@TheAhmadOsman:今晚RTX 3090用户将能运行Kimi_K3_3T_Q_0.001_K GGUF

X AI KOLs Following · 2026-07-16 缓存

Kimi K3模型的量化GGUF版本现已可用,针对RTX 3090 GPU运行进行了优化。

0 人收藏 0 人点赞
#gguf

@MaziyarPanahi:我在Mac Studio上体验了Thinking Machines的新Inkling,一个2分钟的问诊。患者因膝盖问题前来……

X AI KOLs Timeline · 2026-07-16 缓存

Thinking Machines的Inkling是一个975B参数模型,通过llama.cpp在Mac Studio上本地运行。它听取了一段问诊音频,从闲聊中的细微线索准确诊断出心力衰竭,展示了无需离开本机的先进医学推理能力。

0 人收藏 0 人点赞
#gguf

@dealignai:Bonsai-27b CRACK'd GGUF(移除拒绝回答),GGUF 用户们,拿去用吧 https://huggingface.co/dealignai/Bonsai-27b-Ternary-…

X AI KOLs Timeline · 2026-07-15

一个经过修改的 Bonsai-27b GGUF 版本已发布在 Hugging Face 上,移除了拒绝回答功能。

0 人收藏 0 人点赞
#gguf

Qwen 3.5 122B Heretic ROCmFP4 iMatrix

Reddit r/LocalLLaMA · 2026-07-15 缓存

Qwen 3.5 122B 模型的一种紧凑型、重要性校准的 ROCmFP4 量化版本,适用于高内存 AMD 系统,实现了更优的质量(KLD 降低 14%)和性能(28.45 tok/s)。需要 ROCmFPX 运行时,不兼容标准 llama.cpp。

0 人收藏 0 人点赞
#gguf

@atomic_chat_hq: 在本地运行1位Hy3,速度比其API快2.2倍,质量相同!我们为两个模型分配了相同的任务并比较…

X AI KOLs Following · 2026-07-14 缓存

腾讯的Hy3 295B模型现已提供1位和4位GGUF格式,相比云端API,本地推理速度提升2.2倍,同时保持质量,如在4块RTX 5090显卡(128GB显存)上所展示的。

0 人收藏 0 人点赞
#gguf

unsloth/inkling-GGUF

Hugging Face Models Trending · 2026-07-14 缓存

unsloth/inkling-GGUF 页面提供了 Inkling 的量化 GGUF 版本。Inkling 是 Thinking Machines 开发的一个 975B 参数的多模态 MoE 模型(41B 活跃),设计用于文本、图像和音频输入,拥有开放权重,并支持通过 Unsloth、SGLang 和 vLLM 等库进行本地部署。

0 人收藏 0 人点赞
#gguf

@EmperoAI: 感谢大家达到200万下载!我们刚刚发布了带有修复聊天模板的新GGUF量化,用于去…

X AI KOLs Timeline · 2026-07-14 缓存

Empero AI 发布了针对 Qwythos-9B-Claude-Mythos-5-1M 的新GGUF量化版本,带有修复的聊天模板,支持1M上下文和函数调用,在基准测试中优于基础 Qwen3.5-9B。

0 人收藏 0 人点赞
#gguf

MawForge:面向本地混合专家推理的内存受限专家物化

arXiv cs.LG · 2026-07-14 缓存

MawForge 提出了一种内存受限的方法,用于在受限的统一内存机器上服务大型混合专家(MoE)语言模型,通过将完整模型存储在磁盘上,并按需将专家张量物化到有限缓存中。在 MacBook Pro M5 Pro 上的实验表明,能够在 24GB 内存范围内有效服务 34GB 和 25GB 的模型,并分析了缓存大小权衡和推测解码结果。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈