quantized-model

标签

Cards List
#quantized-model

@TheAhmadOsman:今晚RTX 3090用户将能运行Kimi_K3_3T_Q_0.001_K GGUF

X AI KOLs Following · 2026-07-16 缓存

Kimi K3模型的量化GGUF版本现已可用,针对RTX 3090 GPU运行进行了优化。

0 人收藏 0 人点赞
#quantized-model

@ciruai:终于,在智能模型上为16GB显卡实现了256k上下文,并且速度飞快!使用4080 Super 16GB,我向您展示如何获取完整…

X AI KOLs Timeline · 2026-07-16 缓存

演示如何使用Ternary Bonsai 27B Q2_0模型和llama.cpp在16GB RTX 4080 Super上实现256k上下文,生成速度高达141 tok/s。

0 人收藏 0 人点赞
#quantized-model

我创建了一个用于编码的140GB IQ2_XXS REAP量化版GLM 5.2。正在寻找测试者。

Reddit r/LocalLLaMA · 2026-07-08

一个用于编码的140GB IQ2_XXS REAP量化版GLM 5.2已被创建,作者正在寻找测试者。

0 人收藏 0 人点赞
#quantized-model

Ornith-1.0-35B Q3_K_M:约17 GB显存,经KLD与BF16对比验证

Reddit r/LocalLLaMA · 2026-06-27

Ornith-1.0-35B Q3_K_M是一个35B参数模型的3位量化版本,需要约17 GB显存,并通过KLD与BF16对比检查以确保保真度。

0 人收藏 0 人点赞
#quantized-model

@MiaAI_lab: 仅供参考,运行的最佳Qwen 3.6 35b nvfp4是@NVIDIAAI的nvfp4。不要使用unsloth nvfp4,其性能较差。https://hug…

X AI KOLs Timeline · 2026-06-22 缓存

推荐使用NVIDIA的nvfp4量化版Qwen 3.6 35B,而非Unsloth版本,其性能更优。该模型可在HuggingFace上获取,用于AI应用。

0 人收藏 0 人点赞
#quantized-model

Unsloth Gemma 4 QAT MTP 辅助模型现已可用

Reddit r/LocalLLaMA · 2026-06-09

Unsloth 发布了 Gemma 4 QAT MTP 辅助模型,以 GGUF 文件形式在 Hugging Face 上提供,支持 q8_0 及更大量化格式。

0 人收藏 0 人点赞
#quantized-model

I put together a Rust-native, CPU-only implementation of LFM2.5-8B-A1B

Reddit r/LocalLLaMA · 2026-06-09 缓存

作者发布了一个纯Rust、纯CPU的LFM2.5-8B-A1B模型推理实现(4-bit Q4KM量化),解码速度约37 tokens/s,内存占用~7GB,旨在让LLM在廉价VPS或旧机器上可运行。该实现已开源并发布为cargo crate。

0 人收藏 0 人点赞
#quantized-model

Jackrong/Qwopus3.6-27B-v2-MTP-GGUF

Hugging Face Models Trending · 2026-05-21 缓存

Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 是 27B 参数语言模型的 GGUF 量化版本,托管在 Hugging Face 上,并附有使用各种库和工具的说明。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈