model-quantization

标签

Cards List
#model-quantization

我们量化了 Qwen 3.8 27B 并在 RTX 6000 上比较了量化版本

Reddit r/LocalLLaMA · 5小时前

团队将 Qwen 3.8 27B 量化为多种 GGUF 格式,并在 RTX 6000 上进行了基准测试,发现不同量化版本性能相似,推荐 AD-Q6_K 以保证安全性。

0 人收藏 0 人点赞
#model-quantization

@NFTCPS: 本地跑大模型这事,一看几百 GB 权重和显存要求,大多数人当场劝退,我以前也是。 colibri 直接换了个玩法,把显存、内存、硬盘当一个整体来调,权重按需从硬盘流式加载,纯 C 写、零依赖,已经 25000+ Star。 几个点说下: …

X AI KOLs Timeline · 16小时前 缓存

介绍colibri,一个纯C编写的开源推理引擎,能够将显存、内存和硬盘作为统一层次结构,流式加载大模型权重,支持多种前沿MoE模型在消费级硬件上本地运行,降低大模型使用门槛。

0 人收藏 0 人点赞
#model-quantization

我们基准测试的是无人实际运行的模型

Reddit r/LocalLLaMA · 6天前

文章批评了AI模型在不同量化格式下缺乏系统性基准测试,突出了基准测试结果与实际使用之间的差异,并呼吁进行更彻底的评估。

0 人收藏 0 人点赞
#model-quantization

NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B 在双RTX 3090上

Reddit r/LocalLLaMA · 2026-07-16

关于在双RTX 3090上使用vLLM运行量化后的NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B模型的详细指南,支持完整的262K上下文,实现高推理速度且无需CPU卸载。

0 人收藏 0 人点赞
#model-quantization

poolside/Laguna-S-2.1-GGUF

Hugging Face Models Trending · 2026-07-13 缓存

Poolside发布了Laguna S 2.1 AI模型的GGUF量化版本,包括一个DFlash投机解码草稿模型,支持通过llama.cpp进行高效的本地推理。

0 人收藏 0 人点赞
#model-quantization

消费级硬件上的 GLM 5.2

Reddit r/LocalLLaMA · 2026-06-25

一位用户在配备双 RTX 5090 的高端类消费级系统上测试了 unsloth 量化版 GLM-5.2 模型,达到了每秒 12 个 token。

0 人收藏 0 人点赞
#model-quantization

@PyTorch: 弥合模型优化与生产部署之间的差距——本教程将介绍一个典型的端到端…

X AI KOLs Following · 2026-06-16 缓存

本教程来自NVIDIA,介绍了将FP8量化PyTorch模型转换为TensorRT推理引擎用于生产部署的端到端工作流程,涵盖ONNX导出和性能分析。

0 人收藏 0 人点赞
#model-quantization

我移植了EXL3使其在Apple Silicon上良好运行 - PonyExl3

Reddit r/LocalLLaMA · 2026-06-15

将EXL3 LLM编解码器移植到Apple Silicon上通过Metal运行,在M5 Max上实现了高预填充和生成速度(例如,~600 tok/s预填充,不同模型下17-80 tok/s生成)。

0 人收藏 0 人点赞
#model-quantization

Unsloth MiniMax M3 GGUF

Reddit r/LocalLLaMA · 2026-06-12

Unsloth 正在将 MiniMax M3 模型的 GGUF 量化版本上传到 Hugging Face。

0 人收藏 0 人点赞
#model-quantization

@snowboat84: https://x.com/snowboat84/status/2065215177029787705

X AI KOLs Timeline · 2026-06-11 缓存

本文是AI工程全景系列的中篇,详细介绍了推理优化、模型瘦身(量化、蒸馏、剪枝、MoE)和投机解码等核心技术,综述了从硬件到工程栈的最新进展。

0 人收藏 0 人点赞
#model-quantization

Qwen 3.6 27B AutoRound GGUF,需要您的反馈

Reddit r/LocalLLaMA · 2026-06-10

一位用户分享了他们使用AutoRound对Qwen 3.6 27B进行GGUF量化的版本,声称其性能优于其他量化版本,并邀请反馈。

0 人收藏 0 人点赞
#model-quantization

@bnjmn_marie:对于LFM2.5 8B A1B,MoQ GGUFs是最好的,它们拥有最佳的精度/大小比。再次,看到……

X AI KOLs Following · 2026-06-08 缓存

帖子作者指出,LFM2.5 8B A1B模型的MoQ GGUFs提供了最佳的精度/大小比,并建议不要使用精度恢复低于95%的版本。

0 人收藏 0 人点赞
#model-quantization

@PyTorch: 模型优化与训练后量化 模型量化是一种减少VRAM使用并提高...

X AI KOLs Following · 2026-05-26 缓存

这篇来自NVIDIA的文章介绍了如何使用NVIDIA Model Optimizer库,通过训练后量化方法将CLIP模型量化为FP8格式,从而减少VRAM使用并提升在消费级GPU上的推理性能。

0 人收藏 0 人点赞
#model-quantization

MagicQuant (v2.0) - 混合式GGUF量化模型 + Unsloth动态学习量化配置 + 包含可折叠赢家的基准表等

Reddit r/LocalLLaMA · 2026-05-12

MagicQuant v2.0 是一个用于创建混合式GGUF量化模型的管道,它通过学习Unsloth和其他方法,基于KLD基准找到最优量化配置,重点关注非线性赢家和异常检测。

0 人收藏 0 人点赞
#model-quantization

为什么现有硬件难以应对 2026 年多智能体工作流(Mac Studio vs. RTX 5090)

Reddit r/ArtificialInteligence · 2026-05-11

本地运行多智能体 AI 工作流的硬件需求对比,重点探讨显存(VRAM)与 KV Cache 的瓶颈限制。

0 人收藏 0 人点赞
#model-quantization

@ClementDelangue: 本地 AI 正在迎来它的时刻!以下是过去 8 个月每月新增的 GGUF 模型数量及相关见解……

X AI KOLs Following · 2026-05-10

本文强调了 Hugging Face 上本地 AI GGUF 模型创建量的显著激增,近几个月的每月新增量几乎翻倍,超过 9,000 个,这得益于工具的改进以及新的开源权重模型的发布。

0 人收藏 0 人点赞
#model-quantization

@0xSero: 刚刚添加了两种新的模型压缩版本:Hy3-FP8 和 NVFP4。我推荐尝试这个模型,它非常强大且可以完整地在 256GB 显存上运行……

X AI KOLs Following · 2026-05-10 缓存

0xSero 发布了腾讯 Hy3-preview 模型的 FP8 和 NVFP4 量化版本,使其能够在使用完整上下文的情况下在 256GB 显存的设备上运行。

0 人收藏 0 人点赞
#model-quantization

INT3 压缩与融合 Metal 内核 [R]

Reddit r/MachineLearning · 2026-04-22

独立研究者发布了 Spiral,这是一款专为 Apple Silicon 设计、利用自定义融合 Metal 内核将大语言模型(LLM)压缩至 INT3、KV 缓存压缩至 INT2 的工具,目前已提供 Qwen-7B 预览版。

0 人收藏 0 人点赞
#model-quantization

@0xSero:终于搞定 GLM-5.1-505B-REAP-NVFP4,解码 45 tokens/s,预填充 1350 tokens/s,剪枝 32%,这是我跑通过最费劲的一次…

X AI KOLs Timeline · 2026-04-20 缓存

开发者 @0xSero 在优化版 GLM-5.1-505B 上通过 NVFP4 量化与 32% 剪枝实现高吞吐推理,解码速度 45 tokens/s,预填充速度 1350 tokens/s。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈