标签
团队将 Qwen 3.8 27B 量化为多种 GGUF 格式,并在 RTX 6000 上进行了基准测试,发现不同量化版本性能相似,推荐 AD-Q6_K 以保证安全性。
介绍colibri,一个纯C编写的开源推理引擎,能够将显存、内存和硬盘作为统一层次结构,流式加载大模型权重,支持多种前沿MoE模型在消费级硬件上本地运行,降低大模型使用门槛。
文章批评了AI模型在不同量化格式下缺乏系统性基准测试,突出了基准测试结果与实际使用之间的差异,并呼吁进行更彻底的评估。
关于在双RTX 3090上使用vLLM运行量化后的NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B模型的详细指南,支持完整的262K上下文,实现高推理速度且无需CPU卸载。
Poolside发布了Laguna S 2.1 AI模型的GGUF量化版本,包括一个DFlash投机解码草稿模型,支持通过llama.cpp进行高效的本地推理。
一位用户在配备双 RTX 5090 的高端类消费级系统上测试了 unsloth 量化版 GLM-5.2 模型,达到了每秒 12 个 token。
本教程来自NVIDIA,介绍了将FP8量化PyTorch模型转换为TensorRT推理引擎用于生产部署的端到端工作流程,涵盖ONNX导出和性能分析。
将EXL3 LLM编解码器移植到Apple Silicon上通过Metal运行,在M5 Max上实现了高预填充和生成速度(例如,~600 tok/s预填充,不同模型下17-80 tok/s生成)。
Unsloth 正在将 MiniMax M3 模型的 GGUF 量化版本上传到 Hugging Face。
本文是AI工程全景系列的中篇,详细介绍了推理优化、模型瘦身(量化、蒸馏、剪枝、MoE)和投机解码等核心技术,综述了从硬件到工程栈的最新进展。
一位用户分享了他们使用AutoRound对Qwen 3.6 27B进行GGUF量化的版本,声称其性能优于其他量化版本,并邀请反馈。
帖子作者指出,LFM2.5 8B A1B模型的MoQ GGUFs提供了最佳的精度/大小比,并建议不要使用精度恢复低于95%的版本。
这篇来自NVIDIA的文章介绍了如何使用NVIDIA Model Optimizer库,通过训练后量化方法将CLIP模型量化为FP8格式,从而减少VRAM使用并提升在消费级GPU上的推理性能。
MagicQuant v2.0 是一个用于创建混合式GGUF量化模型的管道,它通过学习Unsloth和其他方法,基于KLD基准找到最优量化配置,重点关注非线性赢家和异常检测。
本地运行多智能体 AI 工作流的硬件需求对比,重点探讨显存(VRAM)与 KV Cache 的瓶颈限制。
本文强调了 Hugging Face 上本地 AI GGUF 模型创建量的显著激增,近几个月的每月新增量几乎翻倍,超过 9,000 个,这得益于工具的改进以及新的开源权重模型的发布。
0xSero 发布了腾讯 Hy3-preview 模型的 FP8 和 NVFP4 量化版本,使其能够在使用完整上下文的情况下在 256GB 显存的设备上运行。
独立研究者发布了 Spiral,这是一款专为 Apple Silicon 设计、利用自定义融合 Metal 内核将大语言模型(LLM)压缩至 INT3、KV 缓存压缩至 INT2 的工具,目前已提供 Qwen-7B 预览版。
开发者 @0xSero 在优化版 GLM-5.1-505B 上通过 NVFP4 量化与 32% 剪枝实现高吞吐推理,解码速度 45 tokens/s,预填充速度 1350 tokens/s。