标签
Hugging Face 宣布在 transformers 库中原生支持 GGUF 文件,使得量化模型能更轻松地与 PyTorch 工具结合使用,性能与 llama.cpp 相当。
K2-Horizon AI 模型系列的量化版本现已可在 Hugging Face 上下载,支持从 0.9B 到 36B 参数的多种尺寸。但 llama.cpp 的支持仍在进行中,需要使用分支版本。
本文比较了在 RTX 3060 上对 Qwen 3.8 27B 模型进行 GSQ 和 ByteShape 量化的结果,揭示了尽管 ByteShape 量化声称与原始模型高度相似,但其性能却表现不佳。
Unsloth 发布了 Qwen-Image-2.1 的 GGUF 量化版本,使其能够在12GB VRAM 上本地运行,性能与 Nano Banana 2.0 相当。
作者利用自己的git历史记录构建了一个自定义基准测试框架,用于评估本地AI模型在代码任务中的表现。早期测试结果显示,Flash Next和Swift等模型的性能表现令人惊讶。
本研究评估了量化如何影响大型语言模型在临床基准上的准确性和安全性,发现INT8量化普遍安全,而INT4量化则带来模型和任务相关的风险。
PRQuant 是一种无需训练且低开销的框架,用于量化大型语言模型中的线性层,通过置换和残差补偿来减少推理延迟,同时在如MXFP4等基准上提升准确性。
新量化AI模型Sharp-Spark-X2.5-4B-GGUF发布,针对小GPU和有限内存优化代理编码能力,提升资源有限用户的本地编码体验。
扩展Splash引擎以在Apple Silicon上支持原生8位Qwen3.8-27B模型,实现37-55 tok/s速度且无量化质量损失,并支持最高256k上下文缩放。
Baseten出版的《Inference Engineering》是一本系统化的书籍,讲解从CUDA到生产部署的AI推理优化技术,帮助工程师在生产环境中高效运行开源模型。
Qwen-Image-2.1模型的GGUF量化版本,用于使用ComfyUI进行本地图像生成,包含推荐的量化方式和部署设置说明。
本文测试了在有限显存环境下各种量化版本的 Qwen 3.8 27B AI 模型,比较了它们在动画生成、应用开发和单词生成等任务上的表现。
作者发现,在3张3090显卡上使用Exllama3以3.05 bpw运行Qwen 3.8 Next Flash,能为本地LLM使用提供卓越的性能和质量,优于其他量化方法。
文章探讨了更小的量化模型是否正在成为本地AI应用的首选,强调了它们在VRAM使用、性能和功能(如工具调用)之间的平衡。
作者在有限的显存下比较了 Qwen3.8 27B IQ3_XXS 和 Bonsai Ternary PQ2 的性能,发现 Qwen 更快且使用的 token 更少,而 Bonsai 文件更小但生成时间更长。
作者优化了 Qwen3.8-Flash-Next 模型,使其能在 64GB Mac 上运行,使用专家流式处理和其他技术,通过发布检查点和 llama.cpp 叉版本达到约 27 tok/s 的速度。
本文对比了 Bonsai 2 27B、Gemma 4 12B 和 Qwen 3.5 9B 模型在使用 RTX 5090 生成日式体素宝塔时的性能,结论是 Bonsai 在内存占用方面提供了更优的智能和细节,对本地 AI 社区有益。
Prism-LM 的基于 Qwen3.8 的 Bonsai 2 QAT 模型已被评估并加入比较研究,在综合基准测试中达到约 91.5%,并为模型权衡提供了可靠的参考。
Jovan 来自 UkisAI,讨论了他们 Swift Qwen3.8 27B 模型的改进,并寻求社区反馈以创建 Bonsai 2 的 Swift 版本,以解决过度思考循环和高令牌使用问题。