标签
量化感知修复是一种通过直接从原始未压缩模型蒸馏来恢复压缩4位语言模型的方法,提供比量化感知训练更快、更稳定的性能。
Nunchaku 是一款基于 SVDQuant 的 4-bit 扩散推理引擎,现已原生集成到 Hugging Face Diffusers 中,通过简单的 from_pretrained() 调用即可快速、节省内存地加载量化扩散模型。
Nota AI 发布了 Upstage 的 Solar Open2 250B MoE 模型的 4 位量化版本,使用专有的 NVFP4 量化技术,需要 NVIDIA Blackwell GPU。
新一波大型语言模型,包括GLM 4.5、Qwen 3.5、MiniMax M2.7、Deepseek V4 Flash、Xiaomi MiMo 2.5、StepFun 3.7 Flash和Tencent Hy3,现在可以在双DGX Spark配置上本地运行,拥有250GB可用内存(4位量化),成本约7,000–8,000美元。
Cohere 发布 North Mini Code,一个30B-A3B开源权重模型,采用4位量化,用于代码生成和智能体编码任务,支持256K上下文。
本文将对配对二元样本量计算的方法应用于4位量化基准,提供了一个保守的最小可检测效应(MDE)界,帮助基准设计者在运行实验前确定可靠性。一项试点审计表明,在小子样本中观察到的许多方差是二项抽样噪声,而非真正的模型不可靠性。
Gemma 4 是一款针对 Apple Silicon 优化的 4 位量化模型,能够在 Mac 设备上实现快速本地推理,减少对云计算的依赖。