4-bit-quantization

标签

Cards List
#4-bit-quantization

量化感知修复:恢复压缩4位大语言模型的实用方法

Hugging Face Daily Papers · 2026-08-21 缓存

量化感知修复是一种通过直接从原始未压缩模型蒸馏来恢复压缩4位语言模型的方法,提供比量化感知训练更快、更稳定的性能。

0 人收藏 0 人点赞
#4-bit-quantization

将 Nunchaku 4-bit 扩散推理引入 Diffusers

Hugging Face Blog · 2026-07-23 缓存

Nunchaku 是一款基于 SVDQuant 的 4-bit 扩散推理引擎,现已原生集成到 Hugging Face Diffusers 中,通过简单的 from_pretrained() 调用即可快速、节省内存地加载量化扩散模型。

0 人收藏 0 人点赞
#4-bit-quantization

nota-ai/Solar-Open2-250B-Nota-NVFP4

Hugging Face Models Trending · 2026-07-21 缓存

Nota AI 发布了 Upstage 的 Solar Open2 250B MoE 模型的 4 位量化版本,使用专有的 NVFP4 量化技术,需要 NVIDIA Blackwell GPU。

0 人收藏 0 人点赞
#4-bit-quantization

可在双DGX Spark上运行的新一波迷你大模型

Reddit r/LocalLLaMA · 2026-07-15

新一波大型语言模型,包括GLM 4.5、Qwen 3.5、MiniMax M2.7、Deepseek V4 Flash、Xiaomi MiMo 2.5、StepFun 3.7 Flash和Tencent Hy3,现在可以在双DGX Spark配置上本地运行,拥有250GB可用内存(4位量化),成本约7,000–8,000美元。

0 人收藏 0 人点赞
#4-bit-quantization

North Mini Code 更新:4位量化 + Ollama + OpenRouter

Reddit r/LocalLLaMA · 2026-06-18 缓存

Cohere 发布 North Mini Code,一个30B-A3B开源权重模型,采用4位量化,用于代码生成和智能体编码任务,支持256K上下文。

0 人收藏 0 人点赞
#4-bit-quantization

预先注册可检测效应:面向4位量化基准的配对MDE预算及试点审计

arXiv cs.LG · 2026-05-29 缓存

本文将对配对二元样本量计算的方法应用于4位量化基准,提供了一个保守的最小可检测效应(MDE)界,帮助基准设计者在运行实验前确定可靠性。一项试点审计表明,在小子样本中观察到的许多方差是二项抽样噪声,而非真正的模型不可靠性。

0 人收藏 0 人点赞
#4-bit-quantization

@HuggingModels:Gemma 4 来了,它针对 Apple Silicon 进行了优化。这款 4 位量化模型在您的 Mac 上运行快速,而不仅仅是在…

X AI KOLs Timeline · 2026-05-24 缓存

Gemma 4 是一款针对 Apple Silicon 优化的 4 位量化模型,能够在 Mac 设备上实现快速本地推理,减少对云计算的依赖。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈