quantization-aware-distillation

标签

Cards List
#quantization-aware-distillation

@PyTorch:在NVIDIA NeMo框架内使用PyTorch原生库自定义模型以满足您对延迟、速度、内存和计算的严格要求…

X AI KOLs Timeline · 2026-08-27 缓存

NVIDIA展示了如何使用NVIDIA模型优化器进行量化感知蒸馏(QAD)来改进Nemotron 3.5 Lightning模型,在保持代理基准准确性的同时减少内存使用并提高吞吐量。

0 人收藏 0 人点赞
#quantization-aware-distillation

LFM2.5 Q4_0 检查点:基于量化感知蒸馏的更新

Hugging Face Blog · 2026-08-19 缓存

LiquidAI 发布了针对 LFM2.5 模型的更新 4-bit Q4_0 检查点,通过量化感知蒸馏技术,恢复了量化损失的 97% 准确度,同时保持低内存和高速度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈