标签
NVIDIA展示了如何使用NVIDIA模型优化器进行量化感知蒸馏(QAD)来改进Nemotron 3.5 Lightning模型,在保持代理基准准确性的同时减少内存使用并提高吞吐量。
LiquidAI 发布了针对 LFM2.5 模型的更新 4-bit Q4_0 检查点,通过量化感知蒸馏技术,恢复了量化损失的 97% 准确度,同时保持低内存和高速度。