标签
本文研究了针对NVFP4低精度大语言模型的量化感知蒸馏,并发现仅使用KL损失的输出匹配可能掩盖内部表征漂移。作者提出了CKA-QAD,通过CKA引导的对齐来保持内部几何结构,从而提升了紧凑模型在推理和编码任务上的准确性。
提出了步骤感知推理能量(SARE),一种使用CKA的几何框架,用于量化LLM单个思维链步骤中的计算努力,揭示了非均匀的努力分配和改进的置信度预测。