会话自适应正交蒸馏(SAOD)技术将744B(1.5TB)压缩至100GB以下?

Reddit r/LocalLLaMA 论文

摘要

会话自适应正交蒸馏(SAOD)是一种将7440亿参数模型(1.5TB)压缩至100GB以下的技术,大幅降低存储和推理成本。

暂无内容
查看原文

相似文章

无损抗蒸馏采样

arXiv cs.LG

本文提出无损抗蒸馏采样(LADS),一种新颖的采样方案,通过关联不同账户的响应来对抗多账户蒸馏,同时为单个良性用户保留精确的统计保真度。理论分析和实验表明,LADS会降低蒸馏学生在图像、数学和代码生成上的性能。

OPRD:在策略表示蒸馏

Hugging Face Daily Papers

OPRD提出了一种新的知识蒸馏方法,该方法在策略部署期间跨层对齐学生和教师的隐藏状态,消除了来自词空间KL估计的采样方差。实验表明,OPRD在数学推理基准(AIME 2024/2025、AIMO)上优于输出空间基线,同时速度快1.44倍,内存使用减少54%。

ShortOPD:通过短到长在策略蒸馏恢复剪枝后的大语言模型

arXiv cs.LG

ShortOPD提出了一种短到长的在策略蒸馏方案,通过将训练集中在有效前缀上,恢复用于自由形式生成的剪枝后大语言模型,相较于未恢复模型实现了高达9倍的改进,并以四分之一的训练时间达到了长视界蒸馏的效果。