标签
本文探索了如何以微创方式将循环深度改造进预训练语言模型(如Qwen2.5-0.5B),证明所得模型能够执行更深的潜在推理,外推到受监督深度之外,并优于为在token中推理而微调的稠密模型,同时也揭示了灾难性干扰的极限。
本文介绍CHERRY,一套用于计算高效语言模型的技术,包括选择性令牌监督、通过循环展开的深度压缩以及混合压缩专家,在韩语基础模型上取得了显著的效率提升。