标签
CADENCE 引入了一个统一框架,解决了在线策略知识蒸馏用于推理时的冷启动崩溃、状态无关调度和奖励稀疏性问题,在单个Mac Studio上使用紧凑学生模型在GSM8K和MATH-500上取得了强劲结果。
PrismML的Bonsai-27B模型在Math 500数据集上取得了99.2%的准确率,超越了DeepSeek-R1和Kimi K2。
本研究引入了针对推理轨迹的章节感知压缩,训练模型舍弃填充性叙述,同时保留计算和验证片段,在比原始推理少用2-3倍词元的情况下,达到或超越原始准确率。