iterative-training

标签

Cards List
#iterative-training

更好的起点,更好的终点:压缩推理的自举迭代自推理蒸馏

arXiv cs.CL · 2026-07-20 缓存

提出了BIRD,一种两阶段自推理蒸馏方法,该方法在策略训练之前自举简洁的推理轨迹,在MATH-500和AIME基准测试上实现了更强的精度-效率权衡。在Qwen3-8B上,准确率从86.2%提升至92.0%,同时平均响应长度从3,099个token降至1,115个token。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈