标签
本文识别了大型语言模型在On-Policy Self-Distillation中的'Thinking Collapse'现象,其特点是中间推理步骤的减少,并提出了AD-OPSD控制框架,通过将高风险抑制令牌锚定到参考先验来缓解这种崩溃。该方法在数学基准测试上实现了高达+4.1%的绝对平均准确率提升。