标签
本文分析了RLVR训练中的token级梯度动态,揭示了优势符号与token概率如何共同影响更新稳定性,并提出了Winner Advantage Policy Optimization(WAPO),该方法仅在正优势的完成序列上执行裁剪更新,以提高稳定性。
本文确定了Möbius吸引子和级联监督是Transformer中叠加推理出现的关键机制,填补了图可达性任务中梯度下降收敛的理论空白。