gradient-dynamics

标签

Cards List
#gradient-dynamics

RLVR稳定性与Winner Advantage Policy Optimization的梯度视角

Hugging Face Daily Papers · 2026-06-15 缓存

本文分析了RLVR训练中的token级梯度动态,揭示了优势符号与token概率如何共同影响更新稳定性,并提出了Winner Advantage Policy Optimization(WAPO),该方法仅在正优势的完成序列上执行裁剪更新,以提高稳定性。

0 人收藏 0 人点赞
#gradient-dynamics

前沿叠加的出现:Möbius吸引子与级联监督

arXiv cs.LG · 2026-05-20

本文确定了Möbius吸引子和级联监督是Transformer中叠加推理出现的关键机制,填补了图可达性任务中梯度下降收敛的理论空白。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈