标签
本文研究了带可验证奖励的强化学习(RLVR)的优化层,提出等谱优化(ISO)——一个固定谱框架,在优化输入/输出奇异帧的同时复用基础模型权重谱。ISO-Merger和ISO-AdamW在推理和编程任务上以更少的训练步骤实现了强性能。