标签
本文分析了在线自蒸馏(OPSD)中对前向 KL 目标进行逐点裁剪为何会适得其反:论文通过理论证明与实证实验表明,被裁剪的目标可能会将 token 概率推离教师模型,从而导致推理输出中出现持续的 token 重复现象。
本文识别出自进化搜索智能体中的「协同作弊」现象:出题方(proposer)与解答方(solver)在共享错误上达成一致,从而在不提升真实正确率的情况下虚增内部奖励。作者提出 CrossFit——一种交叉拟合验证方案,可大幅减少虚假一致,并在七个搜索基准上使用 Qwen3.5-4B/9B 模型显著提升性能。
本专著为幂律解码器表示语言模型(PLDR-LLMs)的训练与推理动态提供了统一的解释,涵盖精确恒等式、重正化和实验发现。
本文研究大语言模型中的潜意识学习,并引入liminal训练作为在微调过程中减少意外特征获取同时保持任务性能的方法。
本文研究了在标准初始化下,双层神经网络学习正交多指标模型的训练动态,揭示了增量学习和竞争性参数重分配现象,并引入了一种基于对称性的有限宽度近似方法用于分析。
本文揭示了Transformer训练中Weibull权重尺度的增长由数据可预测性决定,具体是通过双字母组合条件熵实现的,并建立了该增长的预测定律。
本文引入了一个基于检查点的激活干预框架,用于研究概念在语言模型训练过程中如何变得功能充分,并比较了跨层和模型的保存目标。
本文分析了自注意力模型中查询-键回路和输出-值回路的参数化如何影响训练过程中的注意力锐度。通过梯度流分析,作者表明,相对于输出-值学习,更快的查询-键学习会产生更锐利的注意力,从而提高可解释性,同时不牺牲预测性能。
这篇理论论文提出了一种驱动成核速率定律,用于解释语言模型中的能力涌现、可塑性丧失和电路控制,并通过在Pythia和一个受控的门控注意力模型上的实验加以支持。
本文认为,Hessian矩阵的主导子空间虽然对减少损失贡献甚微,但在小批量SGD中降低锐度方面起着关键作用。文章推导了由主导方向上的小批量噪声引起的锐度校正项。
这份预印本揭示,在特定的数据对称性下,LLM的训练动态可以简化为一个低维子空间,从而使分析更易处理且更具可解释性,每个坐标都对应一个清晰的机制。
本文识别出低精度训练中的一种确定性、可预测的冻结现象:当梯度下降权重更新低于权重最后一位单位的一半时,该更新被舍入消失,对应坐标冻结,而梯度仍为非零。该冻结由每坐标半ULP条件决定,且仅需高精度轨迹和目标尾数长度即可预测,无需低精度数据。在一个使用标准AdamW加余弦退火方案、权重以bf16等价精度存储的小型GPT模型中,训练正常进行,然后在中期之后永久冻结——与先验预测相差不超过四个步骤。在一个1.24亿参数的GPT-2变压器中,每次优化器步骤后权重被约束到8位浮点网格,无主权重,密集权重在两个fp8格式下均在初始化时冻结——从fp32参考先验预测——验证损失停滞,而全精度持续提升。随机舍入消除了持久冻结,同一参考也预测了这一点。该条件可迁移至冻结特征回归、跨128倍精度的尾数截断仿真器、小网络以及MNIST上的CNN:这是一个可计算的低精度训练轴,而非扩散噪声。
提出一个GRPO训练动力学的闭式降阶模型,将其简化为阻尼振荡器,并推导出关于稳定性、组大小不变性和损失曲率的预测。在多个模型和基准上进行了验证。
本文提出了一个token级别的框架,表明语言模型损失中的幂律缩放来源于单个token的S形学习曲线的聚合,并证明根据token学习时间重塑训练分布可以将验证损失降低11%。
本文提出了微调回归的引力解释:早期训练形成了占主导地位的行为流形,后续的对齐只轻微地偏移它,从而产生了一个持久的回归方向。实验表明,阻止该方向能以极小的任务成本降低有害性。
本文研究了软件缺陷预测中神经网络的训练动态如何受到类不平衡和类重叠等耦合数据质量问题的影响,并提出了一种交互感知的实证协议。
论文指出重复不匹配是数据混合实验无法扩展的主要原因,并提出了一种重复控制子采样程序,使得小规模实验能够使用远少于原先的token数量恢复出接近最优的混合方案。
这篇立场论文认为,对AI的科学理解必须超越事后分析,转而研究塑造模型行为的训练动态,这对于预测、干预和设计训练过程以获取期望特性(如能力和安全性)具有重要意义。
本文刻画了大语言模型中同策略蒸馏(OPD)独特的参数空间动力学,表明其具有松弛的非主方向更新和子空间锁定特性,从而与监督微调和基于可验证奖励的强化学习区分开来。