标签
本文分析了自注意力模型中查询-键回路和输出-值回路的参数化如何影响训练过程中的注意力锐度。通过梯度流分析,作者表明,相对于输出-值学习,更快的查询-键学习会产生更锐利的注意力,从而提高可解释性,同时不牺牲预测性能。
本文介绍了GradCuit,一种测试时潜在推理方法,在选定的Transformer层插入可优化的潜在状态。它在五个骨干模型和三个推理基准上实现了64.5%的平均准确率,优于思维链提示,并展现出更好的稳健性和可解释性。
本文研究无限小初始化下对角线性网络的梯度流动力学,将先前结果推广至深层网络及更广的类别。研究表明,隐式偏差对应于一个修正的ℓ1范数,并将Structural Invariant Manifold(SIM)识别为关键的几何结构。
GPT-5.6 在一个关于梯度流长度的基础数学问题上显著超越了已发布的最先进水平,实现了指数级的改进。这标志着人工智能在推理复杂数学问题能力上的重大进步。
本文系统性地识别了大型权重共享线性自编码器中所有定性不同的极端学习机制,推导了与三棱柱面相关的五种机制的显式损失演化。
价值梯度流(VGF)提出了一种可扩展的行为正则化强化学习方法,将其构建为通过离散梯度流求解的最优传输问题,在离线强化学习和大型语言模型强化学习基准测试中取得了最先进的成果。该方法消除了显式的策略参数化,同时通过控制传输预算实现了自适应的测试时缩放。