标签
本文应用Marchenko-Pastur随机矩阵理论于预训练注意力权重,将每个投影矩阵分解为类随机体(bulk)和谱异常值。因果实验表明,在Mistral-7B中将这些异常值置零会使HellaSwag、MMLU和PIQA的性能接近随机水平,从而揭示谱异常值编码了11个Transformer中占主导地位的学习结构。
本文开发了一个频谱框架,用于分析Transformer语言模型中的旋转相位对齐、语义连续性和表示漂移,提出了一种有界频谱方法,并区分了内部连贯性与执行边界治理。
该论文揭示,基于偏好的后训练会诱导出具有频谱头-尾组织的参数更新,其中紧凑的头部承载主要的行为偏移,而微弱的尾部对于完整解恢复是必要的,从而将对齐重新定义为结构化的更新重组,而非单一的整体修正。
本文识别了神经网络在错误分类期间内部激活中的频谱漂移,并引入了自检测神经网络(SDNN),通过监控频谱动态来检测故障,在CIFAR-10上实现了79%的AUROC,比基于置信度的方法高出25-30个百分点。
提出拓扑正则化侧路径(TRSP)以缓解LLM中的表示坍缩,通过平衡混合效率与信息容量之间的频谱权衡,在长上下文基准上取得显著提升。
本文提出了一种循环正弦架构用于隐式神经表示,通过利用正弦循环产生的谐波线谱富集,以更少的参数和优化步骤实现更高的保真度。
本文介绍SEB-Cal,一种通过频谱特征(频带能量、熵、峰值主导性、相位稳定性)增强输出空间校准的方法,以改善时间序列分类中的选择性可靠性估计,在多个数据集上实现更高的Corr-AUROC和更低的[email protected]。
本文推导了任意宽度和深度的线性神经网络的Hessian矩阵的特征值,表明在分类任务中使用MSE损失时,尖锐度与最大类别比例相关,并通过实验验证了预测结果。
本文介绍了SPARC,一种谱代数理论,用于解释自回归语言模型中的自我修正盲点,即模型无法纠正自身错误,却能修复相同的外部错误。该理论证明,当误差传播算子的谱半径不小于1时盲点出现,推导出修正标记的激活阈值,并为基于强化学习的自我修正训练提供了收敛保证。
本文分析预训练GPT-2风格语言模型中的频谱模式,并测试这些模式能否用于初始化,发现粗粒度频谱匹配相比标准方法并不能提升预训练性能。
本文研究了注意力头中QK算子的谱性质,表明位置方案(RoPE、学习到的绝对位置、ALiBi)设定了一个默认的谱代数,它起到了功能确定后固化的指纹作用,而非硬约束。
论文介绍了子空间对齐重连(SAR),这是一种事后编辑方法,能够保留强化学习更新的频谱核心,从而保持推理增益、消除干扰,并实现跨专家模型融合,以极少的参数实现强大性能。
本文研究Transformer隐藏状态空间中思维链轨迹的几何性质,引入有效维度和运动学特征,从而通过早期token预测任务难度和答案正确性。
本文介绍NightVision,一种利用受限黑盒API访问来估计大型语言模型隐藏维度、深度和参数数量的攻击方法。它采用新颖的公共集提示技术与频谱分析,在开源模型上实现了高精度。
本文介绍了多适配器PPO(Multi-Adapter PPO),一种结合交叉注意力机制的强化学习框架,用于LIBS定量分析中的波长选择,在钢铁和煤数据集上相比传统方法实现了28.4%的综合评分提升和45.2%的预测精度改进。
解释为什么扩散模型对图像有效:低频频谱成分占主导,因此去噪先恢复粗略结构,再恢复细节——类似于频谱自回归。
本文介绍了多尺度特征注意力网络(MSFAN),这是一种利用太赫兹双梳光谱对12种聚合物进行分类的深度学习架构,达到了85.2%的准确率,并超越了现有最先进模型。
Resonate 是一种低延迟、低内存的算法,用于对音频信号进行感知相关的频谱分析,采用带有指数加权移动平均的谐振器模型。
本文提出了神经网络损失景观中曲率指数α的精确分解,解释了为何该指数在不同层类型间存在差异。引入了谱对齐分解,并导出了一个谱传递恒等式,连接曲率、梯度秩衰减和Hessian指数,该恒等式已在多种架构和数据集上得到验证。
BitsMoE提出了一种基于谱能引导的比特分配框架,用于量化混合专家大语言模型,在超低位宽量化下实现了显著的精度提升和加速。