spectral-analysis

标签

Cards List
#spectral-analysis

谱异常值揭示Transformer注意力中主导的学习结构

arXiv cs.LG · 2026-08-11 缓存

本文应用Marchenko-Pastur随机矩阵理论于预训练注意力权重,将每个投影矩阵分解为类随机体(bulk)和谱异常值。因果实验表明,在Mistral-7B中将这些异常值置零会使HellaSwag、MMLU和PIQA的性能接近随机水平,从而揭示谱异常值编码了11个Transformer中占主导地位的学习结构。

0 人收藏 0 人点赞
#spectral-analysis

旋转注意力中的相位结构:语义连续性与执行边界治理的频谱框架

arXiv cs.CL · 2026-07-29 缓存

本文开发了一个频谱框架,用于分析Transformer语言模型中的旋转相位对齐、语义连续性和表示漂移,提出了一种有界频谱方法,并区分了内部连贯性与执行边界治理。

0 人收藏 0 人点赞
#spectral-analysis

偏好微调作为频谱更新重组

arXiv cs.CL · 2026-07-24 缓存

该论文揭示,基于偏好的后训练会诱导出具有频谱头-尾组织的参数更新,其中紧凑的头部承载主要的行为偏移,而微弱的尾部对于完整解恢复是必要的,从而将对齐重新定义为结构化的更新重组,而非单一的整体修正。

0 人收藏 0 人点赞
#spectral-analysis

通过内部激活的频谱分析检测神经网络故障

arXiv cs.LG · 2026-07-24 缓存

本文识别了神经网络在错误分类期间内部激活中的频谱漂移,并引入了自检测神经网络(SDNN),通过监控频谱动态来检测故障,在CIFAR-10上实现了79%的AUROC,比基于置信度的方法高出25-30个百分点。

0 人收藏 0 人点赞
#spectral-analysis

魔鬼在于频谱:通过拓扑正则化侧路径缓解LLM中的表示坍缩

arXiv cs.AI · 2026-07-24 缓存

提出拓扑正则化侧路径(TRSP)以缓解LLM中的表示坍缩,通过平衡混合效率与信息容量之间的频谱权衡,在长上下文基准上取得显著提升。

0 人收藏 0 人点赞
#spectral-analysis

用于高效高保真表示的循环正弦隐式神经表示

Hugging Face Daily Papers · 2026-07-23 缓存

本文提出了一种循环正弦架构用于隐式神经表示,通过利用正弦循环产生的谐波线谱富集,以更少的参数和优化步骤实现更高的保真度。

0 人收藏 0 人点赞
#spectral-analysis

超越输出空间校准:时间序列分类中选择性可靠性估计的频谱证据捆绑

arXiv cs.LG · 2026-07-22 缓存

本文介绍SEB-Cal,一种通过频谱特征(频带能量、熵、峰值主导性、相位稳定性)增强输出空间校准的方法,以改善时间序列分类中的选择性可靠性估计,在多个数据集上实现更高的Corr-AUROC和更低的[email protected]

0 人收藏 0 人点赞
#spectral-analysis

神经网络的Hessian谱如何依赖于数据

arXiv cs.LG · 2026-07-16 缓存

本文推导了任意宽度和深度的线性神经网络的Hessian矩阵的特征值,表明在分类任务中使用MSE损失时,尖锐度与最大类别比例相关,并通过实验验证了预测结果。

0 人收藏 0 人点赞
#spectral-analysis

自回归生成中自我修正盲点的谱起源

arXiv cs.LG · 2026-07-14 缓存

本文介绍了SPARC,一种谱代数理论,用于解释自回归语言模型中的自我修正盲点,即模型无法纠正自身错误,却能修复相同的外部错误。该理论证明,当误差传播算子的谱半径不小于1时盲点出现,推导出修正标记的激活阈值,并为基于强化学习的自我修正训练提供了收敛保证。

0 人收藏 0 人点赞
#spectral-analysis

复杂度引导的组件级初始化用于语言模型预训练

arXiv cs.CL · 2026-07-13 缓存

本文分析预训练GPT-2风格语言模型中的频谱模式,并测试这些模式能否用于初始化,发现粗粒度频谱匹配相比标准方法并不能提升预训练性能。

0 人收藏 0 人点赞
#spectral-analysis

指纹,而非蓝图:位置方案如何设定注意力的默认谱代数

arXiv cs.LG · 2026-07-09 缓存

本文研究了注意力头中QK算子的谱性质,表明位置方案(RoPE、学习到的绝对位置、ALiBi)设定了一个默认的谱代数,它起到了功能确定后固化的指纹作用,而非硬约束。

0 人收藏 0 人点赞
#spectral-analysis

频谱重连用于探索、净化和模型融合

arXiv cs.LG · 2026-07-07 缓存

论文介绍了子空间对齐重连(SAR),这是一种事后编辑方法,能够保留强化学习更新的频谱核心,从而保持推理增益、消除干扰,并实现跨专家模型融合,以极少的参数实现强大性能。

0 人收藏 0 人点赞
#spectral-analysis

推理的几何特征:任务难度的谱视角

arXiv cs.LG · 2026-07-03 缓存

本文研究Transformer隐藏状态空间中思维链轨迹的几何性质,引入有效维度和运动学特征,从而通过早期token预测任务难度和答案正确性。

0 人收藏 0 人点赞
#spectral-analysis

在受限API访问下对LLM架构属性的黑盒推断

arXiv cs.LG · 2026-07-03 缓存

本文介绍NightVision,一种利用受限黑盒API访问来估计大型语言模型隐藏维度、深度和参数数量的攻击方法。它采用新颖的公共集提示技术与频谱分析,在开源模型上实现了高精度。

0 人收藏 0 人点赞
#spectral-analysis

多适配器PPO:一种基于交叉注意力增强的波长选择框架用于LIBS定量分析

arXiv cs.LG · 2026-06-17 缓存

本文介绍了多适配器PPO(Multi-Adapter PPO),一种结合交叉注意力机制的强化学习框架,用于LIBS定量分析中的波长选择,在钢铁和煤数据集上相比传统方法实现了28.4%的综合评分提升和45.2%的预测精度改进。

0 人收藏 0 人点赞
#spectral-analysis

@teropa: @sedielem 精彩地阐述了为什么扩散模型对图像如此有效。我们的视觉世界在空间上是…

X AI KOLs Following · 2026-06-16 缓存

解释为什么扩散模型对图像有效:低频频谱成分占主导,因此去噪先恢复粗略结构,再恢复细节——类似于频谱自回归。

0 人收藏 0 人点赞
#spectral-analysis

基于太赫兹双梳光谱的多尺度特征注意力网络用于聚合物分类

arXiv cs.LG · 2026-06-08 缓存

本文介绍了多尺度特征注意力网络(MSFAN),这是一种利用太赫兹双梳光谱对12种聚合物进行分类的深度学习架构,达到了85.2%的准确率,并超越了现有最先进模型。

0 人收藏 0 人点赞
#spectral-analysis

Show HN: Resonate – 低延迟高分辨率频谱分析

Hacker News Top · 2026-06-06 缓存

Resonate 是一种低延迟、低内存的算法,用于对音频信号进行感知相关的频谱分析,采用带有指数加权移动平均的谐振器模型。

0 人收藏 0 人点赞
#spectral-analysis

神经网络损失景观的谱渐近:曲率指数的精确分解

arXiv cs.LG · 2026-06-03 缓存

本文提出了神经网络损失景观中曲率指数α的精确分解,解释了为何该指数在不同层类型间存在差异。引入了谱对齐分解,并导出了一个谱传递恒等式,连接曲率、梯度秩衰减和Hessian指数,该恒等式已在多种架构和数据集上得到验证。

0 人收藏 0 人点赞
#spectral-analysis

BitsMoE: 基于谱能引导的MoE大语言模型高效量化比特分配

arXiv cs.LG · 2026-06-02 缓存

BitsMoE提出了一种基于谱能引导的比特分配框架,用于量化混合专家大语言模型,在超低位宽量化下实现了显著的精度提升和加速。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈