超参数化的谜之成功:彩票假说还是逃逸维度?
摘要
一篇研究神经网络超参数化成功原因的论文,比较了彩票假说与逃逸维度。
暂无内容
相似文章
双重评分:可靠提取强彩票子网络
本文引入了双重评分,一种增强的得分空间参数化方法,用于从神经网络中提取强彩票子网络。该方法改进了edge-popup和初始剪枝基线,并降低了对稀疏性超参数的敏感性。
@che_shr_cat: 1/ 一个5M参数的模型刚刚在困难逻辑谜题上击败了前沿LLM,推理成本不到其十万分之一。…
一个5M参数的模型通过使用连续潜空间测试时计算,在困难逻辑谜题上以极低的推理成本超越了前沿LLM。
预测随机低维重参数化何时能训练神经网络
本文分析了随机低维重参数化何时能训练神经网络,推导出随机切片残差的取向分辨主公式,并引入RaMaN——一个可扩展框架,能以极低内存成本预测所需潜在维度。
特征抽奖?概念涌现的分岔理论
本文提出了一种表征动力学的分岔理论,用于检测神经网络在训练过程中何时获得结构化表征。该理论利用对GMM探针的黑塞矩阵分析,得到的比值β/β_c作为一种无标签的相位坐标,能够预测可用结构的出现,并在训练早期预判稀疏自编码器中的特征可解释性。
通过参数噪声实现更好的探索
OpenAI 提出了参数噪声技术,该方法向神经网络策略参数添加自适应噪声,而不是向动作空间添加噪声,使得智能体能够比传统动作噪声方法快得多地学习任务。该方法在 HalfCheetah 上实现了 2 倍的学习速度提升,代表了进化策略与 TRPO、DDPG 等深度强化学习方法之间的平衡点。