weight-decay

标签

Cards List
#weight-decay

无流形的对称性:轨道上的内蕴维数

arXiv cs.LG · 19小时前 缓存

本文展示了当数据形成群轨道时,标准神经缩放定律的推导会失败,因为内蕴维数未定义,导致模型性能呈现指数缩放而非幂律缩放。

0 人收藏 0 人点赞
#weight-decay

热力学权重衰减:通过注意力比热探讨顿悟加速

arXiv cs.LG · 2026-07-24 缓存

本文引入了CvAdamW,一种AdamW变体,它通过监测注意力比热来检测顿悟相变,并动态调整权重衰减,在基线失败的模算术任务上实现了顿悟。

0 人收藏 0 人点赞
#weight-decay

体积微小,效果显著:大语言模型中的缩放向量研究

Hugging Face Daily Papers · 2026-05-26 缓存

本文系统地研究了LLM归一化层中的缩放向量,揭示了它们通过自放大预条件效应优化训练,并提出了三种轻量级改进方案,在几乎不增加开销的情况下提升性能和扩展行为。

0 人收藏 0 人点赞
#weight-decay

基于无调度频谱优化的随时训练

arXiv cs.LG · 2026-05-25 缓存

本文介绍了SF-NorMuon,一种无调度频谱优化器,在参数规模达7.72亿的语言模型上匹配或超越调优后的AdamW,并提供了平稳性和长期稳定性的理论保证。

0 人收藏 0 人点赞
#weight-decay

Grokking Transformer中的权重衰减机制:廉价在线诊断

arXiv cs.LG · 2026-05-21 缓存

本文研究了权重衰减如何作为控制参数,使在模算术上训练的Transformer在记忆与泛化之间发生转变,并引入了两种基于注意力激活的廉价在线诊断指标,用以追踪这些动态。

0 人收藏 0 人点赞
#weight-decay

LoRA 与权重衰减 (2023)

Hacker News Top · 2026-05-18 缓存

这篇博客文章探讨了LoRA与权重衰减的相互作用如何导致与全参微调不同的优化目标,其中权重被正则化到初始模型而不是零。它解释了对实践者的影响。

0 人收藏 0 人点赞
#weight-decay

数据受限训练的规定性缩放定律

Hugging Face Daily Papers · 2026-05-02 缓存

一种考虑数据重复效应的修正缩放定律,为数据受限场景提供了计算最优的训练策略,表明超出某一界限后,进一步重复会适得其反,计算资源应更明智地用于模型容量。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈