layer-wise

标签

Cards List
#layer-wise

DREG:一种作为通用惩罚的逐层雅可比正则化

arXiv cs.LG · 2026-06-24 缓存

本文对导数正则化(DREG)惩罚进行了大规模实证研究,表明其在高精度和噪声鲁棒性方面表现优异,特别是使用GELU激活函数和数据稀缺场景,将其定位为神经网络的一种通用即插即用正则化器。

0 人收藏 0 人点赞
#layer-wise

层表示动力学:跨嵌入器和基础大语言模型的实证研究

arXiv cs.LG · 2026-05-14 缓存

本文引入了层表示动力学(LRD),这是一个包含三个测量家族的框架,用于分析语言模型中各层隐藏状态的变化。应用于30个MTEB任务上的31个模型,LRD揭示了架构差异,并实现了无标签模型选择和推理时层剪枝。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈