面向模拟硬件的噪声感知训练:准确率在阈值处崩溃而非平滑下降 [D]
摘要
一项关于模拟硬件噪声的实验表明,准确率在阈值处崩溃而非平滑下降,而噪声感知训练显著移动了该阈值。
模拟内存计算作为绕过权重在内存与计算之间移动的能耗问题的方式,正重新受到关注。反复出现的反对意见是噪声,因为模拟单元存在真实的变异,而且你无法像数字那样通过刷新来消除它。我想看到退化曲线的形状,而不是抽象地推理,所以我做了一个简单的实验:正常训练一个网络,然后在增加的权重噪声下评估。曲线并不平滑。准确率在某个点之前保持稳定,然后急剧下降:83%,64%,然后基本随机。更像是一个阈值,而不是按比例的下降。在训练期间注入噪声进行重训练(因此优化器可能找到更平坦的最小值)显著移动了该阈值。在匹配噪声下为61%对39%。我想从本子版块听到的是:平坦最小值解释是正确的框架吗,还是其他因素导致了差距?以及是否有直接针对噪声鲁棒性进行优化的工作,而不仅仅是注入噪声并希望有效,更接近针对硬件实际噪声分布的显式尖锐度惩罚?代码和图表在文章中:https://towardsdatascience.com/analog-ai-is-back-can-it-survive-its-own-noise/
相似文章
固有噪声巩固:一种Doob势垒条件化扩散将模拟器件噪声转化为持续学习资源
本文提出将模拟神经形态硬件上的固有器件噪声作为持续学习的资源,通过条件化每个权重的随机动力学以避免跨越记忆关键势垒,展示了非单调的保持性能提升,并在BrainScaleS-2硅基芯片上进行了验证。
面向近无损HiF8 W8A8量化感知训练的最大窗口缩放估计
本文系统研究了OpenPangu-Embedded-1B的HiF8 W8A8量化感知训练,识别并解决了amax饱和和灾难性遗忘等失效模式,通过64步最大算法DTS策略和500步BF16预热实现了近无损性能。
NANQ:面向模拟存内计算的噪声底感知混合精度非均匀量化
本文提出了NANQ,一种面向模拟存内计算(CIM)系统的噪声底感知混合精度非均匀量化框架,它根据硬件噪声特性调整量化精度,并在低位宽约束下提高模型精度。
理解与改进指令微调中的噪声嵌入技术
本文分析了指令微调中的噪声嵌入技术,解释了为何均匀噪声优于高斯噪声,并引入了SymNoise,一种对称噪声方法,在AlpacaEval上将LLaMA-2-7B的性能显著提升至超过NEFTune。
Quantization Damage Is Multiplicative, Not Additive
This preprint challenges the common assumption that quantization damage is additive noise, showing instead that it multiplies decision margins and shrinks them with bit-width, leading to silent failures in tool-use and safety decisions. The authors propose a fitted multiplicative model that predicts flip rates well.