面向模拟硬件的噪声感知训练:准确率在阈值处崩溃而非平滑下降 [D]

Reddit r/MachineLearning 论文

摘要

一项关于模拟硬件噪声的实验表明,准确率在阈值处崩溃而非平滑下降,而噪声感知训练显著移动了该阈值。

模拟内存计算作为绕过权重在内存与计算之间移动的能耗问题的方式,正重新受到关注。反复出现的反对意见是噪声,因为模拟单元存在真实的变异,而且你无法像数字那样通过刷新来消除它。我想看到退化曲线的形状,而不是抽象地推理,所以我做了一个简单的实验:正常训练一个网络,然后在增加的权重噪声下评估。曲线并不平滑。准确率在某个点之前保持稳定,然后急剧下降:83%,64%,然后基本随机。更像是一个阈值,而不是按比例的下降。在训练期间注入噪声进行重训练(因此优化器可能找到更平坦的最小值)显著移动了该阈值。在匹配噪声下为61%对39%。我想从本子版块听到的是:平坦最小值解释是正确的框架吗,还是其他因素导致了差距?以及是否有直接针对噪声鲁棒性进行优化的工作,而不仅仅是注入噪声并希望有效,更接近针对硬件实际噪声分布的显式尖锐度惩罚?代码和图表在文章中:https://towardsdatascience.com/analog-ai-is-back-can-it-survive-its-own-noise/
查看原文

相似文章

理解与改进指令微调中的噪声嵌入技术

arXiv cs.LG

本文分析了指令微调中的噪声嵌入技术,解释了为何均匀噪声优于高斯噪声,并引入了SymNoise,一种对称噪声方法,在AlpacaEval上将LLaMA-2-7B的性能显著提升至超过NEFTune。

Quantization Damage Is Multiplicative, Not Additive

arXiv cs.LG

This preprint challenges the common assumption that quantization damage is additive noise, showing instead that it multiplies decision margins and shrinks them with bit-width, leading to silent failures in tool-use and safety decisions. The authors propose a fitted multiplicative model that predicts flip rates well.