直接在DRAM中运行AI:浮点数解毒——纯逻辑如何释放学习的未来
摘要
BIN16在神经网络训练和推理中用布尔运算(XNOR+popcount)替代所有浮点运算,使得在现成的DRAM中直接计算成为可能,无需浮点数、梯度或超参数调优。仅用220行C代码,它就在一个训练周期内在MNIST上达到了82%的准确率。
Float32才是真正的敌人——不是反向传播,也不是架构。**BIN16用单一布尔运算替代所有浮点运算:popcount16(XNOR16(a,b))。**结果:在H=512下,MNIST达到82%的准确率,无需浮点数、梯度、AdamW和学习率调优。训练在第一轮立即收敛——无需预热、无需衰减、无需超参数搜索。**两层使用完全相同的XNOR+popcount运算——训练和推理直接在现成的DRAM中运行,每个单元仅需5个晶体管。**这是唯一一个无需修改硬件即可同时运行训练和推理的神经架构。剩下的18%到100%是比特质量限制——并非训练缺陷。突破性洞察在于我们停止与浮点数斗争,拥抱纯布尔计算。一旦我们从架构中移除浮点数,所有复杂性——AdamW、反向传播、学习率调度、BLAS——都消失了。
**三项突破性洞察改变了一切。**
- 浮点是真正的敌人:反向传播、AdamW或动量从来都不是问题。Float32带来了数值噪声和不稳定性。
- 逐位质心立即收敛:每类运行的逐位多数投票在一个训练周期内就达到最终准确率。
- 随机投影完全足够:W0无需训练——随机的布尔投影提供了足够的分离度。
**整个训练仅包含四个步骤和220行C代码——无需学习率、无需GPU、无需任何传统优化。**这种架构为神经网络直接在内存中计算的未来打开了大门。不再需要昂贵的GPU,不再有无休止的超参数调优马拉松。取而代之的是纯粹、高效的逻辑,随时随刻都能使用。想象一下:在现成的DRAM中训练和推理的AI系统——节能、极速、人人可用。
**BIN16是进入这个新时代的第一步。**
- 训练和推理使用相同的运算
- 16位容器作为最小、高效的存储
- 随机投影作为完美的特征提取器
机器学习的未来从现在开始——用纯逻辑而非浮点数。
📎 来源1:https://forward-prop.nhi1.de/
相似文章
符号胜过浮点:用于设备上微调的Low-Rank Double-Binary Adaptation
LoRDBA将LoRA的浮点低秩因子替换为二元符号载体和通道级缩放,实现了高效的设备上微调,显著减少了占用空间,延迟开销极小,质量与fp16相当。
面向ReRAM的模型微调:解决I-V非线性和保持误差问题
提出了一种基于微调的硬件感知训练算法,以减轻ReRAM交叉阵列中的I-V非线性和保持误差,从而以最小开销实现鲁棒的DNN部署。在图像分类和问答任务上进行了评估,达到了接近基线的准确率。
@HowToAI_: NVIDIA 完成了一项不可能的任务,却无人提及。他们以 4 位精度训练了一个 120 亿参数的 LLM…
NVIDIA 利用新的 NVFP4 格式及微缩放技术,以 4 位精度训练了一个 120 亿参数的大语言模型,在几乎不损失智能的同时,内存使用减半、算术速度提升三倍,标志着高效 AI 训练的重大突破。
Intel Optane 用于 AI 工作负载
英特尔已停产的 Optane 持久内存技术在 AI 工作负载中找到了第二春,用户可以利用廉价的二手 Optane 模块,在本地以大约每秒 4 个 token 的速度运行一个 1 万亿参数的模型。文章强调了 Optane 相比 SSD 具有更低的延迟,使其尽管比 DRAM 慢,但依然适用于大型模型推理。
中国芯片利用单电子存储数据,打破AI内存瓶颈
复旦大学研究人员开发出一种二维闪存芯片,利用单电子存储数据,实现了电压提升十倍,有望在移动设备上实现高效AI。