我在一个 RP2350 微控制器上实现了一个非常小的图像生成模型(潜在流动变换器)——它可以生成 128x128 的人脸图像 [P]

Reddit r/MachineLearning 模型

摘要

一个具有 2.4-4 百万参数的小型潜在流动变换器,量化到 int8,在 RP2350 微控制器上实现,可在大约 20 秒内生成 128x128 的人脸图像。

这是一个具有 2.4-4 百万参数的模型,量化到 int8,可以在微控制器上完全执行,最长生成时间约 20 秒。生成的图像随后会显示在监视器上或通过 USB 传输。这是一个具有 12 层的潜在流动变换器,使用 AdaLN-Zero 进行条件控制。还支持 CFG,这大大提升了图像质量。推理引擎通过 DMA 从闪存中流式传输权重,同时计算前一层。使用 ReLU² 激活函数来增加稀疏性,引擎可以利用这一点跳过计算。进行了大量消融实验才得以正确实现,我对于用如此少的参数取得如此进展感到非常惊讶。将在下方发布代码仓库 https://preview.redd.it/psu567et66mh1.png?width=1167&format=png&auto=webp&s=8b69dfe5caf5a0cde79f03f23fb5843c940bf993
查看原文

相似文章

训练了一个在264KB RAM上运行的扩散模型 [P]

Reddit r/MachineLearning

一个人训练了一个扩散模型,在只有264KB RAM的Shrike lite微控制器上生成32x32像素的图像,尝试了FPGA加速但遇到了内存瓶颈,导致输出有时是噪声但有时很有趣。

Mage-Flow:一个高效的原始分辨率基础模型,用于图像生成和编辑

Hugging Face Daily Papers

Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。