我在一个 RP2350 微控制器上实现了一个非常小的图像生成模型(潜在流动变换器)——它可以生成 128x128 的人脸图像 [P]
摘要
一个具有 2.4-4 百万参数的小型潜在流动变换器,量化到 int8,在 RP2350 微控制器上实现,可在大约 20 秒内生成 128x128 的人脸图像。
这是一个具有 2.4-4 百万参数的模型,量化到 int8,可以在微控制器上完全执行,最长生成时间约 20 秒。生成的图像随后会显示在监视器上或通过 USB 传输。这是一个具有 12 层的潜在流动变换器,使用 AdaLN-Zero 进行条件控制。还支持 CFG,这大大提升了图像质量。推理引擎通过 DMA 从闪存中流式传输权重,同时计算前一层。使用 ReLU² 激活函数来增加稀疏性,引擎可以利用这一点跳过计算。进行了大量消融实验才得以正确实现,我对于用如此少的参数取得如此进展感到非常惊讶。将在下方发布代码仓库 https://preview.redd.it/psu567et66mh1.png?width=1167&format=png&auto=webp&s=8b69dfe5caf5a0cde79f03f23fb5843c940bf993
相似文章
训练了一个在264KB RAM上运行的扩散模型 [P]
一个人训练了一个扩散模型,在只有264KB RAM的Shrike lite微控制器上生成32x32像素的图像,尝试了FPGA加速但遇到了内存瓶颈,导致输出有时是噪声但有时很有趣。
Mage-Flow:一个高效的原始分辨率基础模型,用于图像生成和编辑
Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。
我构建了‘第一个’流匹配图像生成器,以下是我的心得 [P]
作者分享了构建一个小型流匹配图像生成模型的经历,该模型基于 Apple 表情符号图像进行训练,描述了最初失败的方法以及后来成功转向使用 RGB 通道、残差块和注意力的过程。
@jiqizhixin:如果只需要一步就能生成高质量图像,而不是数百步?斯坦福和字节跳动推出 W-Flow……
斯坦福和字节跳动推出 W-Flow,一种单步生成模型,利用 Wasserstein 梯度流实现了最先进的单步 ImageNet 256x256 生成(FID 1.29),采样速度比多步扩散模型快 100 倍。
在微控制器上运行DCGAN推理:1260万参数,512KB SRAM,26秒生成,纯C实现 [P]
演示在低成本RISC-V微控制器(CH32H417)上运行具有1260万int8量化参数的DCGAN,使用纯C推理和量子熵采样,在26秒内生成64x64的猫脸图像。