训练了一个在264KB RAM上运行的扩散模型 [P]
摘要
一个人训练了一个扩散模型,在只有264KB RAM的Shrike lite微控制器上生成32x32像素的图像,尝试了FPGA加速但遇到了内存瓶颈,导致输出有时是噪声但有时很有趣。
我最近购买了一个Shrike lite,它有264KB的SRAM。我决定训练一个生成32*32像素图像的图像生成模型。微控制器上还装有FPGA,我用它创建了两个并行的INT8 MAC引擎,具有16位累加,以加速计算,但系统很快遇到了内存墙,因为I/O操作数量很多,这意味着带有并行MAC引擎的系统比仅MCU的模型运行得更慢(每张图像约220秒 vs 约70秒)。这仍然是一个有趣的项目,我享受其中。很多图像看起来奇怪和嘈杂,因为严重的量化和内存限制,但有些出来很酷。完整的案例研究在这里。
相似文章
Qwen 3.6 27B AR->Diffusion - 在5090上的本地训练
作者详细介绍了尝试在Nvidia 5090 GPU上使用qlora以及来自open-dllm和d3LLM的修改来本地训练Qwen 3.6 27B自回归到扩散模型的过程,在探索单步扩散技术时遇到了显存限制和硬件问题。
我如何仅用24GB内存运行193B参数模型
介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。
我在ESP32 Dev Kit V1上运行了完整的LLM模型(仅用81KB内存)
一位开发者成功在ESP32 Dev Kit V1上运行了量化至INT4的520万参数MoE LLM,仅使用81KB SRAM,通过从闪存流式加载专家,实现了约每秒5个token的速度。
FourTune:迈向扩散模型全4比特高效后训练
FourTune提出了一个全4比特量化框架(W4A4G4),用于扩散模型的高效后训练,采用三分支混合流水线和自定义融合内核,在12B FLUX.1-dev上将内存减少2.25倍,吞吐量提升2.27倍,且无质量损失。
从零开始在8GB显存上训练LLM。我开心
构建了一个仓库,用于在8GB显存上从零训练一个微型语言模型(25M参数),支持MTP,但指出mHC和BitNet的局限性。