训练了一个在264KB RAM上运行的扩散模型 [P]

Reddit r/MachineLearning 新闻

摘要

一个人训练了一个扩散模型,在只有264KB RAM的Shrike lite微控制器上生成32x32像素的图像,尝试了FPGA加速但遇到了内存瓶颈,导致输出有时是噪声但有时很有趣。

我最近购买了一个Shrike lite,它有264KB的SRAM。我决定训练一个生成32*32像素图像的图像生成模型。微控制器上还装有FPGA,我用它创建了两个并行的INT8 MAC引擎,具有16位累加,以加速计算,但系统很快遇到了内存墙,因为I/O操作数量很多,这意味着带有并行MAC引擎的系统比仅MCU的模型运行得更慢(每张图像约220秒 vs 约70秒)。这仍然是一个有趣的项目,我享受其中。很多图像看起来奇怪和嘈杂,因为严重的量化和内存限制,但有些出来很酷。完整的案例研究在这里。
查看原文

相似文章

Qwen 3.6 27B AR->Diffusion - 在5090上的本地训练

Reddit r/LocalLLaMA

作者详细介绍了尝试在Nvidia 5090 GPU上使用qlora以及来自open-dllm和d3LLM的修改来本地训练Qwen 3.6 27B自回归到扩散模型的过程,在探索单步扩散技术时遇到了显存限制和硬件问题。

我如何仅用24GB内存运行193B参数模型

Reddit r/ArtificialInteligence

介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。

FourTune:迈向扩散模型全4比特高效后训练

arXiv cs.LG

FourTune提出了一个全4比特量化框架(W4A4G4),用于扩散模型的高效后训练,采用三分支混合流水线和自定义融合内核,在12B FLUX.1-dev上将内存减少2.25倍,吞吐量提升2.27倍,且无质量损失。