从零开始在iPod touch 4图像上训练视觉模型

Reddit r/LocalLLaMA 模型

摘要

使用iPod touch 4拍摄的350张红色一次性杯子的照片,从零开始训练了一个DCGAN模型,生成的结果让人联想到早期的DALL-E。

我在iPod touch 4拍摄的照片上从零开始训练了一个DCGAN模型。我了解从零训练视觉模型所需的规模,所以我先从单个物品的照片开始。我拍摄了大约350张红色一次性杯子的照片,背景和光照条件各不相同。模型生成的图像让我想起2022年OpenAI的DALL-E。我打算总共拍摄大约5000张照片,想看看模型能否捕捉到iPod摄像头特有的传感器伪影。
查看原文

相似文章

LLaDA-Image: 构建强大图像生成器的完全开放训练方案

Hugging Face Daily Papers

LLaDA-Image 提出了一个统一框架,结合了一个 60 亿参数的扩散变换器和一个冻结的视觉语言模块,用于生成具有精确编辑功能的逼真图像,通过高效的训练和快速推理,在开源模型中达到了最先进的成果。