从零开始在iPod touch 4图像上训练视觉模型
摘要
使用iPod touch 4拍摄的350张红色一次性杯子的照片,从零开始训练了一个DCGAN模型,生成的结果让人联想到早期的DALL-E。
我在iPod touch 4拍摄的照片上从零开始训练了一个DCGAN模型。我了解从零训练视觉模型所需的规模,所以我先从单个物品的照片开始。我拍摄了大约350张红色一次性杯子的照片,背景和光照条件各不相同。模型生成的图像让我想起2022年OpenAI的DALL-E。我打算总共拍摄大约5000张照片,想看看模型能否捕捉到iPod摄像头特有的传感器伪影。
相似文章
LLaDA-Image: 构建强大图像生成器的完全开放训练方案
LLaDA-Image 提出了一个统一框架,结合了一个 60 亿参数的扩散变换器和一个冻结的视觉语言模块,用于生成具有精确编辑功能的逼真图像,通过高效的训练和快速推理,在开源模型中达到了最先进的成果。
本地iPhone AI图像生成正变得实用 - 每张图片仅需3秒
基准测试显示,在iPhone上本地运行Stable Diffusion 1.5,使用Realistic Vision V5.1 Hyper等优化模型,生成512x512图像最快仅需3.1秒,使得设备端AI图像生成变得切实可行。
仅用64个视觉token,460M VLM在iPhone上首token延迟降至0.3秒
VisionPsy-Nano-460M-Flash 是一款全新的460M视觉语言模型,每张图像仅使用64个视觉token,在iPhone上首token延迟降至0.3秒,同时保留了完整模型约99%的基准分数。这种优化牺牲了部分OCR和精细细节质量。
@ninaddaithankar: 视觉模型能否在没有数据增强、掩码、裁剪或重建的情况下学会观察?它可以!介绍……
介绍了时间差视觉表征学习范式(Temporal Difference in Vision, TDV),这是一种新颖的视觉表征学习范式,无需数据增强、掩码、裁剪或重建即可学习有用的表征,并在密集空间任务上达到与最先进方法相当的性能。
在微控制器上运行DCGAN推理:1260万参数,512KB SRAM,26秒生成,纯C实现 [P]
演示在低成本RISC-V微控制器(CH32H417)上运行具有1260万int8量化参数的DCGAN,使用纯C推理和量子熵采样,在26秒内生成64x64的猫脸图像。