@junyao_gao62882:风格迁移的ImageNet时刻来了!!我们已开源MegaStyle全套代码(训练/推理)、数据集与模型,欢迎尝鲜!
摘要
腾讯开源大规模风格迁移模型MegaStyle,含完整训练/推理代码、140万数据集及预训练模型。
风格迁移的ImageNet时刻来了!!我们已开源MegaStyle全套代码(训练/推理)、数据集与模型,欢迎尝鲜!
代码:https://github.com/Tencent/MegaStyle…
数据集:https://huggingface.co/datasets/tencent/MegaStyle-1.4M…
模型:https://huggingface.co/Gaojunyao/MegaStyle…
相似文章
@drfeifei: 我非常兴奋于这个适用于大规模生成模型新时代的视觉生成新基准数据集…
介绍GPIC(Giant Permissive Image Corpus),一个大规模数据集,包含1亿个VLM标注的图像-文本对用于训练,以及100万个用于基准测试的对,完全许可用于研究和商业用途。
@sheriyuo: 行业内首个万亿参数模型,在五万GPU中国集群上完成端到端训练与推理
美团发布了LongCat-2.0,一个1.6万亿参数的MoE模型,支持100万上下文,声称是首个在五万GPU中国集群上训练的模型,现已在OpenRouter上用于智能编码。
@jiqizhixin:如果只需要一步就能生成高质量图像,而不是数百步?斯坦福和字节跳动推出 W-Flow……
斯坦福和字节跳动推出 W-Flow,一种单步生成模型,利用 Wasserstein 梯度流实现了最先进的单步 ImageNet 256x256 生成(FID 1.29),采样速度比多步扩散模型快 100 倍。
@heyshrutimishra:百度最近开源了ERNIE-Image,80亿参数,权重可商用。意义重大。…
百度开源ERNIE-Image,80亿参数文生图模型,权重允许商用,成为少数完全开放、可微调、对标Midjourney等封闭模型的替代方案。
@NielsRogge: 优秀的论文,已在此处开放:https://paperswithcode.co/paper/98589 查看它与其他文本到图像模型的对比…
一篇关于文本到图像生成的论文已发布,附有开源代码、模型和完整的训练方案,并与其他模型的性能进行了比较。