@ZhengyangGeng: 你永远可以相信Kaiming的质量标准。写作、代码、数据、配方、检查点…… https://github.com/PeppaKing8/minit2i-…
摘要
MiniT2I 是一个极简的直接RGB文本到图像生成器,使用像素空间MM-JiT去噪器,结合流匹配和冻结的FLAN-T5-Large文本令牌,并开源了JAX/Flax和PyTorch实现以及检查点。
你永远可以相信Kaiming的质量标准。写作、代码、数据、配方、检查点…… https://github.com/PeppaKing8/minit2i-jax… https://github.com/Hope7Happiness/minit2i-torch… 与所有本科生合作非常愉快!他们简直就是组里的“博士后”。@kevinxbwang2007 @Hope7Happiness @Lyy_iiis 带带弟弟
查看缓存全文
缓存时间: 2026/06/18 08:12
MiniT2I:文本到图像生成的极简基线
相似文章
@op7418: https://x.com/op7418/status/2074728162018152817
用户发布了开源AI配图技能guizang-material-illustration,基于GPT-Image 2.0和Codex Agent,能生成带中文标签的3D材质解释图,适用于文章、周报、PPT等场景。
@jun_song:正在尝试将 Kimi-K2.6 (1T) 适配到 128GB Mac 上。目标是达到 40tok/s,并尽可能减少质量损失。
一位开发者正在优化 Kimi-K2.6 (1T) 模型,使其能在 128GB Mac 上高效运行,目标速度为 40 tok/s,同时尽可能降低质量损失。
@zstmfhy: 刚试完小米老师开源的 gimi-illustration-skill,直接说结论:这玩意儿太实用了。 丢一篇文章进去,AI 自动分析结构、提炼要点,生成手绘配图。风格统一,不模板化。 支持自定义 IP 形象,做自己的视觉识别 图片尺寸可调…
小米老师开源的 gimi-illustration-skill,输入文章内容可自动生成风格统一的手绘配图,支持自定义IP形象和多种尺寸,适用于汇报、攻略、教程等场景,已托管在GitHub。
@HuggingPapers: 阿里巴巴发布Qwen-Image-Flash,少步蒸馏超越目标,数据组成、教师指导和…
阿里巴巴发布了Qwen-Image-Flash,这是一种少步蒸馏模型,用于快速、高质量的文本到图像生成和指令引导编辑,利用了数据组成、教师指导和任务混合。
K3 发布了!
Moonshot AI 发布了 Kimi-K3,这是一个多模态图像文本到文本模型,可在 Hugging Face 上获取,支持 Transformers、vLLM、SGLang 和 Docker。