标签
介绍了语义生成微调(SGT),一种利用图像分割作为生成代理来对齐统一多模态模型中的视觉理解和生成任务的范式,从而提升理解能力和生成保真度。
本文介绍了 SenseNova-U1,这是一种统一的多模态架构,整合了理解与生成任务。我们发布了两个变体(8B 和 30B),在感知能力和图像合成方面均表现出竞争力的性能。
本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。