在统一的多模态理解与生成中唤醒空间智能
摘要
本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。
查看缓存全文
缓存时间: 2026/05/08 08:08
论文页面 - 唤醒统一多模态理解与生成中的空间智能
来源: https://huggingface.co/papers/2605.04128 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
JoyAI-Image 将空间增强的 MLLM 与 MMDiT 相结合,以实现统一的视觉理解、文生图生成和指令引导的图像编辑,并具备增强的空间智能。
我们提出了 JoyAI-Image,这是一个用于视觉理解、文生图生成和指令引导图像编辑的统一多模态基础模型。JoyAI-Image 将空间增强的多模态大语言模型 (Multimodal Large Language Model, MLLM) 与多模态扩散 Transformer (Multimodal Diffusion Transformer, MMDiT) 耦合,允许感知和生成通过共享的多模态接口进行交互。围绕这一架构,我们构建了一个可扩展的训练方案,结合了统一指令微调 (unified instruction tuning)、长文本渲染监督 (long-text rendering supervision)、空间接地数据 (spatially grounded data) 以及通用和空间编辑信号。这种设计赋予了模型广泛的多模态能力,同时增强了基于几何的推理能力和可控的视觉合成 (controllable visual synthesis)。在理解、生成、长文本渲染和编辑基准上的实验表明,JoyAI-Image 达到了最先进或极具竞争力的性能。更重要的是,增强理解、可控空间编辑和新视角辅助推理之间的双向循环 (bidirectional loop) 使模型能够超越一般的视觉能力,走向更强的空间智能 (spatial intelligence)。这些结果表明,统一视觉模型在下游应用(如视觉-语言-动作系统 (vision-language-action systems) 和世界模型 (world models))中具有广阔的前景。
查看 arXiv 页面 (https://arxiv.org/abs/2605.04128)查看 PDF (https://arxiv.org/pdf/2605.04128)GitHub2.11k (https://github.com/jd-opensource/JoyAI-Image)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.04128)
在您的 agent 中获取此论文:
hf papers read 2605\.04128
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
jdopensource/JoyAI-Image-Edit Image-to-Image• 更新于1天前 • 6.02k • 119 (https://huggingface.co/jdopensource/JoyAI-Image-Edit)
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.04128 以从本页面链接。
引用此论文的应用空间3
包含此论文的集合1
相似文章
通过理解监督引导统一多模态模型中的视觉生成
本文介绍了 UNO,这是一种以理解为导向的后训练框架,利用理解任务作为监督信号,以增强统一多模态模型中的图像生成和编辑能力。
统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键
UniAR提出了一个统一的自回归框架,使用单个离散视觉分词器桥接视觉理解与生成,在图像生成和编辑方面取得了最佳成果。
SmartMage:面向3D场景理解的动态模态编排
SmartMage 是一个统一的多模态大语言模型(LLM),它针对查询相关的3D场景理解动态编排视觉与几何模态,在五个基准上取得了最先进的结果。
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。
图像即句子:扩展交错指令以实现统一的视觉生成
本文介绍了 INSET,这是一个统一的多模态模型,它将图像作为原生词汇嵌入到文本指令中,从而提高了在图像生成和编辑任务中处理复杂交错输入的能力。