EVA01:通过混合变换器实现统一原生3D理解与生成
摘要
EVA01是一个统一框架,通过混合变换器架构将3D网格作为原生模态集成到多模态语言模型中,实现了先进的文本到3D生成以及长上下文多轮几何编辑。
查看缓存全文
缓存时间: 2026/06/02 15:36
论文页面 - EVA01:基于混合专家变换器的统一原生3D理解与生成
来源:https://huggingface.co/papers/2605.16745
作者:
摘要
EVA01通过混合专家变换器(Mixture-of-Transformers)架构,实现了原生3D网格在多模态语言模型中的集成,使语义流形与几何流形对齐,从而提升生成与编辑能力。
本文解决了将3D网格作为原生模态集成到多模态大语言模型(MLLM)中的挑战。基于扩散的大型重建模型将语义理解与几何推理分离,作为依赖密集2D像素先验的无状态重建器运行。近期基于MLLM的方法将3D模态视为外部输出而非多模态序列的原生组成部分,仅进行增量式适配,缺乏对几何流形与MLLM特征空间对齐方式的系统性分析。我们提出EVA01,这是一个统一的框架,将MLLM的模态边界扩展至原生包含3D网格的理解、生成和上下文感知编辑。该框架基于混合专家变换器(MoT)架构,将模型解耦为预训练的理解专家(E_und)和结构镜像的生成专家(E_gen),两者通过共享的全局自注意力与硬模态路由耦合。这种设计使得MLLM骨干网络的语义潜在空间与几何流形对齐,从而无需中间2D表示即可直接迁移多模态先验。实验结果表明,EVA01在原生文本到3D生成保真度方面达到了业界领先水平,并解锁了具有身份保持能力的稳健长上下文多轮几何编辑功能——这一能力从根本上无法被无状态重建管线实现。我们的研究还为基础模型在3D任务中的集成提供了架构见解,为原生3D多模态系统的设计提供了参考。项目页面:https://www.seeles.ai/research/pages/EVA01
查看arXiv页面 (https://arxiv.org/abs/2605.16745)
查看PDF (https://arxiv.org/pdf/2605.16745)
项目页面 (https://www.seeles.ai/research/pages/EVA01)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.16745)
在您的代理中获取此论文:
hf papers read 2605.16745
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接到此论文
在模型的README.md中引用arxiv.org/abs/2605.16745即可从此页面链接。
引用此论文的数据集 0
没有数据集链接到此论文
在数据集的README.md中引用arxiv.org/abs/2605.16745即可从此页面链接。
引用此论文的Space 0
没有Space链接到此论文
在Space的README.md中引用arxiv.org/abs/2605.16745即可从此页面链接。
包含此论文的合集 1
相似文章
UniMesh:统一3D网格理解与生成
UniMesh通过单一模型,借助Mesh Head、链式网格迭代编辑和自省纠错机制,同时完成3D网格生成与理解任务。
UniDDT: 通过解耦扩散变换器统一多模态理解与生成
UniDDT提出了一种解耦扩散变换器框架,通过利用Noisy ViT编码器和LLM进行语义编码,统一了多模态理解与生成,在两个任务上均取得了强劲性能。
在统一的多模态理解与生成中唤醒空间智能
本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。
VGGT-Edit: 基于残差场预测的前馈原生3D场景编辑
VGGT-Edit 提出了一种基于深度同步文本注入和残差场预测的前馈框架,用于文本驱动的原生3D场景编辑,相较于2D提升方法,实现了更优的质量和效率。
HYDRA-X: 原生统一多模态模型与整体视觉分词器
HYDRA-X 提出了一种统一的多模态模型,将图像和视频分词集成到单个视觉变换器中,在理解和生成任务上均取得了强劲性能。