EVA01:通过混合变换器实现统一原生3D理解与生成

Hugging Face Daily Papers 论文

摘要

EVA01是一个统一框架,通过混合变换器架构将3D网格作为原生模态集成到多模态语言模型中,实现了先进的文本到3D生成以及长上下文多轮几何编辑。

本文解决了将3D网格作为原生模态集成到多模态大语言模型(MLLM)中的挑战。基于扩散的大型重建模型将语义理解与几何推理解耦,作为依赖于密集2D像素先验的无状态重构器运行。近期基于MLLM的方法将3D模态视为外部输出而非多模态序列的原生组成部分,仅进行增量式调整,缺乏对几何流形如何与MLLM特征空间对齐的系统分析。我们提出了EVA01,一个统一框架,将MLLM的模态边界扩展为原生包含3D网格的理解、生成和上下文感知编辑。基于混合变换器(MoT)架构,EVA01将模型解耦为预训练的理解专家(E_{und})和结构镜像的生成专家(E_{gen}),通过共享全局自注意力与硬模态路由耦合。该设计将MLLM骨干网络的语义潜在空间与几何流形对齐,使得多模态先验可以直接传递,无需中间2D表示。结果表明,EVA01在原生文本到3D生成保真度上达到先进水平,并解锁了鲁棒的长上下文多轮几何编辑,且保持身份一致性——这对无状态重建流水线来说根本不可能实现。我们的发现进一步为将2D基础模型与3D任务集成提供了架构见解,为原生3D多模态系统的设计提供了指导。项目页面:https://www.seeles.ai/research/pages/EVA01
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:36

论文页面 - EVA01:基于混合专家变换器的统一原生3D理解与生成

来源:https://huggingface.co/papers/2605.16745
作者:

摘要

EVA01通过混合专家变换器(Mixture-of-Transformers)架构,实现了原生3D网格在多模态语言模型中的集成,使语义流形与几何流形对齐,从而提升生成与编辑能力。

本文解决了将3D网格作为原生模态集成到多模态大语言模型(MLLM)中的挑战。基于扩散的大型重建模型将语义理解与几何推理分离,作为依赖密集2D像素先验的无状态重建器运行。近期基于MLLM的方法将3D模态视为外部输出而非多模态序列的原生组成部分,仅进行增量式适配,缺乏对几何流形与MLLM特征空间对齐方式的系统性分析。我们提出EVA01,这是一个统一的框架,将MLLM的模态边界扩展至原生包含3D网格的理解、生成和上下文感知编辑。该框架基于混合专家变换器(MoT)架构,将模型解耦为预训练的理解专家(E_und)和结构镜像的生成专家(E_gen),两者通过共享的全局自注意力与硬模态路由耦合。这种设计使得MLLM骨干网络的语义潜在空间与几何流形对齐,从而无需中间2D表示即可直接迁移多模态先验。实验结果表明,EVA01在原生文本到3D生成保真度方面达到了业界领先水平,并解锁了具有身份保持能力的稳健长上下文多轮几何编辑功能——这一能力从根本上无法被无状态重建管线实现。我们的研究还为基础模型在3D任务中的集成提供了架构见解,为原生3D多模态系统的设计提供了参考。项目页面:https://www.seeles.ai/research/pages/EVA01

查看arXiv页面 (https://arxiv.org/abs/2605.16745)
查看PDF (https://arxiv.org/pdf/2605.16745)
项目页面 (https://www.seeles.ai/research/pages/EVA01)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.16745)

在您的代理中获取此论文:

hf papers read 2605.16745

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接到此论文

在模型的README.md中引用arxiv.org/abs/2605.16745即可从此页面链接。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集的README.md中引用arxiv.org/abs/2605.16745即可从此页面链接。

引用此论文的Space 0

没有Space链接到此论文

在Space的README.md中引用arxiv.org/abs/2605.16745即可从此页面链接。

包含此论文的合集 1

相似文章

UniMesh:统一3D网格理解与生成

Hugging Face Daily Papers

UniMesh通过单一模型,借助Mesh Head、链式网格迭代编辑和自省纠错机制,同时完成3D网格生成与理解任务。

在统一的多模态理解与生成中唤醒空间智能

Hugging Face Daily Papers

本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。