UniMesh:统一3D网格理解与生成
摘要
UniMesh通过单一模型,借助Mesh Head、链式网格迭代编辑和自省纠错机制,同时完成3D网格生成与理解任务。
查看缓存全文
缓存时间: 2026/04/22 06:17
论文页面 - UniMesh:统一3D网格理解与生成
来源:https://huggingface.co/papers/2604.17472
摘要
UniMesh 提出了一种统一框架,通过新颖组件——Mesh Head、链式网格(Chain of Mesh)迭代编辑机制,以及用于纠错的自反思机制——将3D生成与理解任务合二为一。
近期3D视觉(https://huggingface.co/papers?q=3D%20vision)进展催生了专门模型,分别聚焦于3D理解(如形状分类、分割、重建)或3D生成(如合成、补全、编辑)。然而,这些任务通常被孤立处理,导致架构与表示碎片化,阻碍知识迁移与整体场景建模。为此,我们提出UniMesh,在单一架构内联合学习3D生成与理解。首先,我们引入全新Mesh Head(https://huggingface.co/papers?q=Mesh%20Head),作为跨模型接口,连接基于扩散的图像生成(https://huggingface.co/papers?q=diffusion%20based%20image%20generation)与隐式形状解码器(https://huggingface.co/papers?q=implicit%20shape%20decoders)。其次,我们开发链式网格(Chain of Mesh,CoM)(https://huggingface.co/papers?q=Chain%20of%20Mesh),一种几何化的迭代推理(https://huggingface.co/papers?q=iterative%20reasoning)实例,通过闭环潜空间、提示与再生成循环,实现用户驱动的语义网格编辑(https://huggingface.co/papers?q=semantic%20mesh%20editing)。第三,我们引入基于“Actor-Evaluator-自反思”三元组(https://huggingface.co/papers?q=Actor%20Evaluator%20Self%20reflection%20triad)的自反思机制,诊断并纠正3D字幕(https://huggingface.co/papers?q=3D%20captioning)等高层任务中的失败。实验表明,UniMesh不仅标准基准性能优异,还解锁了迭代编辑及生成与理解相互增强的新能力。代码:https://github.com/AIGeeksGroup/UniMesh。项目主页:https://aigeeksgroup.github.io/UniMesh。
查看 arXiv 页面(https://arxiv.org/abs/2604.17472)
查看 PDF(https://arxiv.org/pdf/2604.17472)
项目主页(https://aigeeksgroup.github.io/UniMesh/)
GitHub(https://github.com/AIGeeksGroup/UniMesh)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.17472)
在智能体中获取本文:
hf papers read 2604.17472
尚未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型引用该论文
在模型 README.md 中引用 arxiv.org/abs/2604.17472 即可在此页面显示链接。
引用该论文的数据集 0
暂无数据集引用该论文
在数据集 README.md 中引用 arxiv.org/abs/2604.17472 即可在此页面显示链接。
引用该论文的 Spaces 0
暂无 Space 引用该论文
在 Space README.md 中引用 arxiv.org/abs/2604.17472 即可在此页面显示链接。
收录该论文的合集 0
暂无合集收录该论文
将该论文添加到合集(https://huggingface.co/new-collection)即可在此页面显示链接。
相似文章
UniMate:一个统一模型,用于动画化多样骨架
UniMate是一个统一的扩散变换器模型,能够从文本和绑定了3D资产为多样骨架生成关节运动,无需针对每个骨架进行重新训练。它利用拓扑感知注意力和一个大型精选数据集。
EVA01:通过混合变换器实现统一原生3D理解与生成
EVA01是一个统一框架,通过混合变换器架构将3D网格作为原生模态集成到多模态语言模型中,实现了先进的文本到3D生成以及长上下文多轮几何编辑。
UniSpace:统一的视觉表示与可扩展的多模态建模
UniSpace引入了一种统一的视觉表示,通过使用重新参数化的ViT,在单一空间中统一了语义理解、高保真重建和图像生成,消除了对独立VAE的需求。
Uni-Edit:智能编辑是统一模型调优的通用任务
Uni-Edit提出使用智能图像编辑作为单一通用任务,以同时提升统一多模态模型的理解、生成和编辑能力,并配备自动化数据合成流程生成复杂的编辑指令。
JanusMesh: 快速零样本3D视觉幻觉生成——基于跨空间去噪
JanusMesh 是一个快速、免训练的框架,通过将生成过程解耦为跨空间双分支去噪和视图条件纹理合成,生成文本驱动的3D视觉错觉——单个网格从不同视角展示不同语义——在仅3-5分钟内实现高真实感。