Hunyuan3D-Buffalo 1.0:面向可扩展3D生成、理解与编辑的统一多模态模型
摘要
Hunyuan3D-Buffalo 1.0 是一个用于3D生成、理解与编辑的统一多模态模型,基于87M规模的3D多模态语料库进行训练。它结合了Hunyuan3D-VLM和Hunyuan3D-DiT,在文本到3D生成和3D编辑基准上取得了最先进的性能。
查看缓存全文
缓存时间: 2026/08/05 05:43
论文页面 - Hunyuan3D-Buffalo 1.0:用于可扩展3D生成、理解与编辑的统一多模态模型
来源:https://huggingface.co/papers/2608.02711 发布于8月3日
#3 当日论文(https://huggingface.co/papers/date/2026-08-05) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
图像生成领域的最新进展展示了统一多模态模型在整合理解、生成和编辑方面的潜力。然而,统一的3D建模仍受到多模态数据稀缺的制约,尤其是缺乏大规模且几何一致的编辑数据。为解决这一限制,我们提出了Hunyuan3D-Buffalo 1.0,这是一个在单一架构内支持3D理解、文本到3D生成、指令引导的3D编辑以及文本驱动的部件生成的统一框架。为实现可扩展训练,我们构建了一个8700万规模的3D多模态语料库,包含2500万理解样本、5000万文本-3D配对以及1200万使用Nano3D-v2生成的编辑配对。在架构上,该框架将用于语义、结构和空间理解的Hunyuan3D-VLM与用于高保真3D合成的Hunyuan3D DiT相结合。VLM为生成提供多模态语义条件,而编辑和部件生成则额外将扩散过程以源物体表征为条件,以保留其整体结构和未编辑区域。大量实验表明,Hunyuan3D-Buffalo 1.0在文本到3D生成和3D编辑基准测试中达到了最先进或领先的性能,同时展现出强大的理解和部件生成能力。我们的分析进一步表明,生成和理解均能改善编辑效果,验证了统一3D多模态训练的有效性。项目页面:https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0/
查看arXiv页面(https://arxiv.org/abs/2608.02711)查看PDF(https://arxiv.org/pdf/2608.02711)项目页面(https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.02711)
在您的代理中获取此论文:
hf papers read 2608\.02711
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无关联此论文的模型
在模型README.md中引用arxiv.org/abs/2608.02711即可从此页面关联。
引用此论文的数据集0
暂无关联此论文的数据集
在数据集README.md中引用arxiv.org/abs/2608.02711即可从此页面关联。
引用此论文的Space0
暂无关联此论文的Space
在Space README.md中引用arxiv.org/abs/2608.02711即可从此页面关联。
包含此论文的收藏集0
暂无包含此论文的收藏集
将这篇论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面关联。
相似文章
Hunyuan3D 2.0:扩展扩散模型以生成高分辨率纹理3D资产
Hunyuan3D 2.0 是一个可扩展的基于流的扩散变换器系统,用于生成高分辨率纹理3D资产,性能优于当前最先进的模型,并已公开发布代码和权重。
@HuggingModels:认识 Hunyuan3D-2——这款开源模型可把 2D 图片秒变完整 3D 资产
Hunyuan3D-2 是一款开源 AI 模型,可将 2D 图片即时转换为完整 3D 资产,无需复杂建模软件。
EVA01:通过混合变换器实现统一原生3D理解与生成
EVA01是一个统一框架,通过混合变换器架构将3D网格作为原生模态集成到多模态语言模型中,实现了先进的文本到3D生成以及长上下文多轮几何编辑。
UniCorn:通过自生成监督走向自我改进的统一多模态模型
UniCorn 是一个框架,通过使用多智能体系统进行提示生成、图像创建和质量评估,使统一多模态模型能够自我改进,在 TIIF、WISE 和 OneIG-EN 等文本到图像基准上取得了最先进的结果。
P3D-Bench:参数化3D生成与结构推理的多模态大语言模型基准测试
本文提出P3D-Bench,一个用于评估多模态大语言模型在参数化3D生成任务上的基准测试,涵盖文本到3D、图像到3D和组装到3D,并采用几何精度、语义对齐和部件级结构等指标。