P3D-Bench:参数化3D生成与结构推理的多模态大语言模型基准测试

Hugging Face Daily Papers 论文

摘要

本文提出P3D-Bench,一个用于评估多模态大语言模型在参数化3D生成任务上的基准测试,涵盖文本到3D、图像到3D和组装到3D,并采用几何精度、语义对齐和部件级结构等指标。

多模态大语言模型能够编写代码以生成复杂程序,并利用程序进行3D建模,这为利用其先验知识、世界知识和推理能力驱动的3D生成开辟了新途径。然而,现有基准测试很少通过代码评估3D建模。此类建模不仅仅要求可运行的代码:从文本或视觉规范出发,模型必须生成一个参数化3D程序,该程序在几何上精确、语义上对齐且组装一致。我们引入P3D-Bench,一个用于参数化3D生成的基准测试。与3D网格不同,参数化3D程序暴露了明确的尺寸、构造操作和零件关系,揭示了模型是否恢复设计结构而不仅仅是外观。在统一协议下,P3D-Bench涵盖三个任务家族(文本到3D、图像到3D和组装到3D),并对每个输出的可执行性、几何保真度、拓扑结构、文本约束、多视角语义对齐和部件级结构进行评分。我们在400个文本案例、400个图像案例和203个带标注的组装案例上评估了前沿多模态大语言模型和纯文本大语言模型,并以领域特定模型作为参考点。我们的广泛评估得出三点发现。首先,组装是最困难的场景,模型仍无法将多个部件组合成连贯结构。其次,模型通常能恢复目标对象的整体形状和语义特征,但无法重现输入所指定的精确参数化几何。第三,在组装中部件级建模仍然薄弱,模型既无法恢复每个部件的几何形状,也无法恢复正确的部件数量。这些结果使P3D-Bench成为评估参数化3D生成中精确参数化几何和部件级结构的基准测试。
查看原文
查看缓存全文

缓存时间: 2026/06/15 09:02

论文页面 - P3D-Bench: 基准测试多模态大语言模型在参数化3D生成与结构推理上的表现

来源:https://huggingface.co/papers/2606.11152 发布于 6月9日

·

由 杨忆康 (https://huggingface.co/yangyk) 于 6月15日 提交

摘要

参数化3D生成基准测试通过基于代码的建模任务,评估模型在几何精度、语义对齐和装配一致性方面的能力。

多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20large%20language%20models) 能够编写代码生成复杂程序,并利用程序进行3D建模,这为其借助先验知识、世界知识和推理能力开辟了3D生成 (https://huggingface.co/papers?q=3D%20generation) 的新途径。然而,现有基准测试很少通过代码评估3D建模。这种建模不仅要求代码可运行:从文本或视觉规格出发,模型必须生成一个参数化3D程序 (https://huggingface.co/papers?q=parametric%203D%20program),该程序须在几何上精确、语义上对齐且装配一致 (https://huggingface.co/papers?q=assembly-consistent)。我们引入 P3D-Bench,一个用于参数化3D生成 (https://huggingface.co/papers?q=3D%20generation) 的基准测试。与3D网格不同,参数化3D程序 (https://huggingface.co/papers?q=parametric%203D%20program) 暴露了明确的尺寸、构造操作和部件关系,从而揭示模型是否恢复了设计的结构而不仅仅是外观。在统一协议下,P3D-Bench 涵盖三个任务系列(Text-to-3D (https://huggingface.co/papers?q=Text-to-3D)、Image-to-3D (https://huggingface.co/papers?q=Image-to-3D) 和 Assembly-3D (https://huggingface.co/papers?q=Assembly-3D)),并对每个输出进行可执行性 (https://huggingface.co/papers?q=executability)、几何保真度 (https://huggingface.co/papers?q=geometric%20fidelity)、拓扑 (https://huggingface.co/papers?q=topology)、文本约束、多视图语义对齐 (https://huggingface.co/papers?q=multiview%20semantic%20alignment) 以及部件级结构 (https://huggingface.co/papers?q=part-level%20structure) 的评分。我们在 400 个文本示例、400 个图像示例和 203 个标注装配体上评估了前沿 MLLM 和纯文本 LLM,并以领域特定模型作为参考。评估结果得出三点发现。首先,装配体是最困难的设定,模型仍无法将多个部件组合成连贯结构。其次,模型通常能恢复目标物体的整体形状和语义身份,但无法再现输入所指定的精确参数化几何。第三,在装配体上,部件级建模仍然薄弱,模型既无法恢复每个部件的几何形状,也无法确定正确的部件数量。这些结果使 P3D-Bench 成为评估参数化3D生成 (https://huggingface.co/papers?q=3D%20generation) 中精确参数化几何和部件级结构 (https://huggingface.co/papers?q=part-level%20structure) 的基准测试。

查看 arXiv 页面 (https://arxiv.org/abs/2606.11152) 查看 PDF (https://arxiv.org/pdf/2606.11152) 项目页面 (https://spatiaos.github.io/projects/P3D-Bench/) GitHub37 (https://github.com/SpatiaOS/P3D-Bench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.11152)

在您的代理中获取此论文:

hf papers read 2606.11152

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2606.11152 即可从此页面链接。

引用此论文的数据集1

SpatiaOS/P3D-Bench 查看器 • 3天前更新 • 1.4k • 156 (https://huggingface.co/datasets/SpatiaOS/P3D-Bench)

引用此论文的Space0

没有Space链接到此论文

在Space README.md中引用 arxiv.org/abs/2606.11152 即可从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准

arXiv cs.CL

本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。

超越API:探究MLLMs在物理工具使用中的极限

arXiv cs.CL

本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。