P3D-Bench:参数化3D生成与结构推理的多模态大语言模型基准测试
摘要
本文提出P3D-Bench,一个用于评估多模态大语言模型在参数化3D生成任务上的基准测试,涵盖文本到3D、图像到3D和组装到3D,并采用几何精度、语义对齐和部件级结构等指标。
查看缓存全文
缓存时间: 2026/06/15 09:02
论文页面 - P3D-Bench: 基准测试多模态大语言模型在参数化3D生成与结构推理上的表现
来源:https://huggingface.co/papers/2606.11152 发布于 6月9日
·
由 杨忆康 (https://huggingface.co/yangyk) 于 6月15日 提交
摘要
参数化3D生成基准测试通过基于代码的建模任务,评估模型在几何精度、语义对齐和装配一致性方面的能力。
多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20large%20language%20models) 能够编写代码生成复杂程序,并利用程序进行3D建模,这为其借助先验知识、世界知识和推理能力开辟了3D生成 (https://huggingface.co/papers?q=3D%20generation) 的新途径。然而,现有基准测试很少通过代码评估3D建模。这种建模不仅要求代码可运行:从文本或视觉规格出发,模型必须生成一个参数化3D程序 (https://huggingface.co/papers?q=parametric%203D%20program),该程序须在几何上精确、语义上对齐且装配一致 (https://huggingface.co/papers?q=assembly-consistent)。我们引入 P3D-Bench,一个用于参数化3D生成 (https://huggingface.co/papers?q=3D%20generation) 的基准测试。与3D网格不同,参数化3D程序 (https://huggingface.co/papers?q=parametric%203D%20program) 暴露了明确的尺寸、构造操作和部件关系,从而揭示模型是否恢复了设计的结构而不仅仅是外观。在统一协议下,P3D-Bench 涵盖三个任务系列(Text-to-3D (https://huggingface.co/papers?q=Text-to-3D)、Image-to-3D (https://huggingface.co/papers?q=Image-to-3D) 和 Assembly-3D (https://huggingface.co/papers?q=Assembly-3D)),并对每个输出进行可执行性 (https://huggingface.co/papers?q=executability)、几何保真度 (https://huggingface.co/papers?q=geometric%20fidelity)、拓扑 (https://huggingface.co/papers?q=topology)、文本约束、多视图语义对齐 (https://huggingface.co/papers?q=multiview%20semantic%20alignment) 以及部件级结构 (https://huggingface.co/papers?q=part-level%20structure) 的评分。我们在 400 个文本示例、400 个图像示例和 203 个标注装配体上评估了前沿 MLLM 和纯文本 LLM,并以领域特定模型作为参考。评估结果得出三点发现。首先,装配体是最困难的设定,模型仍无法将多个部件组合成连贯结构。其次,模型通常能恢复目标物体的整体形状和语义身份,但无法再现输入所指定的精确参数化几何。第三,在装配体上,部件级建模仍然薄弱,模型既无法恢复每个部件的几何形状,也无法确定正确的部件数量。这些结果使 P3D-Bench 成为评估参数化3D生成 (https://huggingface.co/papers?q=3D%20generation) 中精确参数化几何和部件级结构 (https://huggingface.co/papers?q=part-level%20structure) 的基准测试。
查看 arXiv 页面 (https://arxiv.org/abs/2606.11152) 查看 PDF (https://arxiv.org/pdf/2606.11152) 项目页面 (https://spatiaos.github.io/projects/P3D-Bench/) GitHub37 (https://github.com/SpatiaOS/P3D-Bench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.11152)
在您的代理中获取此论文:
hf papers read 2606.11152
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2606.11152 即可从此页面链接。
引用此论文的数据集1
SpatiaOS/P3D-Bench 查看器 • 3天前更新 • 1.4k • 156 (https://huggingface.co/datasets/SpatiaOS/P3D-Bench)
引用此论文的Space0
没有Space链接到此论文
在Space README.md中引用 arxiv.org/abs/2606.11152 即可从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准
本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。
BilliardPhys-Bench: 多模态大语言模型的物理推理与视觉动态基准测试
BilliardPhys-Bench 是一个新的基准测试,通过合成台球场景来评估多模态大语言模型的物理推理能力,要求预测碰撞和最终球的位置。论文发现,当前模型在较长的模拟中表现不佳,并表现出一种“静态偏差”——在不确定时预测无交互。
PolyBridgeBench:用于基于物理的桥梁设计的多模态大型语言模型基准测试
PolyBridgeBench是一种新的可执行基准测试,用于评估多模态大型语言模型在基于物理的桥梁设计任务中的表现,揭示了结构合成与修复中确定性有效性与动态成功之间的差距。
3DCodeBench:通过代码对智能体过程化3D建模进行基准测试
本文介绍了3DCodeBench——一个用于评估视觉语言模型通过代码进行过程化3D建模的基准测试,以及3DCodeArena——一个基于成对人类偏好的排名平台。
超越API:探究MLLMs在物理工具使用中的极限
本文介绍了PhysTool-Bench,一个用于评估多模态大语言模型在真实世界场景中识别和规划物理工具使用能力的基准。作者发现,即使是最佳模型也只能识别58.7%的工具,并仅完成21.0%的端到端查询,揭示了感知和功能常识两个层面的缺陷。