SceneMosaic:通过混合代理布局演化实现高效多样的仿真就绪场景生成

Hugging Face Daily Papers 论文

摘要

SceneMosaic结合了学习的图像先验与视觉语言代理,高效生成多样且物理有效的室内场景,相较于现有方法实现了24倍加速和物理有效性的提升。

多样且仿真就绪的室内场景对于交互娱乐和具身AI至关重要,但其可扩展的生成仍然面临挑战。近期依赖于视觉语言模型(VLMs)的基于代理的文本到3D场景管道能够生成高保真度的场景,但需要昂贵的迭代物体放置和细化。另一个主流范式,参数化图像到3D场景模型,通过从2D图像学习到的强先验高效生成场景,但往往导致不精确和物理无效的场景。更重要的是,这两种范式都难以对单一输入生成多样化的场景,因此难以反映真实场景动态变化的本质。在本文中,我们提出了SceneMosaic,一个结合了两种范式优点的框架。它从学习的基于图像的先验中获取初始候选,然后通过VLM代理演化结果,确保效率和物理有效性。在演化过程中,SceneMosaic利用自然场景的局部性,将场景分解为独立的局部单元,允许在每个单元内独立演化,然后通过笛卡尔积组合成全局场景。在SceneEval-100上,SceneMosaic在语义布局质量上与最强的代理基线相匹配,同时实现了24倍加速,大幅减少了物理违规,并获得了最高的人工评分。我们的代码在https://github.com/rxjfighting/SceneMosaic公开可用。
查看原文
查看缓存全文

缓存时间: 2026/09/09 04:30

论文页面 - SceneMosaic:基于混合智能体布局演化的高效多样化仿真就绪场景生成

来源:https://huggingface.co/papers/2609.05594

摘要

SceneMosaic 结合学习到的图像先验与视觉语言智能体,通过演化局部单元并进行全局组合,高效生成多样化、物理合理的室内场景。

多样化且仿真就绪的室内场景对于交互式娱乐和具身人工智能至关重要,但其可扩展生成仍具挑战性。近期依赖视觉语言模型 (VLMs) 的智能体文本到3D场景管线可以生成高保真度场景,但需要昂贵的迭代物体放置与精修过程。另一主流范式——参数化图像到3D场景模型,能从二维图像学习到的强先验中高效生成场景,但常导致场景不精确且物理无效。更重要的是,这两种范式都难以从单一输入生成多样化场景,使其难以反映真实场景动态变化的本质。本文提出 SceneMosaic,一个融合两种范式优势的框架。该框架从基于学习的图像先验中获得初始候选,随后通过视觉语言智能体演化结果,兼顾效率与物理有效性。在演化过程中,SceneMosaic 利用自然场景的局部性,将场景分解为独立局部单元,在每个单元内独立演化,再通过笛卡尔积组合成全局场景。在 SceneEval-100 基准测试中,SceneMosaic 在语义布局质量上匹配了最强的智能体基线,同时实现24倍加速,显著减少物理违例,并获得最高的人类评分。我们的代码已公开于 https://github.com/rxjfighting/SceneMosaic。

查看 arXiv 页面 (https://arxiv.org/abs/2609.05594)查看 PDF (https://arxiv.org/pdf/2609.05594)项目页面 (https://rxjfighting.github.io/SceneMosaic/)GitHub13 (https://github.com/rxjfighting/SceneMosaic)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.05594)

在您的智能体中获取此论文:

hf papers read 2609\.05594

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.05594 以从此页面建立链接。

引用此论文的数据集0

暂无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.05594 以从此页面建立链接。

引用此论文的空间0

暂无空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2609.05594 以从此页面建立链接。

包含此论文的收藏0

暂无收藏包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面建立链接。

相似文章

Image2Sim: 通过生成式神经模拟器实现具身导航规模化

Hugging Face Daily Papers

Image2Sim是一个神经模拟框架,它能从RGB-D图像创建高保真交互环境,为具身导航智能体提供可扩展的训练。该框架生成了近20K场景和超过1000万训练样本,在基准测试上展现了显著改进,并实现了有效的真实世界零样本迁移。

先见后码:面向空间感知的教育动画生成中的视觉先验学习

arXiv cs.AI

本文介绍了 OmniManim,一个基于渲染反馈感知的框架,利用大语言模型从自然语言描述生成教育动画。它通过引入显式的视觉规划、渲染后诊断和局部修复来解决元素重叠、对齐错误等视觉缺陷,并在新构建的数据集上展示了改进的渲染质量。