MAGIC:基于大语言模型的可导航多场景游戏世界的过渡感知生成
摘要
MAGIC是一个系统,利用大语言模型从单个自然语言提示生成相互连接且可导航的多场景游戏世界,解决了跨场景一致性、场景内可导航性及过渡评估问题。在包含100个多场景案例的基准测试中,该系统实现了高精确率和召回率。
查看缓存全文
缓存时间: 2026/07/16 01:40
论文页面 - MAGIC:利用大语言模型生成可导航多场景游戏世界的过渡感知方法
来源:https://huggingface.co/papers/2607.11594
摘要
多场景导航(在单个有限空间内完成清理目标,然后通过传送门进入下一个场景)是当代3D游戏的一个标志性特征,但手动创作这一过程十分繁重:每个传送门两侧必须有一致的端点,每个内部空间在布置家具后仍需保持可导航性,且最终的空间连通性必须在多个文件中保持一致。近期的大语言模型(LLM)和多模态大语言模型(MLLM)场景生成器已显著降低了单个内部空间合成的成本,但它们一次仅生成一个场景,且无法通过简单的重复来构建一个连通的多场景世界。我们识别出单场景方法未能解决的三个障碍:跨场景一致性、场景内可导航性,以及评估过渡是否实际有效。我们提出了MAGIC,一个从提示到项目的系统,解决了这三个问题。MAGIC是一个四阶段流水线,将单个自然语言提示转化为可运行的多场景游戏项目:它规划一个共享的、过渡感知的中间表示,指定每个场景,同时通过洪水填充验证器强制执行传送门可达性,生成场景及其过渡脚本,并将它们组合成一个项目。由于现有的单场景保真度指标从未实际执行过渡,我们进一步引入了一个以过渡为中心的评估智能体,在游戏过程中运行每个过渡。在一个包含100个多场景案例的新基准测试上,MAGIC为每个案例生成了可执行项目,并在端到端过渡识别上达到了0.99的精确率、0.95的召回率和0.96的F1分数;按阶段来看,与LLM基线和Holodeck相比,它恢复了更多的真实传送门,并产生了明显更可导航的布局。我们的代码可在 https://github.com/sereneee1201/MAGIC/ 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2607.11594) 查看 PDF (https://arxiv.org/pdf/2607.11594) 项目页面 (https://github.com/sereneee1201/MAGIC/) GitHub0 (https://github.com/sereneee1201/MAGIC) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11594)
在你的智能体中获取此论文:
hf papers read 2607.11594
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在你的模型 README.md 中引用 arxiv.org/abs/2607.11594 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在你的数据集 README.md 中引用 arxiv.org/abs/2607.11594 以从此页面链接。
引用此论文的 Space0
没有 Space 链接此论文
在你的 Space README.md 中引用 arxiv.org/abs/2607.11594 以从此页面链接。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
超越当前观察:在可控非马尔可夫游戏中评估多模态大语言模型
本文介绍了RNG-Bench,一个基准测试套件,用于评估多模态基础模型在多步交互中重建过去观察并利用它们进行决策的能力。该套件包含两个游戏(Matching Pairs和3D Maze),具有可控难度参数和一个记忆差距指标,用于区分遗忘与糟糕的决策。
SceneMosaic:通过混合代理布局演化实现高效多样的仿真就绪场景生成
SceneMosaic结合了学习的图像先验与视觉语言代理,高效生成多样且物理有效的室内场景,相较于现有方法实现了24倍加速和物理有效性的提升。
为何通用人工智能需要世界模型:大型语言模型的不足与世界模型的潜在优势
本文认为,大型语言模型在因果推理和长时域规划方面存在困难,其原因在于序列预测与对潜在环境动态的推理之间存在目标层面的不匹配,并引入了潜在动态推断视角以及Flux环境来研究这些局限性。
Genie 3:世界模型的新前沿
DeepMind 发布 Genie 3,一个通用世界模型,能够从文本提示生成交互式环境,分辨率达 720p、帧率 24fps,相比前代版本具有更好的一致性和实时交互能力。
SmartMage:面向3D场景理解的动态模态编排
SmartMage 是一个统一的多模态大语言模型(LLM),它针对查询相关的3D场景理解动态编排视觉与几何模态,在五个基准上取得了最先进的结果。