MAGIC:基于大语言模型的可导航多场景游戏世界的过渡感知生成

Hugging Face Daily Papers 论文

摘要

MAGIC是一个系统,利用大语言模型从单个自然语言提示生成相互连接且可导航的多场景游戏世界,解决了跨场景一致性、场景内可导航性及过渡评估问题。在包含100个多场景案例的基准测试中,该系统实现了高精确率和召回率。

多场景导航(在一个有限空间内完成目标,然后通过传送门进入下一个空间)是现代3D游戏的一个标志性特征,但制作过程非常繁琐:每个传送门的两端必须一致,每个内部空间在布置后仍需保持可导航性,且最终的连接关系必须在多个文件中保持一致。近年来,大语言模型(LLM)和多模态大语言模型(MLLM)场景生成器显著降低了单一室内场景的合成成本,但它们一次只能生成一个场景,无法通过简单重复来构建相互连接的多场景世界。我们发现单场景方法遗留了三个未解决的问题:跨场景一致性、场景内可导航性,以及过渡是否实际有效的评估。我们提出了MAGIC,一个从提示到项目的系统,同时解决了这三个问题。MAGIC是一个四阶段流水线,将单个自然语言提示转化为可运行的多场景游戏项目:首先规划一个共享的过渡感知中间表示,然后通过泛洪填充验证器确保传送门可达性的方式指定每个场景,接着生成场景及其过渡脚本,最后将它们整合为一个项目。由于现有的单场景保真度指标从未实际执行过过渡,我们进一步引入了一个以过渡为中心的评估代理,在游戏中运行每个过渡。在一个新的包含100个多场景案例的基准测试中,MAGIC为每个案例生成了可执行项目,在端到端过渡识别上达到了0.99的精确率、0.95的召回率和0.96的F1分数;与LLM基线方法和Holodeck相比,它在各个阶段恢复了更多的真实传送门,并生成了明显更可导航的布局。我们的代码开源于 https://github.com/sereneee1201/MAGIC/。
查看原文
查看缓存全文

缓存时间: 2026/07/16 01:40

论文页面 - MAGIC:利用大语言模型生成可导航多场景游戏世界的过渡感知方法

来源:https://huggingface.co/papers/2607.11594

摘要

多场景导航(在单个有限空间内完成清理目标,然后通过传送门进入下一个场景)是当代3D游戏的一个标志性特征,但手动创作这一过程十分繁重:每个传送门两侧必须有一致的端点,每个内部空间在布置家具后仍需保持可导航性,且最终的空间连通性必须在多个文件中保持一致。近期的大语言模型(LLM)和多模态大语言模型(MLLM)场景生成器已显著降低了单个内部空间合成的成本,但它们一次仅生成一个场景,且无法通过简单的重复来构建一个连通的多场景世界。我们识别出单场景方法未能解决的三个障碍:跨场景一致性、场景内可导航性,以及评估过渡是否实际有效。我们提出了MAGIC,一个从提示到项目的系统,解决了这三个问题。MAGIC是一个四阶段流水线,将单个自然语言提示转化为可运行的多场景游戏项目:它规划一个共享的、过渡感知的中间表示,指定每个场景,同时通过洪水填充验证器强制执行传送门可达性,生成场景及其过渡脚本,并将它们组合成一个项目。由于现有的单场景保真度指标从未实际执行过渡,我们进一步引入了一个以过渡为中心的评估智能体,在游戏过程中运行每个过渡。在一个包含100个多场景案例的新基准测试上,MAGIC为每个案例生成了可执行项目,并在端到端过渡识别上达到了0.99的精确率、0.95的召回率和0.96的F1分数;按阶段来看,与LLM基线和Holodeck相比,它恢复了更多的真实传送门,并产生了明显更可导航的布局。我们的代码可在 https://github.com/sereneee1201/MAGIC/ 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2607.11594) 查看 PDF (https://arxiv.org/pdf/2607.11594) 项目页面 (https://github.com/sereneee1201/MAGIC/) GitHub0 (https://github.com/sereneee1201/MAGIC) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11594)

在你的智能体中获取此论文:

hf papers read 2607.11594

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在你的模型 README.md 中引用 arxiv.org/abs/2607.11594 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在你的数据集 README.md 中引用 arxiv.org/abs/2607.11594 以从此页面链接。

引用此论文的 Space0

没有 Space 链接此论文

在你的 Space README.md 中引用 arxiv.org/abs/2607.11594 以从此页面链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

超越当前观察:在可控非马尔可夫游戏中评估多模态大语言模型

Hugging Face Daily Papers

本文介绍了RNG-Bench,一个基准测试套件,用于评估多模态基础模型在多步交互中重建过去观察并利用它们进行决策的能力。该套件包含两个游戏(Matching Pairs和3D Maze),具有可控难度参数和一个记忆差距指标,用于区分遗忘与糟糕的决策。

Genie 3:世界模型的新前沿

Google DeepMind Blog

DeepMind 发布 Genie 3,一个通用世界模型,能够从文本提示生成交互式环境,分辨率达 720p、帧率 24fps,相比前代版本具有更好的一致性和实时交互能力。

SmartMage:面向3D场景理解的动态模态编排

Hugging Face Daily Papers

SmartMage 是一个统一的多模态大语言模型(LLM),它针对查询相关的3D场景理解动态编排视觉与几何模态,在五个基准上取得了最先进的结果。