VibeWorlding:多模态智能体能否端到端构建3D开放世界?

Hugging Face Daily Papers 论文

摘要

本文提出了VibeWorlding,一个用于基准测试和训练多模态智能体的框架,使其能够从用户查询构建3D开放世界,并展示了强化学习如何提升开源模型以与闭源前沿模型竞争。

从用户查询构建交互式3D开放世界很重要。然而,现有方法主要在理想化的简单查询上评估,难以系统地分析和比较多模态智能体如何理解用户意图、使用3D工具,以及推理文本和视觉的3D世界信息。为此,我们提出了VibeWorlding,一个统一的基准测试和训练VibeWorlding智能体的框架:一种能够自主推断用户意图、规划场景布局、调用3D工具,并在多轮智能体-环境交互过程中反思多模态反馈的多模态智能体。为实现这一目标,我们首先构建了VWE-BENCH,一个包含2,616个高质量3D资产、323个由人类标注的种子3D世界和6,828个逆向合成的多模态用户查询的基准,分为具有真实标签的已验证查询和具有精心设计评分标准的未验证查询。此外,我们开发了VibeWorlding-Gym,一个联合多模态强化学习后训练框架,集成了(1)一个沙箱环境,将资产检索、编辑和图像渲染统一为MCP工具,以及(2)一个基于评分标准的验证器,结合物理可行性和意图满足度验证,支持公平的模型评估和可扩展的多模态强化学习奖励服务。我们的实验表明,当前前沿的多模态大型语言模型远未解决VibeWorlding智能体任务,即使是GPT-5.5和Qwen3.8-Max的成功率也低于60%,并将瓶颈归因于精确的3D世界编辑。我们进一步发现,强化学习训练可以缓解这一弱点,并使开源多模态大型语言模型甚至超越闭源前沿模型:我们的VibeWorlder-8B与前沿多模态大型语言模型相当,而我们的旗舰模型VibeWorlder-30B-A3B在所有评估模型中获得了最佳的整体Pass@1。
查看原文
查看缓存全文

缓存时间: 2026/08/18 03:53

论文页面 - VibeWorlding:多模态智能体能否端到端构建3D开放世界?

来源:https://huggingface.co/papers/2608.15265

摘要

一个统一框架用于评测和训练多模态智能体,这些智能体能够推断用户意图、规划3D场景、调用工具并基于反馈进行反思。研究发现,强化学习能使开源模型性能超越闭源前沿模型。

根据用户查询构建一个交互式3D开放世界至关重要。然而,现有方法主要在理想化的简单查询上进行评估,难以系统分析和比较多模态智能体(https://huggingface.co/papers?q=multimodal%20agents)如何理解用户意图、使用3D工具以及推理文本与视觉3D世界信息。为此,我们提出了VibeWorlding(https://huggingface.co/papers?q=VibeWorlding),一个用于评测和训练“氛围世界构建智能体”的统一框架:这种多模态智能体能够在多轮智能体-环境交互过程中,自主推断用户意图、规划场景布局、调用3D工具,并基于多模态反馈进行反思。为实现此目标,我们首先构建了VWE-BENCH(https://huggingface.co/papers?q=VWE-BENCH),一个包含2,616个高质量3D资产、323个人工标注的种子3D世界以及6,828个逆合成的多模态用户查询的基准测试集,分为带有标准答案的已验证查询和带有精心设计评分标准的未验证查询。此外,我们开发了VibeWorlding(https://huggingface.co/papers?q=VibeWorlding)-Gym,一个联合多模态强化学习(https://huggingface.co/papers?q=multimodal%20RL)后训练框架,该框架集成了(1)一个沙箱环境,将资产检索、编辑和图像渲染统一为MCP工具(https://huggingface.co/papers?q=MCP%20tools),以及(2)一个基于评分标准的验证器(https://huggingface.co/papers?q=rubric-based%20verifier),它结合了物理可行性和意图满足度验证,支持公平的模型评估和可扩展的多模态强化学习(https://huggingface.co/papers?q=multimodal%20RL)奖励服务。我们的实验表明,当前的前沿多模态大语言模型(https://huggingface.co/papers?q=MLLMs)远未解决氛围世界构建智能体任务,即使是GPT-5.5和Qwen3.8-Max的成功率也低于60%,并将瓶颈追溯到精确的3D世界编辑。我们进一步发现,强化学习训练可以缓解这一弱点,并使开源多模态大语言模型(https://huggingface.co/papers?q=MLLMs)甚至超越闭源前沿模型:我们的VibeWorlder(https://huggingface.co/papers?q=VibeWorlder)-8B与前沿多模态大语言模型(https://huggingface.co/papers?q=MLLMs)表现相当,而我们的旗舰模型VibeWorlder(https://huggingface.co/papers?q=VibeWorlder)-30B-A3B在所有评估模型中取得了最佳的总体Pass@1成绩。

查看arXiv页面(https://arxiv.org/abs/2608.15265)查看PDF(https://arxiv.org/pdf/2608.15265)项目页面(https://huggingface.co/collections/usail-hkust/vibeworlder)GitHub24(https://github.com/usail-hkust/VibeWorlding-Gym)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.15265)

引用此论文的模型0

暂无模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.15265即可从本页链接。

引用此论文的数据集0

暂无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.15265即可从本页链接。

引用此论文的Spaces0

暂无Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.15265即可从本页链接。

包含此论文的收藏1

相似文章

无限世界与多样交互

Hugging Face Daily Papers

本文介绍了LingBot-World 2.0,一个先进的世界建模系统,具有无界交互范围、实时720p 60fps视频生成、多样化的交互元素(例如攻击、施法),以及通过领航员和导演智能体实现的新型多智能体行为控制,还附带一个共享的多玩家界面。