VibeWorlding:多模态智能体能否端到端构建3D开放世界?
摘要
本文提出了VibeWorlding,一个用于基准测试和训练多模态智能体的框架,使其能够从用户查询构建3D开放世界,并展示了强化学习如何提升开源模型以与闭源前沿模型竞争。
查看缓存全文
缓存时间: 2026/08/18 03:53
论文页面 - VibeWorlding:多模态智能体能否端到端构建3D开放世界?
来源:https://huggingface.co/papers/2608.15265
摘要
一个统一框架用于评测和训练多模态智能体,这些智能体能够推断用户意图、规划3D场景、调用工具并基于反馈进行反思。研究发现,强化学习能使开源模型性能超越闭源前沿模型。
根据用户查询构建一个交互式3D开放世界至关重要。然而,现有方法主要在理想化的简单查询上进行评估,难以系统分析和比较多模态智能体(https://huggingface.co/papers?q=multimodal%20agents)如何理解用户意图、使用3D工具以及推理文本与视觉3D世界信息。为此,我们提出了VibeWorlding(https://huggingface.co/papers?q=VibeWorlding),一个用于评测和训练“氛围世界构建智能体”的统一框架:这种多模态智能体能够在多轮智能体-环境交互过程中,自主推断用户意图、规划场景布局、调用3D工具,并基于多模态反馈进行反思。为实现此目标,我们首先构建了VWE-BENCH(https://huggingface.co/papers?q=VWE-BENCH),一个包含2,616个高质量3D资产、323个人工标注的种子3D世界以及6,828个逆合成的多模态用户查询的基准测试集,分为带有标准答案的已验证查询和带有精心设计评分标准的未验证查询。此外,我们开发了VibeWorlding(https://huggingface.co/papers?q=VibeWorlding)-Gym,一个联合多模态强化学习(https://huggingface.co/papers?q=multimodal%20RL)后训练框架,该框架集成了(1)一个沙箱环境,将资产检索、编辑和图像渲染统一为MCP工具(https://huggingface.co/papers?q=MCP%20tools),以及(2)一个基于评分标准的验证器(https://huggingface.co/papers?q=rubric-based%20verifier),它结合了物理可行性和意图满足度验证,支持公平的模型评估和可扩展的多模态强化学习(https://huggingface.co/papers?q=multimodal%20RL)奖励服务。我们的实验表明,当前的前沿多模态大语言模型(https://huggingface.co/papers?q=MLLMs)远未解决氛围世界构建智能体任务,即使是GPT-5.5和Qwen3.8-Max的成功率也低于60%,并将瓶颈追溯到精确的3D世界编辑。我们进一步发现,强化学习训练可以缓解这一弱点,并使开源多模态大语言模型(https://huggingface.co/papers?q=MLLMs)甚至超越闭源前沿模型:我们的VibeWorlder(https://huggingface.co/papers?q=VibeWorlder)-8B与前沿多模态大语言模型(https://huggingface.co/papers?q=MLLMs)表现相当,而我们的旗舰模型VibeWorlder(https://huggingface.co/papers?q=VibeWorlder)-30B-A3B在所有评估模型中取得了最佳的总体Pass@1成绩。
查看arXiv页面(https://arxiv.org/abs/2608.15265)查看PDF(https://arxiv.org/pdf/2608.15265)项目页面(https://huggingface.co/collections/usail-hkust/vibeworlder)GitHub24(https://github.com/usail-hkust/VibeWorlding-Gym)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.15265)
引用此论文的模型0
暂无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.15265即可从本页链接。
引用此论文的数据集0
暂无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.15265即可从本页链接。
引用此论文的Spaces0
暂无Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.15265即可从本页链接。
包含此论文的收藏1
相似文章
无限世界与多样交互
本文介绍了LingBot-World 2.0,一个先进的世界建模系统,具有无界交互范围、实时720p 60fps视频生成、多样化的交互元素(例如攻击、施法),以及通过领航员和导演智能体实现的新型多智能体行为控制,还附带一个共享的多玩家界面。
SpatialWorld: 多模态智能体在真实世界任务中的交互式空间推理基准测试
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。
用想象力思考:基于世界模拟器的主动式视觉空间推理
本文提出了Astra,一个主动式空间推理框架,将经过强化学习训练的VLM策略与一个世界模拟器结合起来,生成新视角的观察结果,以改进视觉语言模型中的空间推理能力。
MultiWorld:可扩展的多智能体多视角视频世界模型
MultiWorld 是一个统一的多智能体多视角视频世界建模框架,通过多智能体条件模块与全局状态编码器,在精准控制多智能体行为的同时保持多视角一致性。
MineExplorer:在《我的世界》中评估多模态大语言模型代理的开放世界探索能力
MineExplorer基准测试通过多智能体合成设计的原子任务和多跳任务,评估了多模态大语言模型代理在《我的世界》中的开放世界探索能力。实验表明,开放世界探索仍具挑战性,强模型在长轨迹中性能急剧下降。