标签
本文介绍了THAW-VLA,一种将世界模型表示蒸馏到视觉-语言-动作模型中的方法,用于机器人学,增强了在模拟和真实硬件上的鲁棒性和性能,而不会增加推理开销。
WorldCrafter是一个视频世界模型,它学习一个可相机查询的隐式3D感知记忆,用于从单张图像或文本提示进行一致且相机可控的流式场景探索。
本文介绍了持续企业世界模型发现,其中智能体在动态系统中学习并适应不断变化的业务规则,使用EnterpriseWorldShift基准进行评估,并展示了比先前方法更高的预测准确性。
这篇文章总结了与Anthropic可解释性研究员Emmanuel Ameisen的现场对话,讨论了大型语言模型如何通过下一个词预测发展出复杂的世界模型,以及这对理解人类认知的影响。
Odyssey-3 是一个通用世界模型,它使物理代理能够以最少的任务特定数据控制多样化的系统,如机器人、车辆和无人机,展示了广泛的迁移学习能力。
本文提出了Homeostatic Continual Learning,一种使AI代理在变化环境中持续学习而不发生灾难性遗忘的方法,通过检测离群点并逐步扩展世界模型来实现。
本文介绍了Zing-0.5,一个50亿参数的自回归世界模型,用于生成可通过键盘和文本控制实时交互的可玩世界。它在导航任务中表现出高性能,并展示了以24 FPS进行低成本实时推理的能力。
An open field log designed for AI agents to track, sketch, and analyze their interactions with the world, focusing on transparency and authentic reasoning.
本文介绍了一种分叉账本协议,用于衡量持续适应中世界模型更新的反事实效用,表明总是应用更新会降低CartPole和Walker等控制任务的性能。
介绍了ARC-Bench作为基准,用于审计冻结的JEPA风格世界模型是否正确基于潜在距离对候选动作进行排序,揭示了官方检查点中严重且结构性的失败。论文解释说,闭环重规划掩盖了这些缺陷,导致成功率被高估。
Pelican-Sim 1.0是一款面向具身智能的通用世界模型模拟器,能够从视觉上下文和机器人动作中预测未来观测结果,并通过关键设计提升跨多样具身体和任务的可控性与视频质量。
LTX-2.5是一款支持本地部署、具备微调功能,并改进了生成功能和编辑功能的开源视频模型,强调构建者对AI技术栈的所有权。
Xiaomi Robotics 在 Hugging Face 上发布了一款紧凑的具身世界模型,包括 4B 版本和序列变体,采用 Apache 2.0 许可证。
在ECCV 2026的AI City挑战赛中,展示了开发稳健视觉AI系统的获胜者,其中顶级解决方案在视频预测中使用NVIDIA Cosmos世界基础模型,用于场景理解和预测等任务。
本文介绍了AI创业者Danijar Hafner正在研发的智能体,这类智能体能够借助世界模型提前规划,从而在陌生环境中顺利导航。
ByteDance正在开发一个实时空间视频模型,由创始人张一鸣监督,旨在为XR应用生成交互式虚拟世界,并可能很快推出。
UnifoLM-X2-1.0 是一种世界模型,能够实现人形机器人的实时自主格斗,突破规划与决策中的瓶颈,并验证了大规模部署的可行性。
HappyOyster AI 为其 world model 推出了 Adventure Mode,模拟一场从2060年回望地球开始的穿越宇宙的旅程。
Runway 发布了 GWM Worlds 2,这是一个可实时操控的交互式世界模型,支持 720p/24fps 视频和 48kHz 音频的实时生成,允许用户通过文本动作控制环境并接入智能体执行任务。
介绍了信念校准优化(BCO),这是一种通过显式跟踪和修正对编辑环境响应的信念来维护持久世界模型以提高LLM智能体性能的方法。