标签
JEPA-Anything 提出了一种基于正交预测因子分解的领域无关框架,用于跨视觉、生物学和控制等多种系统学习预测模型,并展示了改进效果和实验验证。
AlayaVista 是一种可控摄像头的流式视频世界模型,它将全景场景演化与透视视频合成解耦,并通过大规模的 MUGEN 数据集支持高保真交互式世界建模。
WMLLM是一个自我进化优化代理框架,使用大语言模型的预测-然后行动世界建模来提高黑盒优化中的样本效率,在多目标分子优化中实现了最先进的结果。
Fable 5.1 是一款由 AI 智能体驱动的工具,能够利用开放数据生成真实场所的浏览器原生 3D 重建模型。该系统以旧金山联合广场的精细模型进行了演示。
ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。
本文提出了一种以智能体为中心的世界建模范式,引入了“智能体中心交互式世界代理”,并将其组织为六种功能形式,跨越智能体改进的三个递进层次,为构建能够赋能智能体规划、学习与进化的世界代理提供了路线图。
本文介绍了心智世界建模(MWM),这是一个将隐藏的心理状态作为世界模型核心组件的框架,并提出了MENTIS,一个无需训练的基线。基于8个LLM世界模型的实验表明,显式的心智状态建模对于预测情境化场景中的人类决策至关重要。
WorldDiT是一个用于机器人世界建模与控制的统一架构,在不依赖VLM生成动作的方法中,它在LIBERO基准测试上取得了最佳性能,并位于所报告的帕累托前沿上。
WorldDiT是一种统一的扩散变换器架构,它将动作生成与视觉世界建模相结合,在LIBERO仿真套件上取得了强劲性能,且无需依赖大型预训练视觉语言模型。
解释了SIGReg,一种针对JEPA的新型正则化器,通过迫使嵌入遵循各向同性高斯分布来防止表征坍缩,具有理论保证和简洁的训练循环。
介绍了Masked Visual Actions,一种像素空间控制接口,将动作表示为部分揭示的轨迹,使得单个模型能够充当前向动力学模型、恢复机器人行为,并仅用15小时的训练数据支持基于模型的规划和逆向建模。
AlayaWorld是一个150亿参数的交互式视频世界模型,可生成24帧/秒的540p和720p视频,采用自回归潜变量块生成、受限视觉上下文以及蒸馏技术来减少推理步骤。它在长视界生成基准iWorld-Bench上达到了最先进的性能。
本文介绍了LingBot-World 2.0,一个先进的世界建模系统,具有无界交互范围、实时720p 60fps视频生成、多样化的交互元素(例如攻击、施法),以及通过领航员和导演智能体实现的新型多智能体行为控制,还附带一个共享的多玩家界面。
OPINE-World 引入了一个 LLM 智能体,通过交互在线学习以对象为中心的程序化世界模型,采用本体错误优先的探索和协作的假设-测试智能体,在 ARC-AGI-3 上取得了强劲的结果。
本文介绍了A2World,一种基于扩散的世界模型,在大规模机器人操作数据上预训练,以学习可迁移的动态先验。该模型可适配为真实世界模拟器(A2World-sim)用于策略评估,或视频-动作联合预测模型(A2World-policy)用于动作预测,展示了在模拟器中心和策略中心的机器人学习中的优势。
本文提出了一种名为“智能体自主世界建模”(AAWM)的训练流程,该流程基于策略自身的决策需求构建世界模型监督,而非依赖下一观测预测,从而使学习目标与有效决策所需的动态特性对齐。
MemoBench是一个诊断基准,用于评估视频生成模型在动态变化环境中的记忆一致性,其中物体消失并以更新后的状态重新出现。它包括360个真实视频片段和一个结合自动指标与基于VQA评估的测试套件,揭示了记忆一致性挑战的洞见。
本文介绍了上下文世界建模(ICWM),这是一个使机器人策略能够从自身生成的交互中推断系统变量的框架,通过将系统识别视为一个上下文自适应问题,无需参数更新即可适应新的配置。在模拟和真实世界实验中,它在处理新的相机视角时优于标准的VLA基线。
Anthropic证明,AI系统现在能够进行世界建模,Fable对峙实验即是证据。