标签
DreamGuard是一种面向LLM智能体的主动式运行时护栏,利用风险感知世界模型跟踪潜在状态并预测未来风险,从而在不安全动作执行前进行干预。它在基准测试和在线评估中优于基线,延迟为25毫秒。
EnvACE 引入了世界预演,一种智能体强化学习方法,通过策略在内部预演环境响应来取代外部环境交互,在多个基准上取得了强劲性能。
UniNav是一个统一的世界-动作扩散模型,用于图像目标视觉导航。它在单个扩散过程中联合预测未来的视觉观察和航点轨迹,以高效推理实现了强大的基准测试结果。
介绍了WCM,一种世界评论模型,它联合预测未来的潜在状态并估计价值,以改进视觉-语言-行动强化学习的时间建模,在多个机器人操作基准上取得了最先进的结果。
本文介绍了 ODEWorld,一种使用物理时间流(PT-Flow)的连续时间潜在世界模型,该模型学习由常微分方程参数化的潜在速度场,能够实现任意时间分辨率、回溯预测,并改进视频生成和机器人控制的规划。
PhiZero是一个物理世界模型,它从视频中学习一种称为“物理语言”的紧凑离散表示,并在渲染未来视频之前用它来推理世界状态的转换,从而在生成和理解任务中提高物理一致性。
WorldDiT 是一个新型的小型(<1B 参数)机器人模型,统一了世界预测与控制,在 LIBERO 基准测试中取得顶级性能,无需 VLM。
本文提出Music-JEPA,这是一个世界模型,通过将音频视为状态、钢琴卷帘视为动作来学习钢琴声音表示。它捕捉动作与声音之间的关系,并支持如节拍跟踪和通过规划进行钢琴转录等下游任务。
N₀-TWAM 是一个面向接触丰富操作的触觉原生世界-动作模型,基于来自 6 个具身和 450 个任务的视触觉数据进行了规模化训练。作者公开了代码和预训练检查点,将其定位为首个规模化训练的触觉世界-动作模型。
Opus 5 为AlphaSchool的实时AI导师原型提供动力,结合了聊天、方向以及一个自定义小型世界模型(类似),用于实时渲染和交互性。
Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,可联合生成视听内容,并通过与 mimic robotics 的合作,实现用于机器人控制的视频-动作预测,已在奥迪进行测试。
WorldWeaver (W²) 将跨智能体世界状态寄存器引入多智能体视频扩散模型,实现跨智能体和视图的共享世界状态持久化,提升了双智能体 Minecraft 视频生成的逻辑一致性。
AlayaWorld 是一个全栈、开源的视频世界模型,能够生成720p、24帧/秒的流式视频,支持相机控制,实现动态场景创建。
本文介绍了 AlayaRenderer-Flash,这是一种实时生成式世界渲染器,通过使用少步自回归流式模型和轻量级蒸馏编解码器,将渲染速度从 0.56 FPS 提升到 31.54 FPS,实现了与物理引擎的交互式游玩。
NVIDIA 发布了 Cosmos 3 Edge,一个40亿参数的开源世界模型,专为边缘设备设计,帮助机器人和视觉AI代理理解周围环境、实时推理并生成动作。它在同类模型中实现了领先的吞吐量和准确度。
DSWorld 提出了一种数据科学世界模型,通过预测环境状态转换来减少自主代理中代价高昂的试错过程,在强化学习训练中实现了14倍加速,推理时加速3-6倍,同时保持了有竞争力的性能。
介绍了SeerGuard,一个针对移动GUI代理的后果感知安全框架,该框架使用安全增强的世界模型在执行前评估风险,提高了安全-效用分数。
Neural Drive 是一个基于动作条件的世界模型,专为 SuperTuxKart 设计,完全通过 WebGPU 在浏览器中运行,无需游戏引擎即可根据过去的帧和控制器输入预测游戏帧。
介绍EvolvingWorld,这是一个用于互动文学世界中角色扮演智能体与世界模型共同演化的开放模式框架与基准,支持具有持久角色和世界状态更新的长时程模拟。