world-model

标签

Cards List
#world-model

DreamGuard:基于风险感知世界模型的高效LLM智能体运行时护栏

arXiv cs.AI · 2天前 缓存

DreamGuard是一种面向LLM智能体的主动式运行时护栏,利用风险感知世界模型跟踪潜在状态并预测未来风险,从而在不安全动作执行前进行干预。它在基准测试和在线评估中优于基线,延迟为25毫秒。

0 人收藏 0 人点赞
#world-model

EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Hugging Face Daily Papers · 3天前 缓存

EnvACE 引入了世界预演,一种智能体强化学习方法,通过策略在内部预演环境响应来取代外部环境交互,在多个基准上取得了强劲性能。

0 人收藏 0 人点赞
#world-model

UniNav:用于视觉导航的统一世界-动作扩散模型

arXiv cs.AI · 4天前 缓存

UniNav是一个统一的世界-动作扩散模型,用于图像目标视觉导航。它在单个扩散过程中联合预测未来的视觉观察和航点轨迹,以高效推理实现了强大的基准测试结果。

0 人收藏 0 人点赞
#world-model

WCM:一种用于视觉-语言-行动强化学习的世界评论模型

Hugging Face Daily Papers · 2026-07-31 缓存

介绍了WCM,一种世界评论模型,它联合预测未来的潜在状态并估计价值,以改进视觉-语言-行动强化学习的时间建模,在多个机器人操作基准上取得了最先进的结果。

0 人收藏 0 人点赞
#world-model

ODEWorld:通过物理时间流的连续预测架构

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了 ODEWorld,一种使用物理时间流(PT-Flow)的连续时间潜在世界模型,该模型学习由常微分方程参数化的潜在速度场,能够实现任意时间分辨率、回溯预测,并改进视频生成和机器人控制的规划。

0 人收藏 0 人点赞
#world-model

PhiZero:一个围绕物理语言构建的世界模型

Hugging Face Daily Papers · 2026-07-30 缓存

PhiZero是一个物理世界模型,它从视频中学习一种称为“物理语言”的紧凑离散表示,并在渲染未来视频之前用它来推理世界状态的转换,从而在生成和理解任务中提高物理一致性。

0 人收藏 0 人点赞
#world-model

世界模型与空间智能时代:超越语言的AI治理

Reddit r/ArtificialInteligence · 2026-07-29 缓存

斯坦福HAI探讨了AI中世界模型和空间智能的兴起,呼吁建立治理框架以应对超越语言处理的能力。

0 人收藏 0 人点赞
#world-model

@svpino: 新的 WorldDiT 机器人模型非常棒:它非常小(<1B 参数),却能同时进行预测和控制…

X AI KOLs Timeline · 2026-07-28 缓存

WorldDiT 是一个新型的小型(<1B 参数)机器人模型,统一了世界预测与控制,在 LIBERO 基准测试中取得顶级性能,无需 VLM。

0 人收藏 0 人点赞
#world-model

@iScienceLuvr: Music-JEPA: 从动作中学习声音的世界模型 "我们提出使用JEPA学习钢琴声音的世界模型,通过…"

X AI KOLs Following · 2026-07-27 缓存

本文提出Music-JEPA,这是一个世界模型,通过将音频视为状态、钢琴卷帘视为动作来学习钢琴声音表示。它捕捉动作与声音之间的关系,并支持如节拍跟踪和通过规划进行钢琴转录等下游任务。

0 人收藏 0 人点赞
#world-model

N_0-TWAM:面向接触丰富操作的触觉原生世界-动作模型规模化

Hugging Face Daily Papers · 2026-07-26 缓存

N₀-TWAM 是一个面向接触丰富操作的触觉原生世界-动作模型,基于来自 6 个具身和 450 个任务的视触觉数据进行了规模化训练。作者公开了代码和预训练检查点,将其定位为首个规模化训练的触觉世界-动作模型。

0 人收藏 0 人点赞
#world-model

@mattshumer_: Opus 5 实现了我正在为@AlphaSchool原型设计的这个疯狂的新实时AI导师概念。它驱动底层的聊天+方向,……

X AI KOLs Timeline · 2026-07-24 缓存

Opus 5 为AlphaSchool的实时AI导师原型提供动力,结合了聊天、方向以及一个自定义小型世界模型(类似),用于实时渲染和交互性。

0 人收藏 0 人点赞
#world-model

Flux 3 X Mimic:新一代视频-动作模型

Hacker News Top · 2026-07-24 缓存

Black Forest Labs 宣布推出 FLUX 3,这是一个多模态基础模型,可联合生成视听内容,并通过与 mimic robotics 的合作,实现用于机器人控制的视频-动作预测,已在奥迪进行测试。

0 人收藏 0 人点赞
#world-model

带有世界状态寄存器的流式多智能体自回归扩散模型

Hugging Face Daily Papers · 2026-07-23 缓存

WorldWeaver (W²) 将跨智能体世界状态寄存器引入多智能体视频扩散模型,实现跨智能体和视图的共享世界状态持久化,提升了双智能体 Minecraft 视频生成的逻辑一致性。

0 人收藏 0 人点赞
#world-model

AlayaWorld 是一个全栈、开源的视频世界模型,支持720p、24帧/秒的流式视频生成,并具备相机控制功能。

Reddit r/singularity · 2026-07-22

AlayaWorld 是一个全栈、开源的视频世界模型,能够生成720p、24帧/秒的流式视频,支持相机控制,实现动态场景创建。

0 人收藏 0 人点赞
#world-model

以游戏速度运行的生成式世界渲染器

Hugging Face Daily Papers · 2026-07-21 缓存

本文介绍了 AlayaRenderer-Flash,这是一种实时生成式世界渲染器,通过使用少步自回归流式模型和轻量级蒸馏编解码器,将渲染速度从 0.56 FPS 提升到 31.54 FPS,实现了与物理引擎的交互式游玩。

0 人收藏 0 人点赞
#world-model

介绍 Cosmos 3 Edge

Hugging Face Blog · 2026-07-20 缓存

NVIDIA 发布了 Cosmos 3 Edge,一个40亿参数的开源世界模型,专为边缘设备设计,帮助机器人和视觉AI代理理解周围环境、实时推理并生成动作。它在同类模型中实现了领先的吞吐量和准确度。

0 人收藏 0 人点赞
#world-model

DSWorld:面向高效自主代理的数据科学世界模型

arXiv cs.AI · 2026-07-20 缓存

DSWorld 提出了一种数据科学世界模型,通过预测环境状态转换来减少自主代理中代价高昂的试错过程,在强化学习训练中实现了14倍加速,推理时加速3-6倍,同时保持了有竞争力的性能。

0 人收藏 0 人点赞
#world-model

SeerGuard:基于世界模型预测的移动GUI代理安全框架

arXiv cs.AI · 2026-07-20 缓存

介绍了SeerGuard,一个针对移动GUI代理的后果感知安全框架,该框架使用安全增强的世界模型在执行前评估风险,提高了安全-效用分数。

0 人收藏 0 人点赞
#world-model

Neural Drive:一个在浏览器中运行的 SuperTuxKart 世界模型

Reddit r/LocalLLaMA · 2026-07-20 缓存

Neural Drive 是一个基于动作条件的世界模型,专为 SuperTuxKart 设计,完全通过 WebGPU 在浏览器中运行,无需游戏引擎即可根据过去的帧和控制器输入预测游戏帧。

0 人收藏 0 人点赞
#world-model

EvolvingWorld:一种用于互动文学世界中角色扮演智能体与世界模型共同演化的开放模式框架

Hugging Face Daily Papers · 2026-07-19 缓存

介绍EvolvingWorld,这是一个用于互动文学世界中角色扮演智能体与世界模型共同演化的开放模式框架与基准,支持具有持久角色和世界状态更新的长时程模拟。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈