标签
NVIDIA Research 推出 Hydra-0,一个基于动作流条件的世界模型,将机器人动作表示为像素运动,实现了跨多种体现的学习,显著降低错误并具备零样本能力。
Nvidia的研究表明,围绕AI模型设计精良的系统,而非模型本身,能显著提升长期任务的表现,其中Claude Opus 5在ARC-AGI-3基准测试中获得了满分。
NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。
这篇来自NVIDIA Research的博客讨论了序列并行化如何扩展长视频训练系统,既支持理解任务也支持生成任务,解决了在多GPU上适配超长视频序列的挑战。
NVIDIA 推出了 PiD,一种 Pixel Diffusion Decoder,用其替换潜在扩散模型中的传统 VAE/RAE 解码器,实现快速高分辨率解码,速度提升高达 6 倍,并改进了视觉保真度。