将任意图像转化为可玩游戏的深度神经网络!全部在消费级GPU上运行,而非数据中心
摘要
作者介绍了一个小型基于Transformer的神经网络,从零开始训练,能够将任意图像转化为可玩游戏,在RTX 5090等消费级GPU上实时运行。该模型使用自回归解码和KV缓存,但目前存在运动和上下文问题。
大家好!!我真的很想分享我正在研究的成果。我想构建一个能够模拟游戏的神经网络,或者至少开始尝试。大多数视频生成器太大,无法在消费级硬件上实时运行,因此我从零开始设计了一个模型。没有微调之类的废话。核心的去噪网络完全从零开始训练,以支持这一目标。从图像到游戏数据。上面的视频是在RTX 5090上运行的。这个神经网络是一个类似Transformer的小型模型,以因果方式工作,就像LLM一样。这让我们能够KV缓存所有过去的信息,并为每个新帧执行简单的自回归解码前向传播。在分享的视频中,该模型是一个0.4B参数版本,存在一些显著问题,如运动不佳、奇怪闪烁和上下文问题。它实时接收我给出的键盘操作,并在前向传播中使用。(但没有无分类器引导)。我现在正在训练下一个迭代,一个0.8B模型。顺便说一句,我还没有进行量化,这可以节省大量时间。bf16速度很慢。
相似文章
突破Transformer僵局:一款在消费级硬件上运行的本地优先3D点云认知引擎
介绍SHD-CCP v2.0,这是一种新颖的AI架构,它用3D点云数据结构替代Transformer令牌序列,采用格拉斯曼流形融合和零拷贝内存映射流式处理,在消费级硬件上实现低延迟和低内存占用。
我构建了一个无代码工具,通过观察你的操作学会玩任何2D游戏
DeepEpoch是一个无代码桌面应用,通过行为克隆观察用户操作来学习玩2D游戏,并支持人在回路中微调。
我设计了一种方法,用于(自主地)在单个消费级GPU上训练Transformer语言模型。
一种在单个消费级GPU上自主训练Transformer语言模型的方法,分为六个阶段,设有验证门和AGENTS.md规范,适用于OpenClaw等编排框架。
@_avichawla: 英伟达研究人员构建了一种新的Transformer变体。对层结构做了一个小改动:- 解码速度提升1.7倍 - long-…
英伟达研究人员推出了SparDA,这是一种新的Transformer变体,它增加了一个第四投影(Forecast)来预测下一层的KV块,从而支持从CPU内存预取并降低选择成本,实现了解码速度提升1.7倍,并在长程推理任务上准确率提升6.5个百分点。
视频生成的并行解码(10分钟阅读)
NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。