使用微小递归动态系统(417k参数)从单一初始状态自主生成Bad Apple [P]
摘要
本文介绍了一种使用具有417k参数的小型递归动态系统,从单一初始状态自主生成完整'Bad Apple'视频的方法。它详细说明了架构、训练技术如展开视野课程和状态扰动噪声,并在GitHub上分享了代码和模型。
几周前,我看到这篇帖子,作者训练了一个SIREN MLP将Bad Apple隐式记忆为坐标函数:(t, y, x)到像素。这让我好奇一个稍微不同的表述:与其给网络一个时间戳t,一个小型的递归动态系统(类似RNN)能否学习潜在空间中的连续时间流,并从单一初始条件(h_0, c_0)自主生成整个约6,500帧的全分辨率视频?代码、权重和分析工具,包括展开脚本、图表和独立模型,已在此分享:GitHub: SEBADA321/BadAppleRNN。
架构与推理足迹
在推理时,系统不接收时间戳输入,并在闭环中评估:(h_t, c_t) -> 递归转移 (CTF) -> (h_{t+1}, c_{t+1}) | h_t -> 帧解码器 -> 384x512灰度帧
潜在维度:h_t为64维(解码),c_t为64维(内部记忆流形,用于分离不同时间戳的视觉相似帧)。
递归转移 (CTF):4门LSTM风格递归,正交初始化(16,640参数,65 KB)。
帧解码器 (FD):4阶段双线性上采样,深度可分离卷积(400,361参数,1.56 MB)。
初始状态:一对64维向量(h_0, c_0)(128浮点数,0.5 KB)。
总推理模型:417,129参数(约1.60 MB,FP32)。
运行时性能:在RTX 4080上超过200 FPS,解码期间峰值活动VRAM约17.2 MB。
训练一个从t=0开始的自主系统跨越约6,573步,可能由于梯度消失/爆炸和误差累积在计算上不稳定。我采用的训练设置使用了多种针对性技术:
学习的潜在教师表:在训练期间,我优化了一对表h_table[t]和c_table[t]与模型一起。这允许在有限视野K内从任意时间戳开始并行分段训练。这些表是辅助工具,在推理时完全丢弃。
展开视野课程:我开始训练时K=2,并逐渐将展开长度加倍(K=2 -> 4 -> 8 -> 16 -> 32 -> 64 -> 128 -> 256 -> 512)。每次视野加倍在转移函数适应更长轨迹之前产生特征性的损失跳跃。
状态扰动噪声 (σ=0.005):为防止模型学习脆弱的一维线在微小数值误差下发散,在将状态传递给转移函数之前添加高斯噪声 (z_hat_{t+1} = F(z_t + ε)),同时针对干净目标评估损失。这鼓励递归映射将小偏差收缩回轨迹。
二阶差分加速正则化:惩罚速度 (||h_{t+1} - h_t||) 有使轨迹崩溃的风险。相反,我通过二阶差分惩罚离散加速(抖动):||h_{t+2} - 2h_{t+1} + h_t||_2^2。这强制轨迹平滑而不惩罚运动。
优化器和动量管理:我对解码器/表使用AdamW (1e-5),对递归权重使用Muon (0.005, 动量0.95)。为防止累积动量在K加倍时作为陈旧惯性,从第500周期开始,每10个周期将动量缓冲区缩放0.2。
分块解码:为处理K=512的长视野而不使训练时VRAM溢出,解码器以32帧的时间块进行评估。
一些有趣的事情
模型可以展开完整的6.5k序列,即使技术上最多训练512帧。所以这是成功的。
训练损失与自主展开:具有最低数值训练损失的检查点不一定在自主生成中最佳。因为K在课程中变化,原始训练损失在阶段间不可直接比较,短期视野教师强制一致性不保证长期稳定性。
参数规模上的动态稳定性:挑战不是增加参数数量(递归转移仅16k参数),而是通过噪声注入和加速惩罚调节动态,使误差不会在数千个递归步骤中累积。
我需要大幅改进解码器,我主要专注于递归部分,训练较慢。既然我得到了成功结果,我将更多专注于优化CNN解码器。没有跳跃连接或归一化,这也挺有趣的。显然也没有注意力机制,因为我想保持简单。我也不想使用截断BPTT。
不完全是科学的,因为我在运行中进行了一些更改或一次多个更改,所以不清楚什么贡献更多。我使用'AI'帮助撰写帖子和README。部分代码也是这样生成的,但架构是我自己想出来的,也来自之前的项目。可能还有许多部分需要改进,所以很高兴得到反馈!
相似文章
Hugging Face Daily Papers
One-Forcing 通过用辅助 GAN 损失增强 DMD 目标,改进了单步视频生成,以更低的训练成本实现了最先进的性能。
Hugging Face Daily Papers
AAD-1 引入具有分阶段训练的非对称对抗性蒸馏,以实现一步自回归视频生成,在 VBench 上优于先前方法。
Hugging Face Daily Papers
介绍了Macaron-A2UI,一种用于个人智能体的生成式UI模型,可综合动态界面与轻量级可执行操作,超越纯文本聊天。本文引入大规模语料库、A2UI-Bench基准,并使用LoRA微调和强化学习训练了高达754B参数的模型,取得了显著成果。
OpenAI Blog
# 域随机化与生成模型在机器人抓取中的应用 来源:[https://openai.com/index/domain-randomization-and-generative-models-for-robotic-grasping/](https://openai.com/index/domain-randomization-and-generative-models-for-robotic-grasping/) ## 摘要 基于深度学习的机器人抓取在算法改进和数据可用性增加的推动下取得了重大进展。然而,最先进的模型往往仅在数百或数千个未
arXiv cs.CL
Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。