标签
介绍了 Recurrent Looped Transformer(RLT),一种具有无限推理深度的新型 AI 架构,在实现安全超级智能的背景下进行讨论。
本文介绍了一种使用具有417k参数的小型递归动态系统,从单一初始状态自主生成完整'Bad Apple'视频的方法。它详细说明了架构、训练技术如展开视野课程和状态扰动噪声,并在GitHub上分享了代码和模型。
介绍了一种受Lindblad启发的多时间尺度储备池架构,将旋转与耗散分离,从而独立控制混合、记忆和稳定性,在NARMA-20和Lorenz-63等基准上取得了有竞争力的结果。
本文介绍了上下文就绪 Transformer,一种循环架构,在 Transformer 块之前对 token 进行预上下文化,在匹配或超越标准 Transformer 性能的同时,实现了显著的推理加速(例如在 A100 上达到 1.7 倍),且层数更少。
本文回顾了SWave(一种复数值循环语言模型)的设计演进过程,详细说明了哪些架构组件被保留、重构、取代或被证明为非承重件,并形式化了诸如余弦主导坍缩等失效模式。