标签
RWKV是一种新颖的语言模型架构,结合了RNN的高效性和Transformer的可并行化特性,以线性时间复杂度和恒定内存占用实现了强大的LLM性能。
本文提出了用于逆转中世纪文本中字符集简化和缩写的神经方法,采用一对一和带状RNN,并通过自监督或平行语料库进行训练,同时介绍了一个用于字母还原的Python库。
FLYNN 是一种从果蝇大脑连接组导出的循环神经网络,用于基于视觉的机器人导航。它在性能上与手工设计的网络相当,同时对分布外数据和感觉丧失表现出更强的鲁棒性。
一篇比较RNNs、Transformers和SSMs中记忆设计的技术分析,主张关键问题在于序列状态应存储于何处,而非哪种架构更优。讨论了压缩隐状态、增长的KV缓存以及模型连接中类突触记忆之间的权衡。
这篇论文提出监督记忆训练(SMT)方法,利用Transformer作为超级老师并行提炼记忆状态,然后用一步监督学习训练RNN,实现训练完全并行、梯度路径从O(T)缩短到O(1),显著改善了长距离依赖学习。
本文介绍了Google Research联合康奈尔和南加大提出的一种新方法,通过为RNN的记忆拍快照并缓存,使RNN能高效处理长文本,兼具Transformer的强记忆和RNN的低成本,为长上下文AI提供新方向。
BlinkDL 宣布了 RWKV-7 G1g,一种纯 RNN 大型语言模型,声称是其同类中最好的,且与通用 LLM 竞争,在单个 RTX 5090 上具有高速推理性能。
创建了一个在浏览器中运行的WebGPU版本的经典char-rnn演示,在莎士比亚数据集上训练,以向加入Anthropic的Karpathy致敬。
提出了一种名为PDRNN的模块化混合AI辅助行人航位推算系统,该系统结合了循环神经网络与分别用于方向、速度和距离估计的独立机器学习模型,并可选地使用基于无线电的稳定。在动态运动数据上的实验表明,与经典方法和基于机器学习的方法相比,其准确性和精度更优。
Key-Value Means (KVM) 是一种新颖的注意力机制,结合了 Transformer 和 RNN 的优势,具有可控的计算复杂度和内存使用。它支持固定大小或增长状态,提供次二次方预填充时间和次线性状态增长,并且无需自定义内核即可实现。
RL²将快速强化学习算法编码为循环神经网络的权重,通过缓慢的通用强化学习来学习,使智能体能够像生物学习一样通过少量试验快速适应新任务。该方法在小规模老虎机问题和大规模基于视觉的导航任务上都展现了强大性能。