标签
Recurrent Looped Transformer (RLT) 是一种新颖的架构,它结合了因果编码器和循环解码器,以实现具有无界时间深度的潜在推理、模型-硬件协同设计以及模型-强化学习算法协同设计。
本文分析了循环快速权重记忆和选择性状态空间模型作为在线学习规则,推导出归一化更新族,这些更新族能改善长度外推并在语言建模中保持竞争力。
本文介绍了读出反馈(RoFB),一种测试时干预方法,利用自身的读出概率引导循环推理模型中的潜在动态,在数独和迷宫任务上无需重新训练即可获得性能提升。
本文提出了量子启发式循环模型(QKAN-FWPs)用于流量矩阵预测,与LSTM基线相比,以更少的参数显示出优越的准确性。
本文介绍FRESCO,一种完全在频域运行的回声状态网络架构,将密集递归更新的复杂度降至O(N),在基准测试上达到最先进性能的同时降低了计算成本。
本文介绍MF-Net,一种循环动力学模型,通过共享场状态表示多变量系统,并学习用于联合演化的机械转移。它在实现有竞争力的预测的同时,还能对学习到的关系进行可解释的结构化读取。
本文介绍了通用三重潜在循环模型,该模型将令牌对交互压缩为潜在状态,并提出一种改进精确召回的门控关联检索变体。该混合模型在字节级WikiText-2和分词语言基准上优于Transformer,实现了高达41.9%的关联召回率(对比25%)。
WriteSAE 引入了第一个稀疏自编码器,能够分解状态空间模型和混合循环语言模型中的矩阵缓存写入,相比现有方法实现了更优的令牌级干预。
本文认为,循环模型中鲁棒的状态跟踪取决于误差控制动力学,而不仅仅取决于表达能力,证明了仿射循环网络会遭受累积误差的影响,从而限制了其有效视野。