标签
介绍了卡尔曼增量网络,该网络通过将线性注意力重新表述为带有卡尔曼滤波更新的线性高斯状态空间模型来改进语言建模,以追踪记忆不确定性,从而产生比现有线性注意力模型性能更优的高效近似。
本文介绍了MARCH,一种网络架构,通过将累积的循环状态检查点缓存为内容可寻址的状态锚点,将循环状态空间模型扩展到固定尺寸维度之外,从而实现高效的长程记忆检索,在长上下文基准测试中优于线性注意力变体。
提出了Maglev,一种具有固定大小记忆的循环Transformer架构,它在训练期间保持可并行化的同时,推广了滑动窗口注意力。它使用预填充器和解码器,并采用记忆一致性损失,在验证损失和下游基准测试上优于基线。
介绍了半直接傅里叶Delta注意力(SFDA),一种相位控制的Delta规则层,它通过块旋转傅里叶控制算子扩展了Kimi Delta注意力,提供了构造性Chunk-WY定理以实现高效的分块计算,并展示了在循环记忆和寄存器记忆上的表达能力。
本文对比了softmax注意力与四种线性注意力架构(DeltaNet、Gated DeltaNet、Kimi Delta Attention、Gated DeltaNet-2),并介绍了跨层路由机制。在350M参数规模的实验表明,使用Muon优化器的Kimi Delta Attention取得了最低的验证损失,而使用AdamW的纯Gated DeltaNet吞吐量最高。
本文指出记忆保留是长上下文场景下循环记忆代理的瓶颈,并提出多头循环记忆(MHM),这是一种无需训练的框架,通过“先选择后更新”策略将记忆划分为独立的头。轻量级实例化版本 MHM-LRU 显著提升了 100K 至 1M token 范围内的记忆保留率和端到端准确率,在 896K token 的 RULER-HQA 上,将记忆保留率从低于 30% 提升至 73.96%。
本文介绍了来自Hierarchos的初步发现,Hierarchos是一个2.32亿参数的循环记忆增强助手模型,探讨了其在记忆保留和辅助任务方面的能力。