@_albertgu: 介绍一种新的序列模型Raven,它突破了固定状态大小序列模型的边界!Raven连接了流行的…
摘要
研究人员介绍了Raven,这是一种新颖的序列模型,它将状态空间模型的效率与受滑动窗口注意力启发的选择性槽更新机制相结合,以改进长上下文检索。该方法为现有的线性时间模型提供了一种更严谨的替代方案。
介绍一种新的序列模型Raven,它突破了固定状态大小序列模型的边界!Raven连接了流行的线性时间模型与恒定状态容量,如SSMs和滑动窗口注意力(SWA)。与SWA类似,其状态是一组有限的槽;但与SWA不同的是,Raven学会选择性地决定更新哪些槽,每个新缓存的token都会触发该选择。这是一种更严谨的更新机制,使得检索能力远优于先前的线性模型。我个人认为SWA并不是一个非常严谨的模型——但它很方便且经验上效果很好——最令人兴奋的是看到Raven作为严格更好的即插即用替代品被使用。更广泛地说,它开发的框架希望能引入更多想法,结合类似SSM模型和类似注意力模型的优势。这项工作由@rshia_afz和@avivbick领导。
相似文章
@rshia_afz: 1/ 由于状态大小固定,SSM 在召回基准测试中表现不佳。但当前模型是否真的在“明智地”存储上下文?
本文介绍了 Raven,一种新型状态空间模型(SSM),它采用选择性内存分配机制,在召回任务上达到了最先进的性能,并且相比于 SWA 等现有模型,展现出更优的长度泛化能力。
RAVEN:一种面向金融时间序列预测的体制感知变上下文专家网络
本文提出了RAVEN,这是一种混合专家框架,能够自适应地为每个输入样本确定时间上下文窗口,以处理非平稳金融时间序列。该方法在金融和交通基准上取得了最先进的性能。
RAVEN: 实时自回归视频外推与一致性模型GRPO
RAVEN 提出了一种实时自回归视频外推框架,结合了 CM-GRPO(一种用于一致性模型采样的新型强化学习方法),提升了长时程生成质量。
KV缓存墙:为何固定大小内存的序列模型不断回归
探讨了Transformer推理中KV缓存日益增长的内存瓶颈,解释了为何像Mamba和RWKV这样的固定大小内存的替代架构重新获得关注。
令人印象深刻!Openclaw 解决了复杂的类 Raven 问题。
Openclaw,一个开源 AI 模型,据称在复杂的 Raven's Progressive Matrices 问题上表现优于 ChatGPT,尽管它拒绝透露其内部思维链。