标签
本文探讨了基于Mamba的状态空间模型用于孟加拉语假新闻检测,并与Transformer模型如BanglaBERT进行比较。研究表明,Mamba在资源受限环境中提供了具有竞争力的性能和更高的效率。
本文分析了循环快速权重记忆和选择性状态空间模型作为在线学习规则,推导出归一化更新族,这些更新族能改善长度外推并在语言建模中保持竞争力。
ALPHABET 是一种紧凑的线性时间序列模型,它将时间历史压缩为稳定的复极点模式,以更少的参数和更快的推断速度实现竞争性能。
本文研究Transformer与Mamba架构在其红外光谱中是否表现出类似的集体动力学,发现尽管微观机制不同,两者都发展出近临界慢模动力学。
本文探讨在序列模型中使用受量子理论启发的复数状态,表明它可以在 Mamba 和基于注意力的模型中减少优化步骤,并提高样本效率。
本文介绍了MARCH,一种网络架构,通过将累积的循环状态检查点缓存为内容可寻址的状态锚点,将循环状态空间模型扩展到固定尺寸维度之外,从而实现高效的长程记忆检索,在长上下文基准测试中优于线性注意力变体。
ChronoSSM 提出了一种自回归状态空间模型,该模型联合建模事件和时间戳,表明联合训练能够提高时间可恢复性,同时不降低内容生成质量。
介绍AraSSM,一种通过阿拉伯语语料库上的掩码语言建模进行预训练的双向Mamba状态空间编码器,在消费级GPU上从头训练,同时在阿拉伯语自然语言理解基准上取得了有竞争力的结果。
本文研究了音素与字符目标以及选择性状态空间模型(Mamba)对皮层内脑到文本解码的影响,发现基于GRU的循环解码器在Brain-to-Text '25基准测试中仍是表现最强的模型。
Black-Mamba提出了一种测试时自适应预测架构,利用累积惊异度仅在检测到分布漂移证据时选择性更新记忆,从而在非平稳时间序列上实现高效自适应。
本文探索了使用Mamba和混合Mamba-Transformer骨干网络的循环(递归)状态空间语言模型,表明其在推理任务上优于非循环基线,并在等参数和等FLOPs预训练下保持竞争力,同时自适应退出状态选择改善了中间深度性能。
本文提出了一种可学习的狄利克雷过程缓存,仅为新颖输入分配内存槽,使得缓存大小与独特项目数而非令牌数成比例,从而实现高效的关联回忆。它将DP-means聚类与循环骨干网络相结合,在关联回忆基准测试和真实世界数据流上展示了有效性。
本文介绍了HOLA,一种为快速AI模型(如线性注意力和状态空间模型)提供额外记忆缓存以存储令人惊讶的事实的方法,在不牺牲速度的情况下提高了它们在长上下文任务中的回忆能力。
SHiPPO 通过将多项式投影系数传输到移动通道框架中扩展了 HiPPO,使选择性状态空间模型能够恢复对顺序敏感的记忆信号。本文提供了支持其传输记忆先验的理论基础和诊断方法。
本文介绍了不变-可变解耦状态空间模型(IVD-SSM),这是对 SemEval-2026 任务4的提交,该模型使用混合 Jamba-1.5-Mini 骨干网络和新型结构门控对齐头,从词汇变体中解耦结构不变性,用于叙事相似性评估。
HOLA(海马体线性注意力)受海马记忆启发,通过一个有界的精确KV缓存增强线性注意力,在不牺牲效率的情况下改善长程召回和困惑度。在340M参数规模下,它在Wikitext上优于全注意力Transformer,并在高达32k token的范围内实现稳健的针召回。
介绍了一种基于汉克尔降阶模型(HRM)的适配器,这是一种通过平衡截断初始化的SSM残差模块,用于参数高效微调,在长上下文任务中优于LoRA。
一篇比较RNNs、Transformers和SSMs中记忆设计的技术分析,主张关键问题在于序列状态应存储于何处,而非哪种架构更优。讨论了压缩隐状态、增长的KV缓存以及模型连接中类突触记忆之间的权衡。
本文研究了记忆高效元强化学习架构在对抗性航天器接近操作中用于自适应安全关键控制的性能,发现与LSTM和GRU相比,使用PPO的状态空间模型(如Mamba)在任务完成度、安全性和燃料节约方面表现更优。
对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。