state-space-models

标签

Cards List
#state-space-models

BanglaMamba:探索用于孟加拉语假新闻检测的状态空间模型

arXiv cs.CL · 2026-08-27 缓存

本文探讨了基于Mamba的状态空间模型用于孟加拉语假新闻检测,并与Transformer模型如BanglaBERT进行比较。研究表明,Mamba在资源受限环境中提供了具有竞争力的性能和更高的效率。

0 人收藏 0 人点赞
#state-space-models

持续学习中的快速权重注意力

Hugging Face Daily Papers · 2026-08-27 缓存

本文分析了循环快速权重记忆和选择性状态空间模型作为在线学习规则,推导出归一化更新族,这些更新族能改善长度外推并在语言建模中保持竞争力。

0 人收藏 0 人点赞
#state-space-models

ALPHABET:一种采用分组指数传输的拉普拉斯极点历史聚合器

arXiv cs.LG · 2026-08-26 缓存

ALPHABET 是一种紧凑的线性时间序列模型,它将时间历史压缩为稳定的复极点模式,以更少的参数和更快的推断速度实现竞争性能。

0 人收藏 0 人点赞
#state-space-models

Transformer与状态空间架构中集体动力学的红外普适性

arXiv cs.LG · 2026-08-20 缓存

本文研究Transformer与Mamba架构在其红外光谱中是否表现出类似的集体动力学,发现尽管微观机制不同,两者都发展出近临界慢模动力学。

0 人收藏 0 人点赞
#state-space-models

量子捷径:复数相位状态动态减少序列模型的优化步骤

arXiv cs.LG · 2026-08-18 缓存

本文探讨在序列模型中使用受量子理论启发的复数状态,表明它可以在 Mamba 和基于注意力的模型中减少优化步骤,并提高样本效率。

0 人收藏 0 人点赞
#state-space-models

MARCH:利用内容路由状态锚点扩展循环记忆

arXiv cs.LG · 2026-08-14 缓存

本文介绍了MARCH,一种网络架构,通过将累积的循环状态检查点缓存为内容可寻址的状态锚点,将循环状态空间模型扩展到固定尺寸维度之外,从而实现高效的长程记忆检索,在长上下文基准测试中优于线性注意力变体。

0 人收藏 0 人点赞
#state-space-models

ChronoSSM:在自回归状态空间模型中训练时间感知表示

arXiv cs.LG · 2026-08-12 缓存

ChronoSSM 提出了一种自回归状态空间模型,该模型联合建模事件和时间戳,表明联合训练能够提高时间可恢复性,同时不降低内容生成质量。

0 人收藏 0 人点赞
#state-space-models

AraSSM:用于阿拉伯语掩码语言建模的双向状态空间编码器

arXiv cs.CL · 2026-08-11 缓存

介绍AraSSM,一种通过阿拉伯语语料库上的掩码语言建模进行预训练的双向Mamba状态空间编码器,在消费级GPU上从头训练,同时在阿拉伯语自然语言理解基准上取得了有竞争力的结果。

0 人收藏 0 人点赞
#state-space-models

音素与字符级目标及选择性状态空间模型在皮层内脑到文本中的应用

arXiv cs.CL · 2026-07-30 缓存

本文研究了音素与字符目标以及选择性状态空间模型(Mamba)对皮层内脑到文本解码的影响,发现基于GRU的循环解码器在Brain-to-Text '25基准测试中仍是表现最强的模型。

0 人收藏 0 人点赞
#state-space-models

Black-Mamba: 生物启发的泄漏累积方法用于分布漂移下的概念知识

arXiv cs.AI · 2026-07-22 缓存

Black-Mamba提出了一种测试时自适应预测架构,利用累积惊异度仅在检测到分布漂移证据时选择性更新记忆,从而在非平稳时间序列上实现高效自适应。

0 人收藏 0 人点赞
#state-space-models

具有自适应退出状态选择的循环状态空间语言模型

arXiv cs.AI · 2026-07-14 缓存

本文探索了使用Mamba和混合Mamba-Transformer骨干网络的循环(递归)状态空间语言模型,表明其在推理任务上优于非循环基线,并在等参数和等FLOPs预训练下保持竞争力,同时自适应退出状态选择改善了中间深度性能。

0 人收藏 0 人点赞
#state-space-models

记住独特项目而非标记:一种可学习的狄利克雷过程缓存,介于状态空间模型与注意力机制之间

arXiv cs.LG · 2026-07-14 缓存

本文提出了一种可学习的狄利克雷过程缓存,仅为新颖输入分配内存槽,使得缓存大小与独特项目数而非令牌数成比例,从而实现高效的关联回忆。它将DP-means聚类与循环骨干网络相结合,在关联回忆基准测试和真实世界数据流上展示了有效性。

0 人收藏 0 人点赞
#state-space-models

@rohanpaul_ai: 来自上海大学论文的一个宏大想法——赋予AI模型人类式记忆。想象一下阅读一本巨大的悬疑小说……

X AI KOLs Following · 2026-07-08 缓存

本文介绍了HOLA,一种为快速AI模型(如线性注意力和状态空间模型)提供额外记忆缓存以存储令人惊讶的事实的方法,在不牺牲速度的情况下提高了它们在长上下文任务中的回忆能力。

0 人收藏 0 人点赞
#state-space-models

SHiPPO: 带传输多项式投影的循环记忆

arXiv cs.LG · 2026-07-07 缓存

SHiPPO 通过将多项式投影系数传输到移动通道框架中扩展了 HiPPO,使选择性状态空间模型能够恢复对顺序敏感的记忆信号。本文提供了支持其传输记忆先验的理论基础和诊断方法。

0 人收藏 0 人点赞
#state-space-models

Lacuna Inc. 参与 SemEval-2026 任务4:基于结构门控状态空间模型的叙事相似性解耦

arXiv cs.CL · 2026-07-07 缓存

本文介绍了不变-可变解耦状态空间模型(IVD-SSM),这是对 SemEval-2026 任务4的提交,该模型使用混合 Jamba-1.5-Mini 骨干网络和新型结构门控对齐头,从词汇变体中解耦结构不变性,用于叙事相似性评估。

0 人收藏 0 人点赞
#state-space-models

@omarsar0:新论文值得一读。(收藏)基本思路是将压缩循环状态与一个小型精确记忆配…

X AI KOLs Following · 2026-07-03 缓存

HOLA(海马体线性注意力)受海马记忆启发,通过一个有界的精确KV缓存增强线性注意力,在不牺牲效率的情况下改善长程召回和困惑度。在340M参数规模下,它在Wikitext上优于全注意力Transformer,并在高达32k token的范围内实现稳健的针召回。

0 人收藏 0 人点赞
#state-space-models

基于汉克尔降阶建模的SSM适配器:注入位置决定长上下文微调中的任务适配性

arXiv cs.LG · 2026-06-26 缓存

介绍了一种基于汉克尔降阶模型(HRM)的适配器,这是一种通过平衡截断初始化的SSM残差模块,用于参数高效微调,在长上下文任务中优于LoRA。

0 人收藏 0 人点赞
#state-space-models

RNNs vs Transformers vs SSMs:面向持续学习场景下AI记忆应存放于何处?

Reddit r/artificial · 2026-06-18

一篇比较RNNs、Transformers和SSMs中记忆设计的技术分析,主张关键问题在于序列状态应存储于何处,而非哪种架构更优。讨论了压缩隐状态、增长的KV缓存以及模型连接中类突触记忆之间的权衡。

0 人收藏 0 人点赞
#state-space-models

面向对抗性航天器接近操作中自适应安全关键控制的记忆高效元强化学习

arXiv cs.LG · 2026-06-17 缓存

本文研究了记忆高效元强化学习架构在对抗性航天器接近操作中用于自适应安全关键控制的性能,发现与LSTM和GRU相比,使用PPO的状态空间模型(如Mamba)在任务完成度、安全性和燃料节约方面表现更优。

0 人收藏 0 人点赞
#state-space-models

@qinzytech: https://x.com/qinzytech/status/2066585405479371092

X AI KOLs Timeline · 2026-06-15 缓存

对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈