标签
文章对比了Mamba和RWKV两个AI模型架构阵营的路线:Mamba面向云侧企业AI平台,RWKV面向端侧和边缘设备,各自适配不同硬件与推理场景。
LinearKV is a training-free framework that enables position-independent caching for hybrid LLMs by using a single cached state to initialize linear layers, outperforming exact prefix-state composition and remaining compatible with existing PIC methods.
介绍AraSSM,一种通过阿拉伯语语料库上的掩码语言建模进行预训练的双向Mamba状态空间编码器,在消费级GPU上从头训练,同时在阿拉伯语自然语言理解基准上取得了有竞争力的结果。
NVIDIA released Nemotron 3.5 Lightning 30B-A3B-NVFP4, a hybrid MoE LLM with 3B active parameters, up to 1M context, and speculative decoding support for efficient single-GPU inference.
A developer trained a tiny Mamba-based autoregressive language model and built an inference engine to run it on the 6502 processor inside a BBC Micro, demonstrating modern machine learning on 1975 hardware with only 25KB of user memory.
提出了MaLoRA和MaRA两种适配器系列,在冻结的语言模型中引入选择性状态空间递归,实现token级和上下文级适配,在MuSiQue和2WikiMultihopQA等多跳推理基准上取得了显著提升。
本文提出MambaLSTM,一种结合Mamba状态空间模型和LSTM的框架,用于时空交通事故风险预测,解决了特征融合中的噪声和全局空间关联问题。
提出AdaSurvMamba,一种用于多模态生存分析的自适应框架,通过双尺度重要性感知重建模块和语义聚合扫描来改进全切片图像与基因组图谱的整合,在五个TCGA队列上实现一致性的性能提升。
本文提出了Samba,一种用于音频-视觉导航的混合状态空间架构。它使用Mamba状态编码器(M-SE)替代GRU进行时间聚合,并构建了音频Mamba编码器(AME)以更好地捕捉频谱图中的全局时频依赖关系。在Matterport3D数据集上,导航成功率(SR)相比现有最先进模型提升了11.3%。
德国AI联盟发布Soofi S,一款开源的300亿参数混合专家模型,在英语和德语基准测试中取得最高分,采用混合Mamba-Transformer架构实现高效长上下文推理。
本文提出了一种用于块扩散语言模型的混合Mamba-注意力架构,该架构将反向Mamba扫描限制在活跃去噪块内,从而实现了块间的精确缓存,并在长上下文生成中达到了高吞吐量。
QuantFlow引入了一种基于联邦Mamba的时间序列预测基础模型,该模型结合了逆序嵌入、双向状态空间解码器和分位数回归,在保持数据隐私的同时在基准测试上取得了强劲结果。
本文评估了Mamba状态空间模型在七种南非语言上的ASR性能,发现其在资源更少的情况下达到了与Conformer相当的准确率,并探讨了多语训练策略和低资源场景。
本文提出了一种自监督的基于Mamba的模型,从电子健康记录中学习有效的表征以改进患者亚型分类,在真实世界数据集上展示了优于基线模型的性能。
英伟达的Nemotron-3-Super-120B-A12B,一种混合Mamba和混合专家模型,仅使用四块RTX 3090 GPU就实现了在504K token下的完美大海捞针检索。
NVIDIA 发布了 Nemotron-Labs-3-Puzzle-75B-A9B,它是 Nemotron-3-Super 的压缩版本,推理效率更高,基准测试性能强劲。
SPDM 提出了一种几何感知的状态空间模型,该模型利用对称正定流形上的流形约束进行时间序列预测,在11个基准测试中取得了最先进的性能。
提出了Mamba辅助闭合(MAC)框架,这是一种基于Mamba的序列模型,用于高维动力系统降阶建模中的非马尔可夫闭合,在Burgers方程和Lorenz '96系统上优于基于GRU和马尔可夫的方法。
Nemotron 3 Ultra 是一个开源权重发布,具有令人印象深刻的性能效率比,采用 Mamba-2 与注意力机制的混合栈和 LatentMoE,并且比之前的 Super 变体更大。
研究人员提出了一种用于图生成的轻量级自回归框架,该框架使用结构引导的拓扑排序实现了接近对数线性的复杂度,解决了现有扩散和自回归方法在可扩展性和新颖性方面的局限性。该方法同时支持LSTM和Mamba风格的主干网络,在分子和非分子基准测试中展示了改进的新颖性,同时保持了有效性和独特性。