mamba

标签

Cards List
#mamba

@seclink: 冷知识: Mamba 阵营:走的"云侧前沿模型"路线,客户是 NVIDIA/AI21/IBM 这类卖企业 AI 平台的公司 → 如果你要做长上下文、低成本推理的云 API 数据加工,这个方向值得跟踪。 RWKV 阵营:走的"端侧/边缘内置…

X AI KOLs Following · 2026-08-14 缓存

文章对比了Mamba和RWKV两个AI模型架构阵营的路线:Mamba面向云侧企业AI平台,RWKV面向端侧和边缘设备,各自适配不同硬件与推理场景。

0 人收藏 0 人点赞
#mamba

LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs

arXiv cs.AI · 2026-08-13 缓存

LinearKV is a training-free framework that enables position-independent caching for hybrid LLMs by using a single cached state to initialize linear layers, outperforming exact prefix-state composition and remaining compatible with existing PIC methods.

0 人收藏 0 人点赞
#mamba

AraSSM:用于阿拉伯语掩码语言建模的双向状态空间编码器

arXiv cs.CL · 2026-08-11 缓存

介绍AraSSM,一种通过阿拉伯语语料库上的掩码语言建模进行预训练的双向Mamba状态空间编码器,在消费级GPU上从头训练,同时在阿拉伯语自然语言理解基准上取得了有竞争力的结果。

0 人收藏 0 人点赞
#mamba

nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4

Hugging Face Models Trending · 2026-08-04 缓存

NVIDIA released Nemotron 3.5 Lightning 30B-A3B-NVFP4, a hybrid MoE LLM with 3B active parameters, up to 1M context, and speculative decoding support for efficient single-GPU inference.

0 人收藏 0 人点赞
#mamba

Autoregressive Language Model on the 6502 Processor

Hacker News Top · 2026-07-31 缓存

A developer trained a tiny Mamba-based autoregressive language model and built an inference engine to run it on the 6502 processor inside a BBC Micro, demonstrating modern machine learning on 1975 hardware with only 25KB of user memory.

0 人收藏 0 人点赞
#mamba

语言模型推理的选择性状态空间适配与检索

arXiv cs.CL · 2026-07-22 缓存

提出了MaLoRA和MaRA两种适配器系列,在冻结的语言模型中引入选择性状态空间递归,实现token级和上下文级适配,在MuSiQue和2WikiMultihopQA等多跳推理基准上取得了显著提升。

0 人收藏 0 人点赞
#mamba

MambaLSTM:一种用于增强交通事故风险预测的时空框架

arXiv cs.LG · 2026-07-22 缓存

本文提出MambaLSTM,一种结合Mamba状态空间模型和LSTM的框架,用于时空交通事故风险预测,解决了特征融合中的噪声和全局空间关联问题。

0 人收藏 0 人点赞
#mamba

AdaSurvMamba:面向多模态生存分析的动态融合与语义扫描

arXiv cs.LG · 2026-07-21 缓存

提出AdaSurvMamba,一种用于多模态生存分析的自适应框架,通过双尺度重要性感知重建模块和语义聚合扫描来改进全切片图像与基因组图谱的整合,在五个TCGA队列上实现一致性的性能提升。

0 人收藏 0 人点赞
#mamba

一种用于音频-视觉导航的混合Mamba架构

arXiv cs.LG · 2026-07-16 缓存

本文提出了Samba,一种用于音频-视觉导航的混合状态空间架构。它使用Mamba状态编码器(M-SE)替代GRU进行时间聚合,并构建了音频Mamba编码器(AME)以更好地捕捉频谱图中的全局时频依赖关系。在Matterport3D数据集上,导航成功率(SR)相比现有最先进模型提升了11.3%。

0 人收藏 0 人点赞
#mamba

德国AI联盟发布Soofi S,一款在英语和德语基准测试中均名列前茅的开源300亿参数模型

Reddit r/LocalLLaMA · 2026-07-15 缓存

德国AI联盟发布Soofi S,一款开源的300亿参数混合专家模型,在英语和德语基准测试中取得最高分,采用混合Mamba-Transformer架构实现高效长上下文推理。

0 人收藏 0 人点赞
#mamba

训练具有部分双向性的混合块扩散语言模型

arXiv cs.LG · 2026-07-07 缓存

本文提出了一种用于块扩散语言模型的混合Mamba-注意力架构,该架构将反向Mamba扫描限制在活跃去噪块内,从而实现了块间的精确缓存,并在长上下文生成中达到了高吞吐量。

0 人收藏 0 人点赞
#mamba

QuantFlow:一种基于联邦Mamba的后Transformer基础模型,用于时间序列预测

arXiv cs.LG · 2026-07-07 缓存

QuantFlow引入了一种基于联邦Mamba的时间序列预测基础模型,该模型结合了逆序嵌入、双向状态空间解码器和分位数回归,在保持数据隐私的同时在基准测试上取得了强劲结果。

0 人收藏 0 人点赞
#mamba

从单语到多语:评估Mamba在南非语言中的ASR性能

arXiv cs.CL · 2026-07-03 缓存

本文评估了Mamba状态空间模型在七种南非语言上的ASR性能,发现其在资源更少的情况下达到了与Conformer相当的准确率,并探讨了多语训练策略和低资源场景。

0 人收藏 0 人点赞
#mamba

利用基于Mamba架构的表征改进纵向数据的患者亚型分类

arXiv cs.LG · 2026-06-30 缓存

本文提出了一种自监督的基于Mamba的模型,从电子健康记录中学习有效的表征以改进患者亚型分类,在真实世界数据集上展示了优于基线模型的性能。

0 人收藏 0 人点赞
#mamba

Nemotron-3-Super-120B-A12B(混合Mamba+MoE)在4×3090上实现504K token的完美针检索

Reddit r/LocalLLaMA · 2026-06-26

英伟达的Nemotron-3-Super-120B-A12B,一种混合Mamba和混合专家模型,仅使用四块RTX 3090 GPU就实现了在504K token下的完美大海捞针检索。

0 人收藏 0 人点赞
#mamba

nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4

Hugging Face Models Trending · 2026-06-24 缓存

NVIDIA 发布了 Nemotron-Labs-3-Puzzle-75B-A9B,它是 Nemotron-3-Super 的压缩版本,推理效率更高,基准测试性能强劲。

0 人收藏 0 人点赞
#mamba

SPDM:基于流形约束的几何调制状态空间建模用于时间序列预测

arXiv cs.LG · 2026-06-10 缓存

SPDM 提出了一种几何感知的状态空间模型,该模型利用对称正定流形上的流形约束进行时间序列预测,在11个基准测试中取得了最先进的性能。

0 人收藏 0 人点赞
#mamba

Mamba辅助的非马尔可夫闭合用于降阶建模

arXiv cs.LG · 2026-06-05 缓存

提出了Mamba辅助闭合(MAC)框架,这是一种基于Mamba的序列模型,用于高维动力系统降阶建模中的非马尔可夫闭合,在Burgers方程和Lorenz '96系统上优于基于GRU和马尔可夫的方法。

0 人收藏 0 人点赞
#mamba

@rasbt:又一个开源权重发布。Nemotron 3 Ultra 拥有令人印象深刻的性能效率比!在设计上,它……

X AI KOLs Timeline · 2026-06-04 缓存

Nemotron 3 Ultra 是一个开源权重发布,具有令人印象深刻的性能效率比,采用 Mamba-2 与注意力机制的混合栈和 LatentMoE,并且比之前的 Super 变体更大。

0 人收藏 0 人点赞
#mamba

通过轻量级结构引导的自回归模型实现新型图生成的可扩展性

arXiv cs.LG · 2026-06-04

研究人员提出了一种用于图生成的轻量级自回归框架,该框架使用结构引导的拓扑排序实现了接近对数线性的复杂度,解决了现有扩散和自回归方法在可扩展性和新颖性方面的局限性。该方法同时支持LSTM和Mamba风格的主干网络,在分子和非分子基准测试中展示了改进的新颖性,同时保持了有效性和独特性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈