sequence-modeling

标签

Cards List
#sequence-modeling

HantaWatch:基于联邦学习的汉坦病毒基因组监测

arXiv cs.LG · 5天前 缓存

HantaWatch 是一个用于汉坦病毒基因组监测的联邦学习框架,能够在不共享原始数据的情况下协作训练基于序列的模型,集成了k-mer特征提取和自适应优化,以支持风险筛查和专家优先排序。

0 人收藏 0 人点赞
#sequence-modeling

Flexformer:具有可学习注意力核的灵活线性Transformer

arXiv cs.LG · 2026-06-29 缓存

Flexformer提出了一种灵活的线性Transformer,使用随机傅里叶特征实现完全可学习的注意力核,在语言建模和序列分类任务中达到线性复杂度,同时匹配或超越softmax注意力的性能。

0 人收藏 0 人点赞
#sequence-modeling

关于次二次架构:从应用到原理

Hugging Face Daily Papers · 2026-06-10 缓存

本文在复杂序列建模任务上比较了 xLSTM、Mamba-2 和 Gated DeltaNet,发现 xLSTM 因其增强的状态追踪和记忆动态而更优,并在合成长度泛化任务上得到验证。

0 人收藏 0 人点赞
#sequence-modeling

在失忆与混沌之间:可训练耗散振荡器网络的记忆稳定性表现力三难困境

arXiv cs.LG · 2026-06-10 缓存

本文提出了可训练耗散振荡器网络的记忆-稳定性-表现力三难困境,表明阻尼同时控制这三者并限制了可训练性,通过在20振荡器网络上的实验验证确认了理论界限。

0 人收藏 0 人点赞
#sequence-modeling

Mamba辅助的非马尔可夫闭合用于降阶建模

arXiv cs.LG · 2026-06-05 缓存

提出了Mamba辅助闭合(MAC)框架,这是一种基于Mamba的序列模型,用于高维动力系统降阶建模中的非马尔可夫闭合,在Burgers方程和Lorenz '96系统上优于基于GRU和马尔可夫的方法。

0 人收藏 0 人点赞
#sequence-modeling

基于门控关联检索的通用三重潜在压缩

arXiv cs.CL · 2026-06-05 缓存

本文介绍了通用三重潜在循环模型,该模型将令牌对交互压缩为潜在状态,并提出一种改进精确召回的门控关联检索变体。该混合模型在字节级WikiText-2和分词语言基准上优于Transformer,实现了高达41.9%的关联召回率(对比25%)。

0 人收藏 0 人点赞
#sequence-modeling

Return-to-Go 不仅仅是数字:用于返回条件监督学习的 Q 引导对齐

arXiv cs.LG · 2026-05-29 缓存

本文提出了 Q-align DT 框架,该框架将 return-to-go 与 Q 值对齐,以提高离线强化学习中的可控性和性能,在 D4RL 基准上取得了优异的结果。

0 人收藏 0 人点赞
#sequence-modeling

Interdomain Attention: 超越令牌级键值记忆

arXiv cs.LG · 2026-05-26 缓存

提出了Interdomain Attention,一种通过核方法将状态空间模型集成到注意力中的新方法,实现了固定大小状态的高效长上下文建模,并在参数规模达13亿的语言建模实验中超越了SSM和softmax注意力。

0 人收藏 0 人点赞
#sequence-modeling

我构建了一个Mamba1变体,称为SM1,d_state=1,在Blackwell上纯PyTorch运行[P]

Reddit r/MachineLearning · 2026-05-23

作者提出了SM1,一个Mamba1的变体,d_state=1,使用两个原生PyTorch操作替代选择性扫描,与d_state=16相比内存减少16倍。闭式解消除了状态维度,实现了每个token恒定内存的高效推理。

0 人收藏 0 人点赞
#sequence-modeling

Next-Latent Prediction Transformers 学习紧凑世界模型

Papers with Code Trending · 2025-11-08 缓存

介绍了 Next-Latent Prediction (NextLat),这是一种自监督目标,训练 Transformer 预测其下一个潜在状态,鼓励形成紧凑的内部世界模型,并提高跨序列建模任务的泛化能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈