local-attention

标签

Cards List
#local-attention

@HarshalsinghCN:哟,各位,博客上线了。我试着用简单的语言拆解 BarunLM(35M) 的设计,同时尽可能保持技术深度,又不会让人难以理解。

X AI KOLs Timeline · 2026-08-02 缓存

一篇博客文章的公告,解释了 BarunLM(一个 35M 参数的语言模型)的设计,涵盖其架构、训练方案和数据集准备,重点介绍了相对于其他 sub-100M 模型的效率和性能提升。

0 人收藏 0 人点赞
#local-attention

局部与全局注意力的双维度

arXiv cs.CL · 2026-06-18 缓存

提出距离自适应表示(DAR),该方法对远距离token降低键值维度,同时保留附近token的全维度,在不损失性能的前提下提升KV缓存效率。

0 人收藏 0 人点赞
#local-attention

@akshay_pachaar: 1) 稀疏注意力 它通过以下方式将注意力计算限制在部分令牌上:- 使用局部注意力(令牌仅关注其相邻令牌)…

X AI KOLs Timeline · 2026-06-03 缓存

解释了Transformer中的稀疏注意力,通过仅关注部分令牌(使用局部或学习到的注意力模式)来降低计算复杂度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈