attention-variants

标签

Cards List
#attention-variants

LLMs 现在变得复杂了

Hacker News Top · 2026-06-20 缓存

文章讨论了LLMs如何变得越来越复杂,从简单的Transformer堆栈演变为融入多种注意力变体、混合专家模型和多模态编码器,与推荐系统进行了类比,并强调了像FlexAttention这样可组合内核优化的必要性。

0 人收藏 0 人点赞
#attention-variants

LLM架构的最新发展:KV共享、mHC与压缩注意力 [P]

Reddit r/MachineLearning · 2026-05-17 缓存

Sebastian Raschka回顾了LLM架构中针对长上下文效率的最新创新,包括KV共享、压缩卷积注意力和来自Gemma 4、ZAYA1、Laguna XS.2和DeepSeek V4等模型的逐层注意力预算。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈