latent-attention

标签

Cards List
#latent-attention

@shikhargupta02: 我一直在学习潜在注意力(来自 DeepSeek)。它不是为每个 token 存储完整的 K 和 V 向量,而是……

X AI KOLs Timeline · 2026-08-08 缓存

作者分享了他用 DeepSeek 的潜在注意力训练一个小模型的见解,观察到潜在空间的使用因层而异,以及一个可以将 KV 缓存减少 4 倍且损失不变的测试时技巧。

0 人收藏 0 人点赞
#latent-attention

Kimi K3 架构概述与笔记

Hacker News Top · 2026-07-28 缓存

Sebastian Raschka提供了开放权重的Kimi K3模型架构概述,重点介绍了其从480亿到2.8万亿参数的扩展、新的LatentMoE和注意力残差组件、移除RoPE改用NoPE,以及原生多模态支持。该模型强调推理效率,并达到前沿性能水平。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈