@gurtej__gill_: Kimi 团队在三月份写了一篇非常巧妙的论文,修复了我们似乎已经接受的一个基本缺陷……
摘要
Kimi 团队的论文 'Attention Residuals'(AttnRes)将 Transformer 中的均匀残差连接替换为基于深度的 softmax 注意力,使每一层能够动态选择先前的表示。该模型在 1.4 万亿个 token 上预训练,拥有 48B 参数,稳定了隐藏状态,并显著提升了推理任务的表现。
查看缓存全文
缓存时间: 2026/07/04 08:41
Kimi 团队在三月份发表了一篇非常巧妙的论文,修复了我们在Transformer设计中一直默默接受的一个根本缺陷:“统一残差连接”(Uniform Residual Connections)。
目前,我们只是把每一层的输出用完全相同的权重盲目相加,随着网络加深,早期层的特征会被严重稀释。
他们的论文“注意力残差”(AttnRes)用沿深度维度的softmax注意力替代了这种僵硬的加法。
这让每一层能够动态回看,只抓取它实际需要的特定早期表示。
为了在规模扩展时避免内存爆炸,他们设计了“块级注意力残差”(Block AttnRes),论文中有详细说明。
它将层级分组为块,这样注意力步骤只在那些宏观级别之间运行。
他们实际上使用一个48B参数的Kimi Linear模型在1.4万亿个token上进行了预训练,完全稳定了隐藏状态的增长,同时显著提升了重型推理任务的表现。
这很好地提醒了我们,调整网络中信息的流动方式,可能比简单投入更多计算资源要强大得多。
阅读全文: https://arxiv.org/pdf/2603.15031
无标题文档
来源:https://arxiv.org/html/2603.15031
实验性支持,请查看构建日志(https://arxiv.org/html/2603.15031v1/__stdout.txt)了解错误信息。由LATExml 生成。
错误报告说明
我们正在持续改进论文的HTML版本,您的反馈有助于增强可访问性和移动端支持。要报告帮助我们改进转换和渲染的HTML错误,请选择以下任一方式:
- 点击页面顶部的“报告问题“(Report Issue)按钮。
提示: 您可以先选中相关文本,以便将其包含在您的报告中。
我们的团队已经确认了以下问题(https://github.com/arXiv/html_feedback/issues)。感谢您花时间审查并报告我们可能尚未发现的渲染错误。您的努力将帮助我们改善所有人的HTML版本,因为残疾不应成为获取研究的障碍。感谢您继续支持并倡导开放获取。
有空余的开发周期?来帮助arXiv提升无障碍性吧!我们的合作方LaTeXML维护着一个需要转换的软件包列表(https://github.com/brucemiller/LaTeXML/wiki/Porting-LaTeX-packages-for-LaTeXML),并欢迎开发者的贡献(https://github.com/brucemiller/LaTeXML/issues)。
相似文章
Kimi Linear: 一种富有表现力且高效的注意力架构
Kimi Linear 提出了一种新的线性注意力架构,旨在增强Transformer模型的表达能力和效率,由 Moonshot AI 的 Kimi 团队贡献。
你也能提出Kimi Delta Attention
这篇博客文章逐步推导了从标准softmax注意力经过线性注意力和DeltaNet变体到Kimi Delta Attention的过程,并解释了近期Qwen和Kimi模型使用的状态更新方程。
@antoniolupetti: 《理解Transformer与注意力机制》是一篇非常有趣的论文,它从应用数学的角度介绍了Transformer架构…
一条推文重点介绍了一篇由Michel Fabrice Serret撰写的arXiv论文,该论文从应用数学的角度介绍了Transformer和注意力机制,涵盖了向量化、多头注意力以及降低注意力成本的方法,如KV缓存和Latent Attention。
Kimi-K3 技术报告 [pdf]
MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。
@thealexker: Kimi-K3 发布中未被充分重视的亮点:> 早期 K3 编写了后期开发阶段的大部分内核 > 它…
Kimi.ai 发布了 Kimi K3,一个拥有 2.8 万亿参数的多模态模型,支持 100 万上下文,采用了新颖的 Delta Attention 和 Attention Residuals,以及包含 MiniTriton 编译器的自优化堆栈。该模型实现了最高 6.3 倍的解码速度提升和约 25% 的训练效率提升。