@gurtej__gill_: Kimi 团队在三月份写了一篇非常巧妙的论文,修复了我们似乎已经接受的一个基本缺陷……

X AI KOLs Timeline 论文

摘要

Kimi 团队的论文 'Attention Residuals'(AttnRes)将 Transformer 中的均匀残差连接替换为基于深度的 softmax 注意力,使每一层能够动态选择先前的表示。该模型在 1.4 万亿个 token 上预训练,拥有 48B 参数,稳定了隐藏状态,并显著提升了推理任务的表现。

Kimi 团队在三月份写了一篇非常巧妙的论文,修复了我们在 Transformer 设计中几乎已经接受的一个基本缺陷:“Uniform Residual Connections”。 目前,我们盲目地将每一层的输出以完全相同的权重相加,这导致随着网络加深,早期层的特征被完全稀释。 他们的论文“Attention Residuals”(AttnRes)用基于深度维度的 softmax 注意力取代了这种生硬的加法。 它使每一层能够动态回顾,只抓取它真正需要的特定早期表示。 为了防止内存随着规模扩大而爆炸,他们设计了“Block AttnRes”,你可以在论文中看到。 它将层分组为块,使注意力步骤仅在这些宏观层面上运行。 他们实际上在 1.4 万亿个 token 上预训练了该模型,使用了 48B 参数的 Kimi Linear 模型,这完全稳定了隐藏状态的增长,同时极大地提升了重度推理任务的性能。 这很好地提醒我们,调整信息在网络中的流动方式可能比单纯增加计算量更强大。 在此阅读全文: https://arxiv.org/pdf/2603.15031
查看原文
查看缓存全文

缓存时间: 2026/07/04 08:41

Kimi 团队在三月份发表了一篇非常巧妙的论文,修复了我们在Transformer设计中一直默默接受的一个根本缺陷:“统一残差连接”(Uniform Residual Connections)。

目前,我们只是把每一层的输出用完全相同的权重盲目相加,随着网络加深,早期层的特征会被严重稀释。

他们的论文“注意力残差”(AttnRes)用沿深度维度的softmax注意力替代了这种僵硬的加法。

这让每一层能够动态回看,只抓取它实际需要的特定早期表示。

为了在规模扩展时避免内存爆炸,他们设计了“块级注意力残差”(Block AttnRes),论文中有详细说明。

它将层级分组为块,这样注意力步骤只在那些宏观级别之间运行。

他们实际上使用一个48B参数的Kimi Linear模型在1.4万亿个token上进行了预训练,完全稳定了隐藏状态的增长,同时显著提升了重型推理任务的表现。

这很好地提醒了我们,调整网络中信息的流动方式,可能比简单投入更多计算资源要强大得多。

阅读全文: https://arxiv.org/pdf/2603.15031


无标题文档

来源:https://arxiv.org/html/2603.15031 实验性支持,请查看构建日志(https://arxiv.org/html/2603.15031v1/__stdout.txt)了解错误信息。由LATExml[LOGO] 生成。

错误报告说明

我们正在持续改进论文的HTML版本,您的反馈有助于增强可访问性和移动端支持。要报告帮助我们改进转换和渲染的HTML错误,请选择以下任一方式:

  • 点击页面顶部的“报告问题“(Report Issue)按钮。

提示: 您可以先选中相关文本,以便将其包含在您的报告中。

我们的团队已经确认了以下问题(https://github.com/arXiv/html_feedback/issues)。感谢您花时间审查并报告我们可能尚未发现的渲染错误。您的努力将帮助我们改善所有人的HTML版本,因为残疾不应成为获取研究的障碍。感谢您继续支持并倡导开放获取。

有空余的开发周期?来帮助arXiv提升无障碍性吧!我们的合作方LaTeXML维护着一个需要转换的软件包列表(https://github.com/brucemiller/LaTeXML/wiki/Porting-LaTeX-packages-for-LaTeXML),并欢迎开发者的贡献(https://github.com/brucemiller/LaTeXML/issues)。

相似文章

你也能提出Kimi Delta Attention

Hacker News Top

这篇博客文章逐步推导了从标准softmax注意力经过线性注意力和DeltaNet变体到Kimi Delta Attention的过程,并解释了近期Qwen和Kimi模型使用的状态更新方程。

Kimi-K3 技术报告 [pdf]

Hacker News Top

MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。