@zhaoran_wang: 对我来说,最酷的发现是你可以连接/插值所有 softmax/线性 变体,并给出一个有前途的方向……

X AI KOLs Timeline 论文

摘要

讨论了这样一个发现:所有 softmax/线性注意力变体都可以被插值,并且 Muon 优化器对于 Parallax 超越 Softmax Attention 至关重要。包含论文和代码链接。

对我来说,最酷的发现是你可以连接/插值所有 softmax/线性 变体,并给出一个有前途的方向——affine-linear : )
查看原文
查看缓存全文

缓存时间: 2026/05/30 10:33

对我来说,最酷的发现是你可以连接/插值所有 softmax/线性变体,并给出一个有前景的方向——仿射线性 : )

易飞·左 (@YifeiZuoX): 对我来说,最酷的发现是 Muon 优化器对于 Parallax 超越 Softmax 注意力至关重要。

教训——别只用 AdamW 评估新架构,你会错过那些好的。

论文:https://t.co/fMY17lRQtn 代码:https://t.co/LVBjxCiVVW

对于起源……

相似文章

@Phoenixyin13: 我认为这是ICML 2026里的上乘工作。 传统 Transformer 的 Attention 机制,本质上是点对点匹配,把输入切成一堆 token,即离散点,然后算 Query 和 Key 的相似度,再加权 Value。 这在 NLP…

X AI KOLs Timeline

介绍ICML 2026论文Functional Attention,将函数作为第一公民,用结构化线性算子替代softmax点对点相似度,解决传统Transformer处理连续函数时离散化、分辨率敏感和计算复杂度高的问题,在PDE求解、3D分割等任务上达到或超过SOTA,并具良好OOD泛化能力。

线性注意力架构:机制、权衡与跨层路由

arXiv cs.LG

本文对比了softmax注意力与四种线性注意力架构(DeltaNet、Gated DeltaNet、Kimi Delta Attention、Gated DeltaNet-2),并介绍了跨层路由机制。在350M参数规模的实验表明,使用Muon优化器的Kimi Delta Attention取得了最低的验证损失,而使用AdamW的纯Gated DeltaNet吞吐量最高。