功能注意力:从成对亲和性到功能对应关系

Hugging Face Daily Papers 论文

摘要

功能注意力是一种新颖的注意力机制,它将注意力重新解释为自适应基之间的功能对应关系,用受几何功能映射启发的结构化线性算子取代了softmax亲和性。该方法在包括PDE求解和3D分割在内的算子学习任务上实现了最先进的性能,同时保持了分辨率不变性。

学习无限维函数空间之间的映射(即算子学习)对于许多机器学习应用至关重要。尽管基于Transformer的算子很流行,但它们通常依赖于逐token的注意力。这些方法将连续场视为离散token,通常忽略了全局函数结构。我们引入了功能注意力,它将注意力重新解释为自适应基之间的功能对应关系。受几何功能映射的启发,我们的方法用结构化的线性算子取代了softmax亲和性。这产生了一种紧凑、可泛化、分辨率不变的表示,显式地捕捉全局依赖关系。实验表明,功能注意力在许多算子学习任务(包括求解PDE、3D分割和回归)中能够达到最先进的性能,同时对于不同的离散化保持鲁棒性。项目页面可在 https://github.com/xjffff/FUNCATTN 获取。
查看原文

相似文章

@Phoenixyin13: 我认为这是ICML 2026里的上乘工作。 传统 Transformer 的 Attention 机制,本质上是点对点匹配,把输入切成一堆 token,即离散点,然后算 Query 和 Key 的相似度,再加权 Value。 这在 NLP…

X AI KOLs Timeline

介绍ICML 2026论文Functional Attention,将函数作为第一公民,用结构化线性算子替代softmax点对点相似度,解决传统Transformer处理连续函数时离散化、分辨率敏感和计算复杂度高的问题,在PDE求解、3D分割等任务上达到或超过SOTA,并具良好OOD泛化能力。

重新思考高效注意力在混合架构中的作用

arXiv cs.CL

本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。

注意力的路由与过滤结构

arXiv cs.LG

本文将注意力交互矩阵分解为路由(反对称)和过滤(对称)两个组成部分,并引入 S-D 注意力以解耦它们。揭示了路由中的谱级联现象,可预测注意力简化的位置,从而在极小困惑度损失下实现显著的参数减少。