标签
一位独立研究员引入了Wave Field注意力机制,用FFT波卷积替代了标准O(N²)点积注意力,实现了O(N log N)的训练效率和每token O(1)的推理效率。声称在128K上下文的CPU上达到80+ tok/s,并且在零样本性能上优于GPT-2 124M。