我构建了一种新的注意力机制(Wave Field)——可在标准注意力机制内存溢出的128K上下文环境下运行,笔记本CPU上实现80+ tok/s
摘要
一位独立研究员引入了Wave Field注意力机制,用FFT波卷积替代了标准O(N²)点积注意力,实现了O(N log N)的训练效率和每token O(1)的推理效率。声称在128K上下文的CPU上达到80+ tok/s,并且在零样本性能上优于GPT-2 124M。
嘿,r/LocalLLaMA——我是一名独立研究员。我构建了一个新的注意力架构,希望寻找独立测试者。Wave Field LLM用基于场的FFT波卷积替代了O(N²)的点积注意力。训练复杂度为O(N log N)。推理时每token为O(1)——即使上下文增长,速度和内存也保持恒定。重要提示:这是一个基础的补全模型,不是聊天模型。从头训练,没有RLHF、安全调优或指令微调。
目前我测量的结果:
- 在Mac笔记本CPU上达到80+ tok/s(无需GPU进行推理)
- 128K上下文运行,标准注意力机制会内存溢出
- 模型参数从130M到1.5B
- 130M零样本(DCLM CORE)与GPT-2 124M对比:
- Wave Field平均:46.8% | GPT-2:26.5%
- PIQA:61.7% vs 50.0%
- ARC Easy:43.8% vs 25.0%
- 在32K上下文、H100上:比标准注意力快21.8倍,内存减少5.3倍
链接:
- https://github.com/badaramoni/wave-field-llm
- https://wavefieldlab.com/
- 演示:https://www.youtube.com/watch?v=zH7ICaY5iz4
期待诚实的反馈:
- 基准测试方法——合理吗?
- 与其他~130M基础模型相比质量如何?
- 有没有什么看起来不对劲的地方?
- 它会产生有害的答案
活跃研究,架构v9,专利申请中。欢迎在评论中提问。如果你测试它,请回复硬件+tok/s+一个示例补全。也欢迎坏结果。
相似文章
@tilderesearch: https://x.com/tilderesearch/status/2061771450168889432
Wall Attention 将对角遗忘门泛化到 softmax 注意力,实现了从 4k 到 160k+ 上下文的零样本最先进长度外推,并且在预训练中优于 RoPE 和 FoX。它作为即插即用的替换方案发布,附带开源的 Triton 内核。
Wall Attention(GitHub 仓库)
Wall Attention 是一种新的注意力变体,具有每个通道、每个时间步的乘法衰减,提供内容相关的遗忘率,以及在Triton中实现的高效训练/解码内核。
我发布了一个在GPT-2中等规模(约3.54亿参数,115亿token)的无softmax注意力模型:结构稀疏性+瓦片跳过内核实现长上下文显存节省。开放权重+自定义Triton内核[R]
发布了RRT-355M,一个GPT-2中等规模的无softmax注意力模型,拥有3.54亿参数,从零开始在115亿token上训练,利用结构稀疏性和瓦片跳过内核实现长上下文效率,在22个任务基准测试中达到与GPT-2中等规模相当的性能。
@VukRosic99: 长上下文Transformer面临两大瓶颈:二次注意力计算和KV缓存(在1M tokens时可达数百GB)…
MiniCPM-SALA是一款9B参数的混合注意力模型,通过在稀疏注意力和线性注意力之间交替插入(每3个线性层插入1个稀疏层)来克服长上下文Transformer的二次计算和KV缓存瓶颈。在256K tokens下,其推理速度比Qwen3-8B快3.5倍,并能在消费级GPU上支持高达1M tokens。该模型采用经济高效的持续训练方法,训练成本降低约75%。
@thtrkim: FlashAttention 的手动可视化深入讲解(使用 Excalidraw 绘制)https://winterrykim.github.io/blog/2026/training-lm-…
深入理解 FlashAttention 的可视化讲解,涵盖内存优化和算子融合,以实现语言模型训练中的高效注意力计算。