我构建了一种新的注意力机制(Wave Field)——可在标准注意力机制内存溢出的128K上下文环境下运行,笔记本CPU上实现80+ tok/s

Reddit r/LocalLLaMA 论文

摘要

一位独立研究员引入了Wave Field注意力机制,用FFT波卷积替代了标准O(N²)点积注意力,实现了O(N log N)的训练效率和每token O(1)的推理效率。声称在128K上下文的CPU上达到80+ tok/s,并且在零样本性能上优于GPT-2 124M。

嘿,r/LocalLLaMA——我是一名独立研究员。我构建了一个新的注意力架构,希望寻找独立测试者。Wave Field LLM用基于场的FFT波卷积替代了O(N²)的点积注意力。训练复杂度为O(N log N)。推理时每token为O(1)——即使上下文增长,速度和内存也保持恒定。重要提示:这是一个基础的补全模型,不是聊天模型。从头训练,没有RLHF、安全调优或指令微调。 目前我测量的结果: - 在Mac笔记本CPU上达到80+ tok/s(无需GPU进行推理) - 128K上下文运行,标准注意力机制会内存溢出 - 模型参数从130M到1.5B - 130M零样本(DCLM CORE)与GPT-2 124M对比: - Wave Field平均:46.8% | GPT-2:26.5% - PIQA:61.7% vs 50.0% - ARC Easy:43.8% vs 25.0% - 在32K上下文、H100上:比标准注意力快21.8倍,内存减少5.3倍 链接: - https://github.com/badaramoni/wave-field-llm - https://wavefieldlab.com/ - 演示:https://www.youtube.com/watch?v=zH7ICaY5iz4 期待诚实的反馈: - 基准测试方法——合理吗? - 与其他~130M基础模型相比质量如何? - 有没有什么看起来不对劲的地方? - 它会产生有害的答案 活跃研究,架构v9,专利申请中。欢迎在评论中提问。如果你测试它,请回复硬件+tok/s+一个示例补全。也欢迎坏结果。
查看原文

相似文章

Wall Attention(GitHub 仓库)

TLDR AI

Wall Attention 是一种新的注意力变体,具有每个通道、每个时间步的乘法衰减,提供内容相关的遗忘率,以及在Triton中实现的高效训练/解码内核。

我发布了一个在GPT-2中等规模(约3.54亿参数,115亿token)的无softmax注意力模型:结构稀疏性+瓦片跳过内核实现长上下文显存节省。开放权重+自定义Triton内核[R]

Reddit r/MachineLearning

发布了RRT-355M,一个GPT-2中等规模的无softmax注意力模型,拥有3.54亿参数,从零开始在115亿token上训练,利用结构稀疏性和瓦片跳过内核实现长上下文效率,在22个任务基准测试中达到与GPT-2中等规模相当的性能。

@VukRosic99: 长上下文Transformer面临两大瓶颈:二次注意力计算和KV缓存(在1M tokens时可达数百GB)…

X AI KOLs Timeline

MiniCPM-SALA是一款9B参数的混合注意力模型,通过在稀疏注意力和线性注意力之间交替插入(每3个线性层插入1个稀疏层)来克服长上下文Transformer的二次计算和KV缓存瓶颈。在256K tokens下,其推理速度比Qwen3-8B快3.5倍,并能在消费级GPU上支持高达1M tokens。该模型采用经济高效的持续训练方法,训练成本降低约75%。