AFM3 20B 的特殊架构:指令跟随剪枝

Reddit r/LocalLLaMA 模型

摘要

讨论了苹果的 AFM3 20B 模型架构,该架构使用指令跟随剪枝(Instruction-Following Pruning),每个提示仅激活约 20% 的 MLP 层,并将模型存储在闪存中,以实现高效的设备端推理。

https://openreview.net/forum?id=juARG7yu4P 这是一个专为仅激活约 20% MLP 层而设计的模型。它也是一个 MoE,因此具有一些内置的稀疏性。它从头开始训练,每个提示使用相同的专家,而不是按 token 或逐层切换。模型中大约三分之二的活动参数是 FFN/MLP 专家权重,因此在读取带宽性能方面,一个 30B 活动的 MoE 相当于一个 14B 活动的模型。一个 9B 的稠密模型变成了 3B 的活动模型。这似乎与最近分享的一个想法相似:Session-Adaptive Orthogonal Distillation,来自一位似乎是 Qwen 组织成员的人。这两种方法都依赖于输入进行剪枝,并且都可能在生成长输出时存在某种可以恢复的延迟。https://thenextweb.com/news/apple-third-generation-foundation-models-afm 苹果的诀窍是将整个模型保存在闪存中,而不是保存在小得多的内存池中。使用其研究人员称为“指令跟随剪枝”的技术,该模型对每个提示仅做一次路由决策,只将一小部分“专家”参数加载到内存中,每次加载 10 亿到 40 亿个参数,同时始终保持一组核心共享专家在线。
查看原文

相似文章

LiquidAI/LFM2.5-2.6B

Hugging Face Models Trending

Liquid AI released LFM2.5-2.6B, a 2.6B-parameter hybrid model optimized for on-device deployment with 128K context, agentic post-training, and fast inference (220 tok/s on Apple M5 Max) under 2.5GB memory.

Apple M3 Ultra上实时扩散模型推理的系统优化

arXiv cs.LG

本文对Apple M3 Ultra上的实时扩散模型推理进行了系统优化研究,通过CoreML转换和蒸馏模型在512x512分辨率下达到了22.7 FPS,揭示了针对CUDA优化的技术无法直接迁移到Apple统一内存架构。

SpecPrefetch:面向稀疏MoE基础模型的参数高效专家预取

arXiv cs.AI

SpecPrefetch提出了一种面向稀疏MoE模型的参数高效专家预取框架,使用轻量级适配器预测下一层专家以进行异步传输,同时保留原生路由语义。在Snapdragon 8 Elite设备上,它实现了高达20%的解码吞吐量提升,展示了在内存受限部署中的实用优势。