INT3 压缩与融合 Metal 内核 [R]
摘要
独立研究者发布了 Spiral,这是一款专为 Apple Silicon 设计、利用自定义融合 Metal 内核将大语言模型(LLM)压缩至 INT3、KV 缓存压缩至 INT2 的工具,目前已提供 Qwen-7B 预览版。
大家好,我是一名研究员兼独立创始人。我的模型压缩方案在 INT3 精度下仅增加 +0.14 nats 的困惑度损耗,并且我为长序列任务专门构建了 2 位 KV 缓存。我已经为 Mac(M 系列芯片)推出了同时集成 INT3 模型与 INT2 KV 缓存的版本,底层采用自定义的融合 Metal 内核。目前 Qwen 7B 已开放预览版。
#install brew install reinforceai/spiral/spiral
#chat spiral-chat
我正在进一步开展内核优化工作,并正开发支持 GPU 的 Triton 内核。当前的压缩打包仍有更大的效率提升空间,很快我会分享更多模型的支持。非常欢迎大家提供任何反馈,或推荐任意参数规模在 100B 以内希望我尝试压缩的模型。
[github.com/ReinforceAI/spiral](http://github.com/ReinforceAI/spiral)
相似文章
我移植了EXL3使其在Apple Silicon上良好运行 - PonyExl3
将EXL3 LLM编解码器移植到Apple Silicon上通过Metal运行,在M5 Max上实现了高预填充和生成速度(例如,~600 tok/s预填充,不同模型下17-80 tok/s生成)。
llama.cpp Metal MoE 优化
一位开发者分享了针对 llama.cpp 的 Metal 优化方案,可提升 Apple Silicon 上 IQ3_XXS 模型的解码速度,并在 GitHub 提交了拉取请求,呼吁社区参与测试。
Metal-Sci:用于 Apple Silicon 上 LLM 驱动演化内核搜索的科学计算基准
Metal-Sci 推出了一项包含 10 个任务的基准测试,用于优化 Apple Silicon 上的科学计算内核,并配套了由大语言模型驱动的演化搜索框架。该研究评估了 Claude Opus 4.7、Gemini 3.1 Pro 和 GPT 5.5 等模型,在实现显著加速的同时,利用分布外测试来捕获静默的性能退化问题。
Qwen3.6-35B-A3B-Abliterated-Heretic-MLX-4bit
用户评价了通过MLX为Apple Silicon优化的Qwen3.6-35B模型的量化微调版本,称赞其速度快、智能化程度高且没有安全免责声明。
优化Apple Silicon设备端推理(20分钟阅读)
Apple的Lily引擎通过利用统一内存和硬件,优化了Apple silicon上的设备端LLM推理,性能超越MLX-LM,并针对Qwen3.6-35B-A3B模型架构进行了调优。