@awnihannun: 苹果在设备端部署了200亿参数的模型,这非常酷。你无法以任何合理的精度将200亿参数放入RAM中…
摘要
苹果发布了一款200亿参数的端侧模型,采用MoE变体,每次查询仅选择一次专家以放入NAND,从而在RAM受限的情况下实现推理。
苹果在设备端部署了200亿参数模型,这非常酷。
你无法以任何合理的精度将200亿参数放入RAM。为了使其工作,他们采用了当今标准下相当独特的架构。
一个小模型根据查询(或提示)预测应从NAND加载哪些专家到RAM。与典型MoE的关键区别在于,你每次查询只执行一次此操作,然后使用相同的专家生成所有token(而不是为每个token切换专家)。
查看缓存全文
缓存时间: 2026/06/09 08:57
这非常酷——苹果发布了一款拥有200亿参数的端侧模型。
通常,你无法在内存中以任何合理的精度容纳200亿参数。为了实现这一点,他们采用了当前标准下相当非主流的架构。
一个小模型会根据查询(或提示)预测从闪存加载哪些专家到内存中。与典型混合专家模型的关键区别在于,你在每次查询时只执行一次这个操作,然后使用相同的专家生成所有令牌(而不是为每个令牌切换专家)。
相似文章
@berryxia: Apple 一直其实在赌端侧模型的应用! 统一架构内存就是端侧模型的天然温床! 统一内存也就是,内存即显存。 也看到越来越多的优秀端侧模型出现。 OpenBMB 把 MiniCPM-V 4.6 这个 1.3B 的多模态模型放出来了,我看完…
OpenBMB 发布了 MiniCPM-V 4.6,一个 1.3B 参数的多模态模型,通过高分辨率视觉处理和高效压缩技术,在消费级硬件和手机上实现快速推理,性能超过同类大模型,且全面开源支持多种推理和量化框架。
Show HN:在 Mac 上仅用 4.3 GB 内存运行 80B Qwen,以及在 iPhone 上运行 35B
演示了在 Mac 上仅用 4.3 GB 内存运行 80B Qwen 模型,以及在 iPhone 上运行 35B 模型,展示了本地 LLM 推理的极致内存优化。
优化Apple Silicon设备端推理(20分钟阅读)
Apple的Lily引擎通过利用统一内存和硬件,优化了Apple silicon上的设备端LLM推理,性能超越MLX-LM,并针对Qwen3.6-35B-A3B模型架构进行了调优。
我如何仅用24GB内存运行193B参数模型
介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。
我们迫切需要一款80-160B的模型。统一内存设备市场需要更多模型。
作者认为,当前迫切需要80-160B参数范围的AI模型,以支持使用统一内存设备的用户(例如高内存的Apple/AMD系统),因为最近的模型对于他们的硬件来说要么太小,要么太大。