Edge0/Edge0-35B-A3B-preview
摘要
Edge0-35B-A3B-preview 是一个稀疏的MoE模型,通过流式专家卸载和量化技术,实现移动设备上的高效AI推理,以低于3 GiB的内存达到15 tok/s的性能。
查看缓存全文
缓存时间: 2026/09/12 08:17
Edge0/Edge0-35B-A3B-preview · Hugging Face
来源:https://huggingface.co/Edge0/Edge0-35B-A3B-preview
edge0
一个35B级别的稀疏混合专家模型,可在手机级内存中运行。
3 GiB活跃内存 · 15 tok/s · 4位量化
GitHub (https://github.com/Edge0-AI/edge0) Hugging Face (https://huggingface.co/Edge0/Edge0-35b-a3b-preview) Hugging Face (https://huggingface.co/Edge0/Edge0-8b-a1b-preview) 许可证 (https://github.com/Edge0-AI/edge0/blob/main/LICENSE)
Edge0-35b-a3b — 一个35B参数的混合专家大语言模型,通过edge0流式推理框架,可在3 GiB活跃内存内以可行速度运行。
预览状态: 这是edge0流程的早期预览版本。模型检查点以int4量化形式提供,并包含专为该框架训练的LoRA和预路由器适配器。
亮点
- 可在手机级内存中运行:完整的4位检查点存储在存储设备上,专家模块按需流式加载,因此RAM中仅保留活跃权重——低于3 GiB,无需分片,也无需将权重预先下载到内存中。
- 速度足够支持交互使用:解码速度达15 tok/s;长提示词填充速度为140 tok/s。
- 量化后质量保持良好:通过Recover-LoRA蒸馏,int4模型与其fp16基线相比平均仅下降3.9分。
- 开箱即用:基础检查点、LoRA和预路由器适配器一同提供,并通过
edge0自动加载。
三项机制使其成为可能:
- SSD专家卸载:专家权重按需从存储设备流式加载——仅在被路由时获取,因此RAM仅存放活跃权重。峰值内存由活跃集大小决定,而非参数总量。
- 预路由器:一个训练好的预测头提前一步预测专家路由,使专家加载与前向传播重叠,而非阻塞它——最高提升+59% 解码吞吐量;收益随存储延迟、模型规模和路由宽度K增加而增长。
- Recover-LoRA:冻结int4基础模型,通过从FP教师模型蒸馏训练LoRA适配器,在4位下恢复大部分量化损失(详见下文质量部分)。适配器保持独立:一个只读基础模型可服务多套适配器。
模型摘要
| 项目 | 详情 |
|---|---|
| 基础模型 | Qwen3.5-MoE 35B-A3B |
| 量化 | 4位 |
| 层数 | 40 |
| 专家数/每token激活数 | 256 / 4(K=4) |
| 隐藏维度 | 2048 |
| 许可证 | Apache 2.0 |
| 框架 | edge0 (GitHub(MLX后端)) |
| 内容 | 基础检查点 + lora_edge0_35b.safetensors + prerouter_edge0_35b.safetensors |
LoRA和预路由器适配器与基础检查点放置在一起,并自动加载——本仓库是edge0的一个完整、可直接运行的模型目录。
质量
所有基准测试均在相同设置和参数下使用OpenCompass由我们进行。edge0流程(int4 + 适配器)相对于fp16基线模型的损失很小:平均3.9分。满分100:
| 基准测试 | edge0-35b (int4) | Qwen3.5-MoE 35B-A3B (fp16) |
|---|---|---|
| AIME 2026 | 86.6 | 92.7 |
| HumanEval | 90.9 | 95.1 |
| GPQA-Diamond | 79.8 | 81.8 |
| MMLU-Pro | 81.0 | 84.6 |
| IFBench | 57.9 | 61.7 |
| 平均分 | 79.2 | 83.2 |
性能
在Mac mini M4 Pro(24 GB内存)上使用examples/bench.py测量:
| 指标 | 数值 |
|---|---|
| 解码速度 | 14.9–17.7 tok/s |
| 预填充吞吐量(冷/热) | 113 / 140 tok/s |
| 峰值活跃内存* | 2.9 GiB |
*短上下文;长上下文会增加KV缓存。专家权重按需从SSD流式加载,不常驻内存。
用例
- GPU显存有限且存储快速(NVMe、内置闪存)的边缘/设备端推理。
- 在单台普通机器上批量服务——一个只读基础模型可服务多套LoRA适配器,无需重新量化。
- 启用思考模式的多语言聊天和推理,配套聊天模板支持。
局限性
- 预览版本:覆盖范围和质量仍在扩展;模型主要针对基础模型的语言进行了调优。
- 智能体能力:此预览版本尚未针对智能体任务优化——工具使用、多步规划和长期自主性目前较弱。正式版将大幅增强智能体能力。
- MLX后端目前仅针对Apple Silicon;其他后端在edge0路线图上。
- 长上下文会增加KV缓存;使用较短上下文可将峰值内存保持在3 GiB。
快速开始
pip install -e 'git+https://github.com/Edge0-AI/edge0.git#egg=edge0[fetch]'
# 将此仓库下载到本地目录
huggingface-cli download Edge0/Edge0-35b-a3b-preview --local-dir ./Edge0-35b-a3b-preview
# 运行
export EDGE0_35B_MODEL=$PWD/Edge0-35b-a3b-preview
edge0 chat --name edge0-35b --prompt "Introduce yourself"
# 或启动兼容OpenAI的HTTP API服务
edge0 serve --name edge0-35b --port 8085
完整用法(Python API、流式选项、预路由器详情)请参阅edge0文档。
许可证
Apache 2.0。详见许可证。
相似文章
内存墙的另一半:使用训练路由预测从SSD服务35B MoE模型
Edge0是一个流式MoE推理引擎,它使用训练路由预测从SSD服务35B混合专家模型,在消费级硬件上实现接近fp16的性能,且内存使用率低。
FreeToken: 高效边缘原生 MoE 服务(24分钟阅读)
FreeToken 是一个边缘原生的 Mixture of Experts 服务系统,通过自适应管理异构边缘设备的资源,高效地在消费级硬件上运行大型开源权重模型。
我以为在标准智能手机上运行大规模模型已经非常了不起了,但
bigedgeonmoe开源代码库的创建者使得在移动设备和消费级PC上运行大规模MoE模型(高达120B参数)成为可能,在中端手机上实现了Qwen 35B模型每秒6个token的速度。
在Zeus(小米12 Pro,12GB RAM)上运行Qwen 3.6 35B MoE(Q4_K_M)
演示在搭载12GB RAM的小米12 Pro上以Q4_K_M量化方式运行Qwen 3.6 35B MoE模型,展示了在移动设备上进行本地AI推理。
SpecPrefetch:面向稀疏MoE基础模型的参数高效专家预取
SpecPrefetch提出了一种面向稀疏MoE模型的参数高效专家预取框架,使用轻量级适配器预测下一层专家以进行异步传输,同时保留原生路由语义。在Snapdragon 8 Elite设备上,它实现了高达20%的解码吞吐量提升,展示了在内存受限部署中的实用优势。