Edge0/Edge0-35B-A3B-preview

Hugging Face Models Trending 模型

摘要

Edge0-35B-A3B-preview 是一个稀疏的MoE模型,通过流式专家卸载和量化技术,实现移动设备上的高效AI推理,以低于3 GiB的内存达到15 tok/s的性能。

任务: 文本生成 标签: mlx, safetensors, qwen3_5_moe, moe, 边缘推理, prerouter, lora, ssd-offload, 文本生成, 对话式, 许可证: Apache-2.0, 4位, 地区: 美国
查看原文
查看缓存全文

缓存时间: 2026/09/12 08:17

Edge0/Edge0-35B-A3B-preview · Hugging Face

来源:https://huggingface.co/Edge0/Edge0-35B-A3B-preview
edge0

一个35B级别的稀疏混合专家模型,可在手机级内存中运行。

3 GiB活跃内存 · 15 tok/s · 4位量化

GitHub (https://github.com/Edge0-AI/edge0) Hugging Face (https://huggingface.co/Edge0/Edge0-35b-a3b-preview) Hugging Face (https://huggingface.co/Edge0/Edge0-8b-a1b-preview) 许可证 (https://github.com/Edge0-AI/edge0/blob/main/LICENSE)

Edge0-35b-a3b — 一个35B参数的混合专家大语言模型,通过edge0流式推理框架,可在3 GiB活跃内存内以可行速度运行。

预览状态: 这是edge0流程的早期预览版本。模型检查点以int4量化形式提供,并包含专为该框架训练的LoRA和预路由器适配器。

亮点

  • 可在手机级内存中运行:完整的4位检查点存储在存储设备上,专家模块按需流式加载,因此RAM中仅保留活跃权重——低于3 GiB,无需分片,也无需将权重预先下载到内存中。
  • 速度足够支持交互使用:解码速度达15 tok/s;长提示词填充速度为140 tok/s。
  • 量化后质量保持良好:通过Recover-LoRA蒸馏,int4模型与其fp16基线相比平均仅下降3.9分
  • 开箱即用:基础检查点、LoRA和预路由器适配器一同提供,并通过edge0自动加载。

三项机制使其成为可能:

  • SSD专家卸载:专家权重按需从存储设备流式加载——仅在被路由时获取,因此RAM仅存放活跃权重。峰值内存由活跃集大小决定,而非参数总量。
  • 预路由器:一个训练好的预测头提前一步预测专家路由,使专家加载与前向传播重叠,而非阻塞它——最高提升+59% 解码吞吐量;收益随存储延迟、模型规模和路由宽度K增加而增长。
  • Recover-LoRA:冻结int4基础模型,通过从FP教师模型蒸馏训练LoRA适配器,在4位下恢复大部分量化损失(详见下文质量部分)。适配器保持独立:一个只读基础模型可服务多套适配器。

模型摘要

项目详情
基础模型Qwen3.5-MoE 35B-A3B
量化4位
层数40
专家数/每token激活数256 / 4(K=4)
隐藏维度2048
许可证Apache 2.0
框架edge0 (GitHub(MLX后端))
内容基础检查点 + lora_edge0_35b.safetensors + prerouter_edge0_35b.safetensors

LoRA和预路由器适配器与基础检查点放置在一起,并自动加载——本仓库是edge0的一个完整、可直接运行的模型目录。

质量

所有基准测试均在相同设置和参数下使用OpenCompass由我们进行。edge0流程(int4 + 适配器)相对于fp16基线模型的损失很小:平均3.9分。满分100:

基准测试edge0-35b (int4)Qwen3.5-MoE 35B-A3B (fp16)
AIME 202686.692.7
HumanEval90.995.1
GPQA-Diamond79.881.8
MMLU-Pro81.084.6
IFBench57.961.7
平均分79.283.2

性能

在Mac mini M4 Pro(24 GB内存)上使用examples/bench.py测量:

指标数值
解码速度14.9–17.7 tok/s
预填充吞吐量(冷/热)113 / 140 tok/s
峰值活跃内存*2.9 GiB

*短上下文;长上下文会增加KV缓存。专家权重按需从SSD流式加载,不常驻内存。

用例

  • GPU显存有限且存储快速(NVMe、内置闪存)的边缘/设备端推理。
  • 在单台普通机器上批量服务——一个只读基础模型可服务多套LoRA适配器,无需重新量化。
  • 启用思考模式的多语言聊天和推理,配套聊天模板支持。

局限性

  • 预览版本:覆盖范围和质量仍在扩展;模型主要针对基础模型的语言进行了调优。
  • 智能体能力:此预览版本尚未针对智能体任务优化——工具使用、多步规划和长期自主性目前较弱。正式版将大幅增强智能体能力。
  • MLX后端目前仅针对Apple Silicon;其他后端在edge0路线图上。
  • 长上下文会增加KV缓存;使用较短上下文可将峰值内存保持在3 GiB。

快速开始

pip install -e 'git+https://github.com/Edge0-AI/edge0.git#egg=edge0[fetch]'

# 将此仓库下载到本地目录
huggingface-cli download Edge0/Edge0-35b-a3b-preview --local-dir ./Edge0-35b-a3b-preview

# 运行
export EDGE0_35B_MODEL=$PWD/Edge0-35b-a3b-preview
edge0 chat --name edge0-35b --prompt "Introduce yourself"

# 或启动兼容OpenAI的HTTP API服务
edge0 serve --name edge0-35b --port 8085

完整用法(Python API、流式选项、预路由器详情)请参阅edge0文档

许可证

Apache 2.0。详见许可证

相似文章

SpecPrefetch:面向稀疏MoE基础模型的参数高效专家预取

arXiv cs.AI

SpecPrefetch提出了一种面向稀疏MoE模型的参数高效专家预取框架,使用轻量级适配器预测下一层专家以进行异步传输,同时保留原生路由语义。在Snapdragon 8 Elite设备上,它实现了高达20%的解码吞吐量提升,展示了在内存受限部署中的实用优势。