我在一台6GB RTX 4050笔记本上尝试运行1.56TB MoE模型,结果如下
摘要
在配备6GB RTX 4050的笔记本上测试1.56TB混合专家模型,需借助NVMe进行修补式内存流式传输,解码速度达到0.106 tokens/s。
## 测试平台配置
我在一台廉价游戏笔记本上尝试运行了一个庞大的1.56TB混合专家(MoE)检查点(96分片,93层,每层896个专家,约4.46比特/参数 MXFP4)。
**笔记本电脑**:HP Victus 15
**GPU**:NVIDIA RTX 4050 Laptop(6GB GDDR6,96位接口,带宽192 GB/s,Ada Lovelace AD107)
**系统内存**:16GB DDR4(双通道)
**存储**:原装PCIe 4.0 NVMe固态硬盘(实测顺序读取约3,500 MB/s)
**可用快速内存预算**:总计约19GB(操作系统开销后可用RAM约13.5GB + 可用VRAM约5.5GB)
**硬件背景**:RTX 4050采用第4代Tensor Core。由于缺乏原生MXFP4硬件加速(该功能随50系列/Blackwell推出),引擎会在Tensor Core执行前将MXFP4权重反量化回FP16/INT8。
## 第一次运行:标准引擎架构(开箱即用)
**结果**:在第1个Token之前硬崩溃/内存不足(OOM)
在默认引擎配置下,密集注意力权重和共享参数永久驻留于RAM,而稀疏专家权重从NVMe流式传输。
**所需驻留内存**:约40GB(4位精度)
**可用内存**:约19GB
引擎在初始内存映射阶段立即触发内存不足分配错误,并在处理任何提示Token前终止。
## 第二次运行:修补版引擎(从SSD流式传输密集权重)
为了强制模型在16GB RAM上执行,我修补了运行时,将RAM纯粹视为薄LRU缓存,迫使引擎将未缓存的密集权重和注意力层与活跃专家一起直接从NVMe流式传输。
**实际基准测试数据**:
- 初始加载与内存映射时间:5分42秒(主要由96个分片文件的mmap开销和头部解析主导)
- 预填充(7-token提示):11.8秒(所有位置逐层加载权重一次)
- 解码速度:9.4秒/token(约0.106 tok/s)
**瓶颈所在**:
每个Token需要交换以下数据(8个活跃专家/层 × 93层):
- 活跃专家:8 × 93 × ~18MB ≈ 13.4GB
- 未缓存的密集/注意力权重:≈ 19.6GB
- 每个Token的总磁盘I/O:~33GB
原装NVMe的持续读取速度上限为3.5 GB/s,整个生成过程中驱动器100%处于活跃状态。
(注:由于英语不是我的母语,我使用Grammarly进行了格式校对。)
相似文章
在老款GTX 1080(8GB显存,128k上下文)上,约30B的MoE模型达到24+ tok/s的推理速度
一位开发者展示了如何使用llama.cpp,通过MoE卸载和TurboQuant KV缓存量化技术,在老款GTX 1080(8GB显存)上以128k上下文运行Qwen 3.6 35B-A3B和Gemma 4 26B-A4B等MoE模型,达到24+ tok/s的推理速度,并揭示了针对Gemma MTP投机解码的优化技巧。
在搭载RTX 4060(8GB)的笔记本电脑上运行Qwen3.6-35B-A3B——哪些有效、哪些无效以及一个令人意外的推测解码结果
详细记录了在8GB笔记本GPU上运行Qwen3.6-35B-A3B MoE模型的经历,涵盖有效优化(如--no-mmap和VRAM余量)、意料之外的发现(推测解码相比基准测试提升26%的速度)以及Windows和CPU瓶颈的陷阱。
@analogalok:我的8GB显存游戏本肯定会恨我这么做,但我还是做了。跑了一个31B稠密模型(Gemma 4…
用户在8GB显存的游戏本上,使用llama.cpp配合MTP推测解码,以约3 tokens/s的速度运行了Gemma 4 31B稠密模型,展示了在消费级硬件上运行31B稠密模型的可行性,并提出了智能体工作流程:快速MoE模型将困难任务路由给这个较慢的稠密模型。
我通过从SSD流式传输MoE专家权重,在36 GB MacBook上运行35B–480B编码模型——自包含应用,并且我也公开了那些*失败*的基准测试
Slipstream 通过从SSD而非RAM流式传输MoE专家权重,使得在36 GB MacBook上运行大型编码模型(35B–480B)成为可能。基准测试显示,35B模型约13–19 tok/s,118B模型约2.8 tok/s,并诚实报告了失败的方法。
Rotary GPU:在有限显存下探索大型MoE模型的本地执行
本文介绍了Rotary GPU,一种探索性的执行方法,能够在有限显存的消费级硬件上运行大型混合专家(MoE)模型,在配备8GB显存的RTX 4060上达到21 tokens/s的速度。该方法关注部署的可行性而非架构改进。