我在一台6GB RTX 4050笔记本上尝试运行1.56TB MoE模型,结果如下

Reddit r/LocalLLaMA 新闻

摘要

在配备6GB RTX 4050的笔记本上测试1.56TB混合专家模型,需借助NVMe进行修补式内存流式传输,解码速度达到0.106 tokens/s。

## 测试平台配置 我在一台廉价游戏笔记本上尝试运行了一个庞大的1.56TB混合专家(MoE)检查点(96分片,93层,每层896个专家,约4.46比特/参数 MXFP4)。 **笔记本电脑**:HP Victus 15 **GPU**:NVIDIA RTX 4050 Laptop(6GB GDDR6,96位接口,带宽192 GB/s,Ada Lovelace AD107) **系统内存**:16GB DDR4(双通道) **存储**:原装PCIe 4.0 NVMe固态硬盘(实测顺序读取约3,500 MB/s) **可用快速内存预算**:总计约19GB(操作系统开销后可用RAM约13.5GB + 可用VRAM约5.5GB) **硬件背景**:RTX 4050采用第4代Tensor Core。由于缺乏原生MXFP4硬件加速(该功能随50系列/Blackwell推出),引擎会在Tensor Core执行前将MXFP4权重反量化回FP16/INT8。 ## 第一次运行:标准引擎架构(开箱即用) **结果**:在第1个Token之前硬崩溃/内存不足(OOM) 在默认引擎配置下,密集注意力权重和共享参数永久驻留于RAM,而稀疏专家权重从NVMe流式传输。 **所需驻留内存**:约40GB(4位精度) **可用内存**:约19GB 引擎在初始内存映射阶段立即触发内存不足分配错误,并在处理任何提示Token前终止。 ## 第二次运行:修补版引擎(从SSD流式传输密集权重) 为了强制模型在16GB RAM上执行,我修补了运行时,将RAM纯粹视为薄LRU缓存,迫使引擎将未缓存的密集权重和注意力层与活跃专家一起直接从NVMe流式传输。 **实际基准测试数据**: - 初始加载与内存映射时间:5分42秒(主要由96个分片文件的mmap开销和头部解析主导) - 预填充(7-token提示):11.8秒(所有位置逐层加载权重一次) - 解码速度:9.4秒/token(约0.106 tok/s) **瓶颈所在**: 每个Token需要交换以下数据(8个活跃专家/层 × 93层): - 活跃专家:8 × 93 × ~18MB ≈ 13.4GB - 未缓存的密集/注意力权重:≈ 19.6GB - 每个Token的总磁盘I/O:~33GB 原装NVMe的持续读取速度上限为3.5 GB/s,整个生成过程中驱动器100%处于活跃状态。 (注:由于英语不是我的母语,我使用Grammarly进行了格式校对。)
查看原文

相似文章

Rotary GPU:在有限显存下探索大型MoE模型的本地执行

Hacker News Top

本文介绍了Rotary GPU,一种探索性的执行方法,能够在有限显存的消费级硬件上运行大型混合专家(MoE)模型,在配备8GB显存的RTX 4060上达到21 tokens/s的速度。该方法关注部署的可行性而非架构改进。