标签
本文解释了如何仅用64GB RAM本地运行DeepSeek-V4.1-Flash 763B模型,通过将200GB Engram卸载到NVMe并使用DSpark,在4块Max-Q卡上实现200 TPS。
LazyTrain 是一个研究系统,通过将检查点选择、激活放置、重计算以及 CPU-GPU-NVMe 通信重叠建模为混合整数调度问题,优化有限硬件上的大语言模型训练,相比匹配基线实现了约 1.24 倍的 TFLOPS 提升。
SpecPrefetch提出了一种面向稀疏MoE模型的参数高效专家预取框架,使用轻量级适配器预测下一层专家以进行异步传输,同时保留原生路由语义。在Snapdragon 8 Elite设备上,它实现了高达20%的解码吞吐量提升,展示了在内存受限部署中的实用优势。
Nader Dabit 展示了1,000 tok/s子代理与85 tok/s之间的速度差异,强调lightning skill offload通过使用子代理进行实施同时保持前沿模型作为规划者和审查者,可实现约5倍更快的执行。
一位用户分享了在llama.cpp中将KV缓存卸载到RAM的经验,在释放显存以便运行更大模型和上下文窗口的同时,实现了相近的速度,表明这种权衡通常是值得的。
在单张 RTX 3090 上使用定制版 llama.cpp(ik_llama.cpp)以 35 t/s 运行 Qwen 3.5 122B MoE 的详细解析,其中采用了融合 MoE 操作和专家层卸载到 CPU 内存的技术,性能显著优于原版 llama.cpp MTP。
讨论了将大型AI模型权重从GPU显存卸载到系统内存时的性能权衡,比较了不同GPU配置(如RTX 5090与RTX6000)在运行DeepSeek V4 Pro等模型时的表现。
一位用户分享了他们使用 llama.cpp 服务器进行模型卸载的经验,指出了性能权衡和安静运行的优势,并询问了解该工具如何在 VRAM 和系统 RAM 之间管理内存的阅读资源。
本文对在共享异构硬件上调度多个LLM进行了实证研究,重点关注CPU-GPU卸载和抢占的性能影响。研究发现,卸载会导致非线性的解码吞吐量下降,尤其是对于较小的模型,而抢占开销主要由模型状态重载主导,为未来多模型调度器的设计提供了指导。