在MXFP4下,能装入128 GB内存的最大密集模型是什么?
摘要
讨论在MXFP4量化下,能装入128 GB内存的最大密集模型。
暂无内容
相似文章
在sm120上使用NVFP4 KV缓存量化将使32GB VRAM系统变得非常强大
在sm120上使用NVFP4 KV缓存量化显著提高了大语言模型的内存效率,使32GB VRAM系统在196k上下文大小下使用Qwen3.6-27B实现约60 tok/秒的推理速度。
难以置信!我使用llama.cpp中的mmap函数,将Qwen3.8-Flash-Next IQ3_XSS放入16G+64G RAM中,速度仍达到26t/s。
用户成功使用llama.cpp中的mmap函数,将Qwen3.8-Flash-Next IQ3_XSS模型放入16GB+64GB RAM中,达到26 tokens/秒的速度,这超过了更大的非MOE 30B模型。
是否有针对192 GB内存的GLM 5.3 Flash Antirez/DS4 GGUF模型?
作者询问是否存在适合192 GB内存的GLM 5.3 Flash Antirez/DS4 GGUF模型,并希望得到构建此类模型的建议。
榨干64GB内存:Qwen3.5 122B A10B(UD-Q2_K_XL,启用MTP)已完全取代我原本的Qwen3 Next 80B(UD-Q4_K_XL)
一位用户比较了在64GB内存系统上运行量化版Qwen3 Next 80B和Qwen3.5 122B的情况,指出了本地LLM推理中速度、质量和内存使用之间的权衡。
高显存本地编码模型——依然首选 Qwen 3.6 27B 吗?
用户分享了使用 Qwen 3.6 27B 进行本地编码任务的经验,并寻求适合拥有 224GB 显存系统的更大模型(100B 以上)的推荐。