如果你使用Windows,请禁用内存压缩以消除瓶颈!
摘要
一位用户分享了通过命令'Disable-mmagent -mc'禁用内存压缩来解决Windows 11中AMD GPU运行AI模型时的性能瓶颈问题。
这是对以下帖子的跟进:[https://www.reddit.com/r/LocalLLaMA/comments/1ta3ben/dont\_you\_have\_issues\_in\_w11\_with\_amd\_gpu\_where/](https://www.reddit.com/r/LocalLLaMA/comments/1ta3ben/dont_you_have_issues_in_w11_with_amd_gpu_where/) 我通过管理员终端禁用内存压缩解决了这个无休止的问题:`Disable-mmagent -mc` 所有问题都解决了,我可以打开任何游戏,AI也不会像以前那样变慢(即使游戏关闭时也一样!)
相似文章
16GB显存炼狱讨论帖
一个讨论帖,分享在16GB显存Windows系统上运行AI模型如Qwen3.8-27B的配置和技巧,专注于内存优化技术。
本地 AI 硬件内存带宽(2026 年版)
本文深入解析内存带宽作为本地 AI 硬件性能的关键指标,对比了 NVIDIA、Apple、AMD、Intel 等厂商在不同性能层级下的当前 GPU 与统一内存系统。
大幅提升 --n-cpu-moe 部分卸载模型的提示词处理速度
本文分享了一个 llama.cpp 的性能优化技巧,展示了增大微批大小(`-ub`)并结合部分 CPU 卸载(`--n-cpu-moe`)可以显著提升 gpt-oss-120b 等大型模型在消费级 GPU 上的提示词处理速度。
AMD的小型AI PC预示着模型推理向本地化未来的转变
AMD的Ryzen AI Max平台配备128GB统一内存,可本地推理高达2000亿参数的大模型,旨在将AI工作负载从云端转移到紧凑的个人硬件上。
Windows 11与Linux下llama.cpp的速度差异:中型和大型MoE模型其实没有差别
用户评测表明,使用llama.cpp运行大型MoE模型时,Windows 11与Linux之间并无显著速度差异,打破了一个常见迷思。在多GPU配置下,使用Qwen 3.5 122B、397B和MiniMax 2.7等模型进行测试,提示处理和令牌生成速度几乎相同。