llama.cpp ngram在RAM/SSD上?

Reddit r/LocalLLaMA 工具

摘要

用户询问如何通过llama.cpp和Unsloth Studio等工具,将ngram数据卸载到RAM或SSD,以运行Qwen3.8-Flash-Next等大型语言模型,并寻求具体方法或官方计划。

我有一段时间没关注了。目前是否有官方方式在Unsloth Studio等工具中将ngram数据卸载到RAM或SSD?我有兴趣在72GB VRAM上运行Qwen3.8-Flash-Next,但初步尝试失败了,因为即使在Q4量化下,似乎也加载了无关数据到错误的位置。如果有人能分享具体方法,或者告诉我官方支持计划(我可以等待,知道这即将到来),我将不胜感激。提前致谢。
查看原文

相似文章