llama.cpp 的 Qwen-3.8-Next-Flash Ngram 热插拔知识注入器

Reddit r/LocalLLaMA 工具

摘要

对 llama.cpp 的一项修改,实现了为 Qwen 模型实时热插拔 Ngram PLE 表,从而支持知识注入,并为低成本训练提供了新的可能性。

研究 Qwen 的新架构时,我很好奇是否可以通过修改 Ngram PLE 表,使其像一个长期知识数据库一样工作。结果发现,在某些限制下是可以的。我对 llama.cpp 编写了一个小型修改,允许在内存中修改该表,从而能够实时用新数据为其打补丁。PLE 表会在每次提示时更新,因此现在你可以热插拔其中的一部分,而无需重新加载模型。限制在于难以可靠地控制输出,因为嵌入是在模型的早期层注入的。然而,通过一些技术,你可以通过简单的修改来影响模型的输出,正如示例中所展示的。我创建了两个代码库:llama.cpp 的修改版在这里:https://github.com/ortegaalfredo/llama.cpp-NLTM Ngram 知识注入器(一种用于创建表补丁的编译器)在这里:https://github.com/ortegaalfredo/ngram-knowledge-injector 此项目存在一些限制,例如 PLE 表需要被内存映射到内存中(这是 llama.cpp 的默认设置),而且我仅在 q8 量化版本上测试过,因此你需要相当大的内存来测试此功能。这能被用作一种新的低成本训练方法吗?也许吧。目前来看并不容易,但通过一些简单的修改,我认为你可以轻松地为大语言模型创建具有长期、即时热插拔记忆的模型,就像电影里那种“我学会了功夫”的能力。
查看原文

相似文章

Qwen3.8-Flash-Next

Simon Willison's Blog

Qwen 发布了 Qwen3.8-Flash-Next,这是一款开放权重的多模态 MoE 模型,拥有 125B tokens,但只有 6B 活跃参数,提供了性能提升,并作为 Qwen4 架构的早期预览。

orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF

Hugging Face Models Trending

本文发布未经审查的 Qwen3.8-Flash-Next 模型的 GGUF 量化版本,这是 Qwen4 架构的混合专家模型预览版,专为支持视觉功能的 llama.cpp 设计,需要自定义构建以确保兼容性。