Qwengram-0.8B:我将Qwen3.8 Flash-Next的n-gram记忆转移到了Qwen3.5-0.8B——验证困惑度降低了5.05%

Reddit r/LocalLLaMA 论文

摘要

作者将预训练的PLE n-gram记忆从Qwen3.8-Flash-Next转移到Qwen3.5-0.8B,在不微调骨干网络的情况下,验证困惑度降低了5.05%。主要发现包括动态门控和阅读器训练在记忆注入方面的有效性。

我一直在尝试Qwen3.8-Flash-Next的预训练PLE n-gram记忆是否能改善更小的Qwen3.5-0.8B模型。我使用有限资源训练了0.8B设置,主要利用免费的Kaggle笔记本GPU。该设置保持Qwen3.5-0.8B骨干网络和大约510亿参数的PLE记忆冻结不变。一个小型的R=1阅读器在解码器层3和9上训练,带有依赖于token的线性门控来控制后续注入。没有骨干网络微调。当前平衡检查点使用训练了1500万token的阅读器和单独校准的动态门控。在冻结的完整验证集上:Qwen3.5-0.8B原始NLL:2.905585 PPL:18.2759 Qwengram-0.8B NLL:2.853786 PPL:17.3534 困惑度降低:5.05% 这是语言模型的验证结果,而不是声称基准准确度提高5%。几个发现塑造了最终设计:真实的预训练PLE优于随机记忆和置换记忆的对照组。阅读器损失在超过500万训练token后仍在持续改善。2000万token的阅读器进一步改善了聚合LM损失,但在数学上有所退步,因此1500万token仍是平衡检查点。强固定晚期记忆注入损害了LAMBADA。动态token级仲裁恢复了大部分这种权衡。门控是真正动态的:其记忆强度在token间显著变化,而不是表现为一个学习常数。在完全相同的记忆预算下,学习到的token放置优于洗牌放置。将记忆路由到高不确定性位置恢复了部分优势,但仍未匹配学习门控。一个热启动的R=4阅读器产生了小的聚合LM损失改善,但引入了代码和数学退步。因此我保持R=1作为平衡架构。我还在llama.cpp中实现了推理路径。公开产物包括:模型/GGUFs https://huggingface.co/Ninnix96/Qwengram-0.8B 训练、控制和评估 https://github.com/Ninnix/qwen-ple-transfer 修改后的llama.cpp运行时 https://github.com/Ninnix/llama.cpp GGUF包含Qwen3.5骨干网络以及训练好的阅读器和仲裁张量。大型PLE作为外部量化副卡保留,而不是打包进模型GGUF中。我还在单独的固定WikiText-2 GGUF运行时测试中测试了量化保留:Q8_0保留了91%的BF16阅读器NLL增益。这是单独的运行时测量,不是上面冻结的Kaggle验证基准。欢迎尝试复现或改进阅读器、PLE缓存、路由或运行时。接下来我想尝试更大的Qwen骨干网络,特别是35B-A3B MoE。这个规模的实验需要比免费Kaggle笔记本提供的计算资源多得多,但0.8B研究为阅读器缩放和动态记忆仲裁提供了更清晰的方案。声明:我是Qwengram及链接仓库的作者。英语不是我的母语,所以我使用了AI来帮助校对语法并改进本文措辞。实验本身也是在编码代理的协助下开发的,主要是ChatGPT Sol,用于实现、调试、实验编排和分析支持。我设计了实验,做出了研究决策,审查了结果,并对最终结论负责。
查看原文

相似文章

Qwen 3.8 Next Engram 用途是什么?

Reddit r/LocalLLaMA

本文探讨了 Qwen 3.8 Next AI 模型中的 Engram 组件,详细描述其为一个具有高度偏斜访问模式的 510 亿参数 Zipfian 缓存,并评估了通过频率剪枝进行压缩的优化方法。

Qwen3.8-Flash-Next

Simon Willison's Blog

Qwen 发布了 Qwen3.8-Flash-Next,这是一款开放权重的多模态 MoE 模型,拥有 125B tokens,但只有 6B 活跃参数,提供了性能提升,并作为 Qwen4 架构的早期预览。