标签
作者将预训练的PLE n-gram记忆从Qwen3.8-Flash-Next转移到Qwen3.5-0.8B,在不微调骨干网络的情况下,验证困惑度降低了5.05%。主要发现包括动态门控和阅读器训练在记忆注入方面的有效性。