重建Gemma 4 31b……更好……压缩为26b……
摘要
一位开发人员正在将Gemma 4 31b重建为一个更小的26b模型,通过移除弱SWA层、添加基于注意力的残差网络(来自Moonshot)以及使用topK logit目标进行再训练,旨在实现更好的长上下文和性能。
所以……我不管了。我打算重建Gemma 4 31b。我真的很喜欢这个模型。所以目前的计划是重建SWA层。目前正在运行所有适当的消融测试,以确定移除哪个SWA层。Gemma运行5个SWA,每个1024个token。然后是一个全局层作为“块”。第3层始终是最弱的,很可能会被移除。然后我将全面重新调整SWA的注意力。新的SWA将是1024/2048/4096/8.1k,然后是全局层。这就是Gemma使用的“块”。之后,我将添加“基于注意力的残差网络”……这是Moonshot开发的。研究论文大概是2026年初。我几乎没睡觉在搞这个,所以论文日期可能不对。总之,网络中的全局层将获得基于注意力的残差,使全局层之间能够更好地传递信息。理论上,这使模型具有更好的全局连贯性,并且在更小的体积下表现更好。鉴于我没有谷歌投入数百万美元开发的完整IT/RL流水线……我必须在IT基础上工作。因此,在初始重建中,我将从31b模型中提取topK 12?还是20?的logits,并将它们作为重新训练的目标,同时冻结模型的顶部和底部。这将保持分词/输出/词汇表不变,同时网络内部在更小的空间中寻找稳定性,看起来像31b。TopK重建是我在另一个训练环节开发的另一个奇怪技术。它很酷,因为它教会模型对下一个token可能是什么以及邻近token等有更丰富的理解……我不知道是我发明了这种方法,还是只是得出了别人已经得出的结论。可能两者都有。最后,给它喂几十亿个token来重建它。我必须找到一个“好”的数据集来使用,或者……直接构建数据集。实际的完整再训练需要花费资金,但无所谓了。到时候再面对吧。我很确定我可以直接竞价租用B300并在上面训练。模型的总参数量将从约30.81B降至约26.02B。理论上也应该更好。更好的长上下文等。如果你有好的数据集、算力等想捐赠……联系我……如果你只是对这一切如何运作或为什么有效有疑问……随便问。我可以坐着回答,因为盯着TQDM进度条不需要太多脑力。等我从即将进入的昏迷中醒来后再回复。
相似文章
@MiaAI_lab:我使用Fable-5风格推理和助手轨迹对Gemma 4 12B进行了微调,并将其发布为Gemmable 4 12b。**可用…
Mia-AiLab发布了Gemmable 4 12B,这是Google Gemma 4 12B模型的微调版本,使用了Fable-5风格推理和助手轨迹,提供GGUF和MLX格式用于本地推理。
@witcheer:Gemma 4 发布了一个12B版本。我将其放在RTX 5090上与31B的兄弟型号进行对比。当你把一个模型从31B裁剪到12B时,你到底失去了什么……
对Gemma 4 12B和31B模型的对比显示,较小的模型几乎完整保留了推理能力,但知识储备大幅下降,使其成为推理任务的理想选择,而较大的模型则更适合广泛知识的问答。
Gemma 4 技术报告
Gemma 4 技术报告介绍了新一代开放权重、原生多模态语言模型,采用多样化的架构,推理能力增强,并在各项任务中性能提升。模型参数范围从 2.3B 到 31B,并具备生成推理轨迹的思考模式。
与Gemma 4 31B对话!
宣布推出Gemma 4 31B,这是谷歌的一款新的大型语言模型。
google/gemma-4-26B-A4B-it
Google DeepMind 发布 Gemma 4,一系列开放权重的多模态模型,参数量从2.3B到31B,支持文本、图像、视频和音频输入。模型具有256K上下文窗口,MoE和密集架构,增强的推理能力,并针对从移动设备到服务器的部署进行优化。