Gemma 4 31b AttnRes 项目

Reddit r/LocalLLaMA 模型

摘要

一位独立开发者更新了 AttnRes 项目:用基于注意力的路由替代标准残差流,通过渐进式切换计划和 top-K logits 从 Gemma 4 31b 进行蒸馏,并计划推出一个 Apache 2.0 社区模型。

我让 Claude 帮我重写了这篇帖子,所以里面会有很多破折号。内容没问题,但带有大量“Claude 式”的简化。 --- 大家好。距离我上次发布关于 AttnRes 架构的帖子已经有一段时间了,所以我想更新一下目前的进展。 简单来说:它还活着。详细来说……情况比较复杂。 核心想法没有变:用基于注意力的路由机制——AttnRes——替代标准的残差流,让模型学习在层之间把信息路由到哪里,而不是盲目地把所有内容都向前传递。 参数数量与基础模型相同。假设是,同样的算力可以得到根本性的更好利用。 我花时间最多的地方,是想明白如何在不从头训练的情况下真正实现这一点。我没有 Google 的预算。我只有一个人。 所以整个策略围绕从 Gemma 蒸馏到新架构展开,采用一种渐进式切换计划——一开始让标准残差承担全部工作,然后在训练过程中逐步把责任转移到 AttnRes 路径上。模型学习通过新路径进行路由,同时旧路径被慢慢撤掉。这听起来简单。其实并不简单。 最花时间搞清楚的是数据。不是数据量……而是多样性。如果你在狭窄的分布上蒸馏,你会得到一个在该分布上表现很好、但悄悄丢失了其他所有能力的模型。模型流形是一个巨大的高维存在,你必须在过渡期间完整保留它;否则你会得到一个能写代码、但当你问它量子力学时突然用韩语和英语混合回答的模型。我亲眼见过这种情况。很有启发,但不理想。 我最终采用的解决方案是:让模型自己生成多样化的覆盖。拿一篇新闻文章,让模型总结它;然后把摘要翻译成保加利亚语;再问它保加利亚语翻译是否丢失了细微差别。一份源内容,就锻炼了模型能力空间中三个完全不同的区域。把这个做法扩展到 Google 训练 Gemma 时熟练掌握的 20 种语言,你就用相对简单的数据脚手架获得了巨大的流形覆盖。 另一个重大决策是蒸馏目标。大多数人使用 1-hot 或标签平滑目标进行蒸馏。我使用来自源模型的 top-K(约 12 个)logits,并保持它们的比例权重。理由是……模型不是一个下一个词元预测器,而是一个下一个分布预测器。每个位置上各候选之间的相互关系编码了模型的实际知识——它认为什么可能、什么合理、什么相关。One-hot 把这些全部丢弃了。Top-K 12 捕获了约 98% 的概率质量,并保留了那个就是流形的分布形状。这很重要,因为在渐进切换过程中,新路径不仅要学会重现正确答案,还要学会重现正确的不确定性结构。正是这一点迫使它真正内化模型的知识,而不是仅仅模仿输出。 目标不是完美。我想要一个能证明该架构有效且可训练的 beta 版本。足够好,让人可以拿来,用我已经建好的流水线蒸馏新知识,并改进它。训练代码已经存在,因为我必须写它来做这项工作。数据流水线已存在。方法论也有文档记录。全部采用 Apache 2.0 许可。如果有算力提供商愿意参与进来,帮助把模型推到 Gemma 级别的质量……我很乐意把他们的名字写在 HuggingFace 模型卡片上。这本来就是一个基于开放架构构建的社区模型,任何人都可以改进。 等探测运行完成后会有更多更新。很高兴回答关于方法论或这些决策背后理由的问题。 --- 核心模型和训练模型所主要蒸馏自的源模型,是 Gemma 4 模型的 abliterated 变体。所以……它没有任何安全限制。使用后果自负。目前我在等 B300。它们就是买不到;现在用一块 B300 是我的测试目标。过去一周每个数据中心都 100% 售罄,一出现就立刻被抢光。 另外值得注意的是,我使用 Top K 12 蒸馏,但我发现对于很大一部分数据集,前 3 或 4 个就够了。这归结于语言、代码甚至逻辑的结构方式。简单来说,你不能写“I want to eat a”然后期望下一个词元是 apple。如果你把“a”换成“an”,那么 apple 以及任何以元音开头的词都变得合法,其他所有词的概率都会下降。根据我的观察,这种情况经常发生。 另一个问题是量化。量化会影响那些有大量选项的长尾分布。我目前正在研究这两个问题,以求让这个过程更高效。 像之前那个模型那样移除层,需要大约 100 倍的训练量。这涉及到逐步移除它们。尽管我已经识别出了所有需要移除的层,但模型会变得太不稳定,无法在继续训练的同时做其他事情。这就需要先把 Gemma 削减为 3 个 SWA + Global,然后再应用注意力残差。或者,你也可以在中间插入一两个块来让模型更大,然后训练更多,再应用注意力残差。 据我所知,除了 Moonshot 之外还没有人这么做;即使是 Moonshot,也用了大约 1.5 万亿 token,因为那是从预训练到指令训练的完整过程。不过 Moonshot 证明了他们的模型使用这种残差流学习效率提高了约 25%。此外,Kimi K3 现在已经发布,并且正好具备这个特性。所以我猜我最初确实发现了什么。 旧帖 - https://old.reddit.com/r/LocalLLaMA/comments/1ulmez2/rebuilding_gemma_4_31b_better_as_26b/
查看原文

相似文章

重建Gemma 4 31b……更好……压缩为26b……

Reddit r/LocalLLaMA

一位开发人员正在将Gemma 4 31b重建为一个更小的26b模型,通过移除弱SWA层、添加基于注意力的残差网络(来自Moonshot)以及使用topK logit目标进行再训练,旨在实现更好的长上下文和性能。

Gemma 4 技术报告

Hugging Face Daily Papers

Gemma 4 技术报告介绍了新一代开放权重、原生多模态语言模型,采用多样化的架构,推理能力增强,并在各项任务中性能提升。模型参数范围从 2.3B 到 31B,并具备生成推理轨迹的思考模式。

google/gemma-4-31B-it-assistant

Hugging Face Models Trending

Google DeepMind 发布了 Gemma 4,这是一个开源权重的多模态模型家族,支持文本、图像、视频和音频,具备增强的推理和编码能力,并通过多令牌预测(MTP)实现高达 2 倍的解码速度提升。

Gemma 4 技术报告

arXiv cs.CL

Gemma 4 引入了新一代开放权重、原生多模态语言模型,采用密集和混合专家架构,具备思考模式以进行高级推理,提高了效率并支持长上下文能力。