attention-modification

标签

Cards List
#attention-modification

重建Gemma 4 31b……更好……压缩为26b……

Reddit r/LocalLLaMA · 2026-07-02

一位开发人员正在将Gemma 4 31b重建为一个更小的26b模型,通过移除弱SWA层、添加基于注意力的残差网络(来自Moonshot)以及使用topK logit目标进行再训练,旨在实现更好的长上下文和性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈