@maximelabonne: 哇,这让我想起了早期的模型合并。完全疯狂,我喜欢!

X AI KOLs Following 模型

摘要

一个采用融合架构的新型sub-6B稀疏激活AI模型,结合了LFM2.5-2.6B和Qwen3.6-35B-A3B的权重,以极小的尺寸实现了接近Qwen3.6-35B的性能。

哇,这让我想起了早期的模型合并。 完全疯狂,我喜欢!https://t.co/qyWSrq5Vmp
查看原文
查看缓存全文

缓存时间: 2026/08/06 16:44

哇,这让我想起了早期的模型合并。

太疯狂了,我喜欢!https://t.co/qyWSrq5Vmp

Vasko (@RoliumGens): 大家好!

我刚发布了一个低于6B参数的稀疏激活AI模型,它采用了一种全新的架构:融合。

我融合了 @liquidai 的 LFM2.5-2.6B 和 @Alibaba_Qwen 的 Qwen3.6-35B-A3B 的权重。

它的性能接近 Qwen3.6-35B-A3B,同时大约

相似文章

Jackrong/Qwopus-GLM-18B-Merged-GGUF

Hugging Face Models Trending

Jackrong 发布了 Qwopus-GLM-18B-Merged-GGUF,这是一个结合两个 Qwen3.5-9B 微调模型的 64 层“弗兰肯合并”模型,参数规模约 18B。通过 1000 步 LoRA 微调修复了层边界问题。该模型在能力基准测试中达到 90.9%,而显存消耗不到 Qwen 3.6-35B MoE 的一半。