@maximelabonne: 哇,这让我想起了早期的模型合并。完全疯狂,我喜欢!
摘要
一个采用融合架构的新型sub-6B稀疏激活AI模型,结合了LFM2.5-2.6B和Qwen3.6-35B-A3B的权重,以极小的尺寸实现了接近Qwen3.6-35B的性能。
查看缓存全文
缓存时间: 2026/08/06 16:44
哇,这让我想起了早期的模型合并。
太疯狂了,我喜欢!https://t.co/qyWSrq5Vmp
Vasko (@RoliumGens): 大家好!
我刚发布了一个低于6B参数的稀疏激活AI模型,它采用了一种全新的架构:融合。
我融合了 @liquidai 的 LFM2.5-2.6B 和 @Alibaba_Qwen 的 Qwen3.6-35B-A3B 的权重。
它的性能接近 Qwen3.6-35B-A3B,同时大约
相似文章
@TheAhmadOsman: 一直在玩@PrismML的新模型,该模型将Qwen 3.5 27B变成了子4GB和子6GB的权重,令我印象深刻 C…
PrismML发布了一个压缩版的Qwen 3.5 27B,可以装入子4GB和子6GB内存中,实现了令人印象深刻的本地AI性能。
@rasbt: 疯狂模型!它实际上使用了旧的Qwen2.5-Coder-3B栈,并通过后训练取得了非常出色的性能……
一个使用Qwen2.5-Coder-3B栈的3B参数模型,在编程基准测试中取得了与Claude Opus 4.5相媲美的分数,采用了详细的后训练技术,包括合成数据、过滤、两阶段SFT,以及一种新颖的RL方法(MGPO)。
@noctus91: 我最近从 Qwen 3.5 9B 切换到了 @liquidai 的 LFM2.5-8B-A1B,它迅速成为我在 H… 中的默认本地模型
一位用户分享了从 Qwen 3.5 9B 切换到 Liquid AI 新推出的 LFM2.5-8B-A1B 模型的积极体验,称赞其在代理任务上的速度和可靠性,同时指出编码仍然是其弱项。该模型是一个 8B MoE 架构,具有 1.5B 活跃参数和 128K 上下文,针对设备和服务器端使用进行了优化。
Jackrong/Qwopus-GLM-18B-Merged-GGUF
Jackrong 发布了 Qwopus-GLM-18B-Merged-GGUF,这是一个结合两个 Qwen3.5-9B 微调模型的 64 层“弗兰肯合并”模型,参数规模约 18B。通过 1000 步 LoRA 微调修复了层边界问题。该模型在能力基准测试中达到 90.9%,而显存消耗不到 Qwen 3.6-35B MoE 的一半。
@Ex0byt:激活、切片、拼接、微调数日,外加15小时屏息凝神的NVFP4校准/传播轮次……
社区成员发布了Qwen3.6-35B-A3B-PRISM-NVFP4——一款经过多轮、数据集校准、零损耗的NVFP4量化版Qwen模型。