标签
MedMix是一个语义对齐框架,用于联邦多模态稀疏MoE,通过协调路由和专家专业化解决模态异构性,在医疗AI数据集上实现性能提升。
Moonshot的Kimi K3是一个2.8万亿参数的开源权重模型,拥有896个专家(每个token激活16个),体现了在保持活跃计算不变的情况下扩大总参数的趋势,并使用注意力压缩来减少KV缓存大小,使得前沿推理更容易实现,但存储成本较高。
SILX AI 发布 Quasar-Preview,这是一个 18B 参数 MoE 基础模型,具有 2B 活跃参数和实验性的 5M token 上下文,基于混合循环/注意力架构构建,并设计用于通过 Bittensor SN24 进行去中心化训练。
HodgeCover 使用高阶拓扑覆盖来压缩稀疏混合专家层,通过解决成对信号遗漏的不可归约可合并性障碍,在专家缩减方面匹配最先进的基线,并在激进压缩方面领先。