标签
Edge0是一个流式MoE推理引擎,它使用训练路由预测从SSD服务35B混合专家模型,在消费级硬件上实现接近fp16的性能,且内存使用率低。
本文介绍了Colla-Q,一种基于激活熵的比特分配框架,用于量化混合专家模型,以平衡专家性能,提高整体模型效率并减少对校准数据集的依赖。
本文研究稀疏混合专家模型中早期专家选择在超越最近层后的预测价值,发现跨层路由预测有显著增益。
介绍了DeepSeek-V4.1-Flash,一个多模态混合专家(MoE)模型,拥有552B参数,采用先进的KV缓存压缩技术,以降低部署成本并提升长上下文代理工作负载的效率。
Empero AI发布其首个MoE模型Qwen3.8-35B-A3B-Distill,该模型将Qwen3.8的推理能力蒸馏到一个更小、更高效的架构中,在ARC-Challenge基准测试上显示出改进。
Xing4.0-29B-A4B 是一个开源的290亿参数大型语言模型,针对智能体任务和 Ascend NPU 进行了优化,采用 MoE 架构,实现高训练效率,并在基准测试中取得有竞争力的结果。
本文分析了Z-loss在人工智能模型训练中的反向传播几何,提供了一个框架来理解和优化密集输出头与稀疏混合专家路由器中的梯度,并在GPT-2和Pythia模型上进行了评估。
North Small Translate 是一个基于LLM的开源机器翻译模型,拥有250亿活动参数,无需在推理时进行昂贵推理,即可在其类别中实现跨50种语言的顶级性能。
本文提出了FedTAR,一种针对基于MoE的大型语言模型的任务感知联邦微调方法,该方法通过将本地更新与任务偏好对齐,以在异构数据下保留专家专业化并提高性能。
本文提出ESRL,一种通过探索专家路由路径来增强混合专家模型训练的强化学习框架,从而在数学、科学和编程任务上取得性能提升。
本文介绍了管理长上下文长度下训练大型混合专家模型内存峰值的技术,包括Pipelined LLEP、Ring-DTP、SCO和OffloadStreamAdamW,这些技术实现了固定的GPU工作集,并将吞吐量提高了多达10.4倍。
Yandex 发布了 AliceAI-Foundation-80B-A3B-Base,这是一种基础语言模型,采用混合架构和 MoE 层,拥有 800 亿参数(每个 token 激活 30 亿参数),从头开始训练,在俄语事实知识任务中表现出色。
本文讨论了最近发布的 K2-Horizon-MoVA-36B-A4B MoE 模型,并询问其当前使用情况和潜在用例,提供了一个模型比较的链接。
Atria Dawn Preview 是来自 Shanghai AI Lab 的一款新型代理AI模型,基于744B参数MoE GLM-5.2基础构建,专为需要持续环境理解和工具使用的研究和工程任务设计。
M3-Former 是一个多模态变换器模型,它使用混合专家模型和大语言模型增强的语义融合来预测长期船舶轨迹,并具有更高的准确性和鲁棒性。
CohereLabs 发布了 North Small Translate,这是一个开放权重的稀疏混合专家模型,拥有250亿活跃参数,用于支持50种语言的高质量机器翻译。
Cognition的SWE-2模型,基于Kimi K3进行后训练,在Terminal-Bench 2.1上获得92.8分,相较于前沿模型如Fable 5.1和GPT-6 Astra,提供具有竞争力的性能且成本更低。
该仓库为 DeepSeek-V4.1-Flash AI 模型提供提示编码和最小 PyTorch 推理实现,包括视觉编码器、MoE 和 Hyper-Connections 等组件,基于 MIT 许可证。
本文认为,无重训练的MoE压缩检查点应被视为受益于小型后压缩调整的压缩初始化。研究表明,仅使用3,000个样本和一个周期,语言模型微调即可恢复性能损失的大部分,并且比知识蒸馏更具成本效益。
ACE提出了一种方法,用于整合MoE大语言模型中跨专家的冗余适配器,以实现更高效的参数高效微调,训练速度提升最高可达1.48倍,且不增加峰值内存。