标签
本文介绍KITE,一种KV不变Transformer扩展方法,通过降低推理成本在保持性能的同时高效扩展LLM。它提出了SST模型,与基线相比,实现了更低的训练损失和减少的推理成本。
Qwen3.8-Omni-Flash是一款原生多模态智能体模型,旨在提升真实世界生产力。它通过MoE架构和扩展上下文窗口增强了多模态理解与推理能力,并发布了多模态应用的开源框架。
Hunyuan-A13B 是一个开源的大型语言模型,采用专家混合架构,在推理时激活 130 亿参数,并具备双模式思维链框架,以实现对复杂任务的自适应推理。
本文介绍了限制大规模MoE训练中四个关键内存峰值的方法,使得在1M上下文长度下使用固定GPU内存进行训练成为可能,并且相比基线,吞吐量提升高达10.4倍。
dots3-note Preview 是一个多模态 Mixture-of-Experts AI模型,具有280B总参数和16B激活参数,支持多达512K token上下文,在Hugging Face上作为开源权重模型发布。
本文提出CS-MoE,一种创新的Transformer架构,通过跨层共享神经专家来提高参数利用率,仅激活55%的参数即可实现更低的困惑度。
本文将混合专家模型中的推测解码问题表述为随机最短路径问题,并使用一个诊断Oracle来证明最优决策遵循平衡成本与进展的必要条件。
小米发布了两款顶尖AI模型:MiMo-V2.6 Pro RL(最大化能力)和MiMo-V2.6 Flash RL(最大化效率)。两者均采用稀疏混合专家架构,支持100万上下文长度,采用MIT许可协议,并原生支持文本、图像、视频和音频的全模态处理。
OneBid是一个统一自动竞价基础模型,通过采用Mixture-of-Experts架构和CROP优化,解决了多样化oCPX广告场景中的挑战,在快手部署后显示了显著改进,如ROAS提升13.1%。
IntBMoE是一种新颖的混合专家方法,通过区块级条件和稀疏执行,解耦参与、执行和具体化成本,在图像分类、语言建模和推荐系统方面展现出改进,并在AMap的生成式推荐系统中实现了实际部署。
本文提出L0-MoE,一种使用L0正则化的轻量级混合专家模型方法,用于加速稠密LLMs,最高可实现2.5倍加速,同时保持竞争力的性能。
本文提出 Attention-Aware Routing(AAR)方法,通过将注意力权重集成到路由器中来增强混合专家模型,显著提升数学推理性能,并揭示了路由与注意力之间存在的耦合动力学。
本文介绍了ScriptMoE,一种用于一体化多语言场景文本识别的脚本感知混合专家架构,以及TextMuSS-10M合成数据集,在基准测试中取得了最先进的准确率。
本文详细解释了MoE(混合专家)推理工程,纠正了关于激活参数与部署成本的误解,并深入探讨了路由器选择、运行时分组、GPU执行、内存管理和专家并行等技术细节。
这篇文章解释了Mixture-of-Experts (MoE) 推理的工程方面,详细介绍了令牌路由、专家批处理、GPU分配和性能权衡,以实现高效的服务。
Flyweight 是一款开源 C++/CUDA 推理引擎,可在消费级 GPU 结合系统 RAM 的情况下运行大型 MoE 模型,提供优化性能,并与 Qwen 和 DeepSeek 等模型兼容。
llama.cpp 的一个非官方分支为混合专家模型引入了持久化的专家池,优化以减少在 16GB AMD gfx906 GPU 上通过 PCIe 的专家重新拷贝,从而提升大上下文长度的解码吞吐量。
OceanMoE 引入一种混合专家框架,结合结构化条件稀疏计算,以平衡共享海洋上下文与自适应特化,用于多变量海洋预报,展示了长期预测中提升的准确性。
本文提出一种无限参数LLM架构,该架构使用超网络通过贝叶斯更新从实时数据生成权重,实现持续适应并超越上下文学习。
Edge0是一个流式MoE推理引擎,它使用训练路由预测从SSD服务35B混合专家模型,在消费级硬件上实现接近fp16的性能,且内存使用率低。