标签
OPERA提出了一种多智能体集成框架,将专家权重分配视为用于通用生物医学图像分析的离线策略学习问题,实现了无需重新训练的测试时自适应,并在9个数据集和30多个基线上持续提升性能。
提出PADD框架,用于将知识从密集教师模型蒸馏到混合专家(MoE)学生模型,解决了教师无路由器情况下学习路由策略的挑战。该方法包含四个阶段,在数学推理基准测试上展示了改进效果。
本文提出了dMoE,一种用于扩散大语言模型的块级混合专家框架,该框架将词元级专家分布聚合成块级路由,在保持性能的同时减少激活的专家数量和内存使用。
一篇技术深度文章,探讨大型语言模型中预训练运行失败的常见原因,包括专家路由中的因果破坏问题和数值精度错误,并附有Llama 4、Gemini 2 Pro和GPT-4的示例。
本文提出了一种针对稀疏混合专家(MoE)模型中通信高效专家路由的信息论框架,将门控机制视为随机信道,并推导实用的互信息估计器以分析有限专家库上的准确率-速率权衡。