标签
OceanMoE 引入一种混合专家框架,结合结构化条件稀疏计算,以平衡共享海洋上下文与自适应特化,用于多变量海洋预报,展示了长期预测中提升的准确性。
本文介绍了Accessibility Plasticity,这是一个原则,神经系统的适应方式是通过重新组织哪些现有计算可以交互,而不仅仅是修改参数。在序列学习任务上的概念验证表明,可访问性适应在保持相当性能的同时减少了能力修改。
TriRoute引入了一个单一的轻量级控制器,该控制器联合决定每个token的注意力模式、专家选择和KV缓存位宽,与独立调优的MoD、MoE和KV量化组合相比,实现了更高的效率和鲁棒性。
本文提出了一种用于大语言模型的从稠密到稀疏的持续训练方法,采用预测器门控的按组稀疏性实现4倍FFN稀疏度,并在Qwen2.5-8B上通过长上下文训练进行了验证。
OpenAI 提出了一种实用的神经网络 L₀ 正则化方法,在训练过程中促使权重精确变为零,实现网络剪枝以提高速度和泛化性能。该方法使用随机门控机制,引入硬具体分布(hard concrete distribution)使得不可微的 L₀ 范数优化能够通过梯度下降法求解。