Motif 3:技术报告
摘要
Motif 3 是一个具有 3140 亿参数的混合专家语言模型,每个 token 激活 132 亿参数,采用分组差分潜在注意力,并在 12.5 万亿 token 上完成训练,在推理、编程和长上下文任务中展现出具有竞争力的性能。
查看缓存全文
缓存时间: 2026/08/11 06:20
论文页面 - Motif 3:技术报告
来源:https://huggingface.co/papers/2608.09119 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
我们介绍了 Motif 3,一个仅解码器的混合专家(Mixture-of-Experts)语言模型,总参数为 3140 亿,每个 token 激活 132 亿参数。每个稀疏 MoE 层包含 384 个路由专家,每个 token 选择 8 个。这种细粒度的稀疏性在限制计算量的同时提供了充足的专家容量。Motif 3 围绕分组差分潜在注意力(GDLA)构建,该机制将分组差分注意力与多头潜在注意力的压缩键值表示相结合。该架构进一步融入了改进的流形约束超连接、专家特定 PolyNorm 激活以及多 token 预测,以提升优化稳定性、专家专业化和推理效率。我们在约 12.5 万亿个 token 上预训练 Motif 3,涵盖网页文档、STEM、代码、数学、多语言内容和领域专业化语料库。专家平衡和数值稳定技术支持大规模下的稳定训练,同时选择性 MXFP8 计算与通信、内存高效的融合内核以及窗口感知的上下文并行性使得最高 256K token 的上下文长度训练成为可能。我们的后训练流水线结合了通用监督微调、六个使用强化学习训练的专家教师、一个使用监督微调训练的软件工程教师,以及多教师在线策略蒸馏。由此产生的统一模型整合了推理、编码、工具使用、专业工作、长上下文理解、校准式弃权和指令遵循等方面的互补能力。在广泛的评估套件中,Motif 3 展示了与领先开放权重模型相当的竞争力,在长程智能体任务、数学推理、科学知识和幻觉敏感评估上均取得了强劲结果。
查看 arXiv 页面 (https://arxiv.org/abs/2608.09119) 查看 PDF (https://arxiv.org/pdf/2608.09119) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.09119)
在你的 agent 中获取此论文:
hf papers read 2608\.09119
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型
Motif-Technologies/Motif-3 文本生成• 315B• 更新于大约 4 小时前 • 52 (https://huggingface.co/Motif-Technologies/Motif-3)
Motif-Technologies/Motif-3-NVFP4 文本生成• 180B• 更新于大约 4 小时前 • 17 (https://huggingface.co/Motif-Technologies/Motif-3-NVFP4)
Motif-Technologies/Motif-3-Base 文本生成• 315B• 更新于大约 4 小时前 • 16 (https://huggingface.co/Motif-Technologies/Motif-3-Base)
引用此论文的数据集
没有关联此论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2608.09119 即可从此页面链接到它。
引用此论文的 Spaces
没有关联此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2608.09119 即可从此页面链接到它。
包含此论文的收藏集
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到它。
相似文章
Motif-Technologies/Motif-3-Beta
Motif Technologies 发布了 Motif-3 的中期测试版检查点,这是一个大规模混合专家语言模型,总参数约 314B(激活约 13B),上下文长度 256K,并采用自定义架构如分组差分潜在注意力(GDLA),公开可用于非商业研究。
Motif-Video 2B:技术报告
# 论文页面 - Motif-Video 2B:技术报告 来源:[https://huggingface.co/papers/2604.16503](https://huggingface.co/papers/2604.16503) 作者:、、、、、、、、、、、、、、、、、、、、、 ## 摘要 Motif-Video 2B 采用共享交叉注意力与三段式主干的专用架构,以及高效训练方法,在显著降低参数量和训练数据用量的同时,实现了高质量文本到视频生成。
Hunyuan-A13B 技术报告
Hunyuan-A13B 是一个开源的大型语言模型,采用专家混合架构,在推理时激活 130 亿参数,并具备双模式思维链框架,以实现对复杂任务的自适应推理。
Mach-Mind-4-Flash 技术报告
本技术报告介绍了 Mach-Mind-4-Flash,一个拥有35B参数(3B激活参数)的混合专家(MoE)代理模型,仅通过后训练优化即可达到或超越100B参数级别的模型性能。它提出了一种新颖的训练基础设施,包括动态多教师调度、多教师在线策略蒸馏以及用于令牌效率的混合中位长度策略优化。
混合专家模型中的涌现式模块化(8 分钟阅读)
Ai2 发布了 EMO,一个 14B 参数的混合专家语言模型,训练用于发展涌现式模块化。它允许在特定任务中使用一小部分专家,同时保持接近全模型性能。