Motif 3:技术报告

Hugging Face Daily Papers 论文

摘要

Motif 3 是一个具有 3140 亿参数的混合专家语言模型,每个 token 激活 132 亿参数,采用分组差分潜在注意力,并在 12.5 万亿 token 上完成训练,在推理、编程和长上下文任务中展现出具有竞争力的性能。

我们推出了 Motif 3,这是一个仅解码器的混合专家语言模型,总参数为 3140 亿,每个 token 激活 132 亿参数。每个稀疏 MoE 层包含 384 个路由专家,每个 token 选择其中 8 个。这种细粒度稀疏性在限制计算量的同时提供了充足的专家容量。Motif 3 以分组差分潜在注意力(GDLA)为核心,该机制将分组差分注意力与多头潜在注意力的压缩键值表示相结合。该架构还融入了改进的流形约束超连接、专家特定 PolyNorm 激活以及多 token 预测,以提升优化稳定性、专家专业化和推理效率。我们在约 12.5 万亿 token 上对 Motif 3 进行了预训练,涵盖网页文档、STEM、代码、数学、多语言内容以及领域专用语料库。专家平衡和数值稳定技术支撑了大规模训练的稳定性,而选择性 MXFP8 计算与通信、内存高效的融合内核以及窗口感知的上下文并行机制,使得训练上下文长度可达 256K token。我们的后训练流程结合了通用监督微调、六个使用强化学习训练的专家教师、一个使用监督微调训练的软件工程教师,以及多教师在线策略蒸馏。最终得到的统一模型整合了推理、编程、工具使用、专业工作、长上下文理解、校准性弃答和指令遵循等互补能力。在广泛的评测套件中,Motif 3 在与领先开源权重模型的对比中展现出具有竞争力的性能,包括在长周期智能体任务、数学推理、科学知识和幻觉敏感评测上的强劲表现。
查看原文
查看缓存全文

缓存时间: 2026/08/11 06:20

论文页面 - Motif 3:技术报告

来源:https://huggingface.co/papers/2608.09119 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

我们介绍了 Motif 3,一个仅解码器的混合专家(Mixture-of-Experts)语言模型,总参数为 3140 亿,每个 token 激活 132 亿参数。每个稀疏 MoE 层包含 384 个路由专家,每个 token 选择 8 个。这种细粒度的稀疏性在限制计算量的同时提供了充足的专家容量。Motif 3 围绕分组差分潜在注意力(GDLA)构建,该机制将分组差分注意力与多头潜在注意力的压缩键值表示相结合。该架构进一步融入了改进的流形约束超连接、专家特定 PolyNorm 激活以及多 token 预测,以提升优化稳定性、专家专业化和推理效率。我们在约 12.5 万亿个 token 上预训练 Motif 3,涵盖网页文档、STEM、代码、数学、多语言内容和领域专业化语料库。专家平衡和数值稳定技术支持大规模下的稳定训练,同时选择性 MXFP8 计算与通信、内存高效的融合内核以及窗口感知的上下文并行性使得最高 256K token 的上下文长度训练成为可能。我们的后训练流水线结合了通用监督微调、六个使用强化学习训练的专家教师、一个使用监督微调训练的软件工程教师,以及多教师在线策略蒸馏。由此产生的统一模型整合了推理、编码、工具使用、专业工作、长上下文理解、校准式弃权和指令遵循等方面的互补能力。在广泛的评估套件中,Motif 3 展示了与领先开放权重模型相当的竞争力,在长程智能体任务、数学推理、科学知识和幻觉敏感评估上均取得了强劲结果。

查看 arXiv 页面 (https://arxiv.org/abs/2608.09119) 查看 PDF (https://arxiv.org/pdf/2608.09119) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.09119)

在你的 agent 中获取此论文:

hf papers read 2608\.09119

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型

Motif-Technologies/Motif-3 文本生成• 315B• 更新于大约 4 小时前 • 52 (https://huggingface.co/Motif-Technologies/Motif-3)

Motif-Technologies/Motif-3-NVFP4 文本生成• 180B• 更新于大约 4 小时前 • 17 (https://huggingface.co/Motif-Technologies/Motif-3-NVFP4)

Motif-Technologies/Motif-3-Base 文本生成• 315B• 更新于大约 4 小时前 • 16 (https://huggingface.co/Motif-Technologies/Motif-3-Base)

引用此论文的数据集

没有关联此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2608.09119 即可从此页面链接到它。

引用此论文的 Spaces

没有关联此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2608.09119 即可从此页面链接到它。

包含此论文的收藏集

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接到它。

相似文章

Motif-Technologies/Motif-3-Beta

Hugging Face Models Trending

Motif Technologies 发布了 Motif-3 的中期测试版检查点,这是一个大规模混合专家语言模型,总参数约 314B(激活约 13B),上下文长度 256K,并采用自定义架构如分组差分潜在注意力(GDLA),公开可用于非商业研究。

Motif-Video 2B:技术报告

Hugging Face Daily Papers

# 论文页面 - Motif-Video 2B:技术报告 来源:[https://huggingface.co/papers/2604.16503](https://huggingface.co/papers/2604.16503) 作者:、、、、、、、、、、、、、、、、、、、、、 ## 摘要 Motif-Video 2B 采用共享交叉注意力与三段式主干的专用架构,以及高效训练方法,在显著降低参数量和训练数据用量的同时,实现了高质量文本到视频生成。

Hunyuan-A13B 技术报告

Hugging Face Daily Papers

Hunyuan-A13B 是一个开源的大型语言模型,采用专家混合架构,在推理时激活 130 亿参数,并具备双模式思维链框架,以实现对复杂任务的自适应推理。

Mach-Mind-4-Flash 技术报告

arXiv cs.CL

本技术报告介绍了 Mach-Mind-4-Flash,一个拥有35B参数(3B激活参数)的混合专家(MoE)代理模型,仅通过后训练优化即可达到或超越100B参数级别的模型性能。它提出了一种新颖的训练基础设施,包括动态多教师调度、多教师在线策略蒸馏以及用于令牌效率的混合中位长度策略优化。