@_akhaliq: A.X K2 刚刚在 Hugging Face 上发布 大规模稀疏MoE (688B / 33B 激活参数) https://huggingface.co/skt/A.X-K2

X AI KOLs Following 模型

摘要

SKT 在 Hugging Face 上发布了 A.X K2,一个 688B 参数的稀疏 MoE 语言模型,拥有 33B 激活参数,原生采用 FP8 训练,并具备 Think/Non-Think 推理模式。

A.X K2 刚刚在 Hugging Face 上发布 大规模稀疏MoE(688B / 33B 激活参数) https://t.co/nVr17DscD3 https://t.co/zOHc6ineWn
查看原文
查看缓存全文

缓存时间: 2026/07/30 05:50

A. X K2 刚刚在 Hugging Face 上发布 大规模稀疏 MoE(688B / 33B 活跃参数) https://t.co/nVr17DscD3 https://t.co/zOHc6ineWn


skt/A.X-K2 · Hugging Face

来源:https://huggingface.co/skt/A.X-K2

A. X 标志 🤗 模型 (https://huggingface.co/collections/skt/ax-k2) | 🖥️ Github (https://github.com/SKT-AI/A.X-K2) | 📄 技术报告 (https://github.com/SKT-AI/A.X-K2/blob/main/A_X_K2_Tech_Report.pdf)

https://huggingface.co/skt/A.X-K2#model-summary

模型摘要

A. X K2 是一个从头开始训练的大规模专家混合(MoE)语言模型,旨在作为高性能的智能体基础模型,是 A. X K1 的继任者。该模型拥有 6880 亿总参数,其中 330 亿活跃参数,在保持实际推理效率的同时,展现出强大的推理与指令遵循能力。通过**“思考-融合”训练方案,单一统一模型支持思考模式(用于复杂问题解决)和非思考模式(用于简洁、低延迟的响应),允许用户根据每次请求权衡质量与成本。A. X K2 是韩国政府主权 AI 基础模型**项目的一部分,旨在构建一个对韩语和韩文化有深刻理解的前沿规模模型。

https://huggingface.co/skt/A.X-K2#key-features

主要特点

  • 大规模稀疏 MoE (688B / 33B 活跃参数) 采用高容量专家混合架构(256 个路由专家 + 1 个共享专家),每个词元仅激活 8 个专家,从而在保持实用推理效率的同时,实现强大的推理性能。相较于 A. X K1,路由专家数量从 192 个增加到 256 个,同时保持激活参数数为 330 亿。
  • 混合推理控制(思考/非思考) 通过“思考-融合”方案支持用户可控制的推理深度,允许在单一统一模型内执行显式的多步推理或简洁的低延迟响应。
  • 用于高效长上下文推理的稀疏门控注意力 (SGA) 在多头潜在注意力 (MLA) 之上,结合了轻量级稀疏注意力索引器(前 k 个词元选择)与特定头部的门控注意力。这在长上下文场景下剪枝注意力计算并抑制注意力沉点,从而在长序列长度下实现更高的吞吐量和更低的延迟。
  • 用于稳定训练和低精度服务的门控范数 (GN) 在 RMSNorm 之后立即应用一个依赖于输入的门控,以抑制大规模激活和隐藏状态异常值。这稳定了大规模训练,并产生了一个抑制异常值的激活分布,有利于低精度(FP8 / NVFP4)部署。
  • 原生 FP8 训练和 FP8 检查点 A. X K2 从头开始**以原生 FP8 格式(MXFP8, E4M3)进行前向和反向传播训练,发布的检查点以块缩放 FP8(E4M3)**格式分发。这与 BF16 相比,将内存占用减半,并开箱即用地支持高效 FP8 服务,无需单独的后期量化步骤。
  • 针对多语言和代码数据优化的分词器 继承了 A. X K1 的大词汇量基于 BBPE 的分词器,针对五种语言(英语、韩语、中文、日语和西班牙语)的词元效率进行了优化,并特别强调源代码、结构化文本和编程相关模式。

https://huggingface.co/skt/A.X-K2#model-details

模型详情

  • 架构: 仅解码器 Transformer 与专家混合 (MoE)
  • 总参数: 6880 亿(256 个路由专家 + 1 个共享专家)
  • 活跃参数: 每个词元 330 亿(8 个专家 + 1 个共享专家)
  • 层数: 61(1 个密集层 + 60 个 MoE 层)
  • 注意力头数: 64
  • 隐藏层大小: 7168
  • 中间层大小: 18432(密集层)
  • 专家中间层大小: 2048
  • 注意力: 多头潜在注意力 (MLA),带特定头部输出门控和稀疏注意力 (SGA)
  • 归一化: 门控范数(在 RMSNorm 后应用门控),使用 QK-归一化
  • 词汇表大小: 163,840
  • 上下文长度: 262,144 个词元 (256K) — 原生训练至 128K,通过 YaRN 缩放扩展至 256K
  • 训练精度: 原生 FP8(MXFP8, E4M3)前向和反向传播;FP32 主权重和梯度
  • 检查点精度: 块缩放 FP8(E4M3, 128×128 权重块,动态激活缩放)

https://huggingface.co/skt/A.X-K2#architecture-highlights

架构亮点

A. X K2 基于门控 Transformer 模块构建,该模块将两种门控机制集成到 MoE Transformer 模块中:注意力子层中的稀疏门控注意力 (SGA)和归一化路径上的门控范数 (GN)。它们共同保持大规模训练的稳定性,同时使长上下文推理和低精度服务变得高效。

A. X K2 带有稀疏门控注意力 (SGA) 子层的 Transformer 模块 A. X K2 Transformer 模块。一个轻量级索引器对键值候选进行评分和排序,选择器保留前 k 个索引;MLA 随后对选定的 KV 缓存执行潜在注意力。一个特定头部的输出门控在输出投影之前调制注意力输出,而门控范数则位于子层之前,以平滑异常值,从而实现稳定、低精度(FP8/FP4)计算。

https://huggingface.co/skt/A.X-K2#sparse-gated-attention-sga

稀疏门控注意力 (SGA)

A. X K2 将两种机制结合到 SGA 中,以使长上下文推理高效,同时保持训练稳定:

  • 门控注意力: 在 MLA 之上,在整个预训练过程中应用一个特定头部的输出门控。它为注意力输出引入非线性,减轻注意力沉点,并改善损失收敛。
  • 稀疏注意力: 一个轻量级索引器对键值候选进行评分和排序,为每个查询选择一小部分前 k 个词元(k = 2048),从而在长序列长度下大幅减少注意力计算量。

这两种机制相互促进:通过抑制非信息性词元上的注意力沉点质量,输出门控提供校准更良好的信号,使索引器将其有限的预算用于真正相关的位置。在长上下文服务中,当输入长度增长到数万个词元时,采用 SGA 的 A. X K2 相比 A. X K1,能够维持显著更高的词元吞吐量、更低的每个输出词元时间 (TPOT) 和更低的首次词元时间 (TTFT)。

https://huggingface.co/skt/A.X-K2#gated-norm-gn

门控范数 (GN)

A. X K2 采用门控范数,其中学习到的、依赖于输入的门控在归一化激活进入残差流之前对其进行调制。通过防止归一化输出拟合异常值标量,GN 抑制了大规模激活——那些在层间持续存在、数值上远大于其他部分的隐藏单元,这已被证明是训练不稳定和低精度量化误差的来源之一。通过这种设计,训练无需 A. X K1 中使用的双重归一化方案即可保持足够稳定:门控范数的单一后归一化门控吸收了早期设计的稳定效果,同时降低了架构复杂性。另一个好处是,由此产生的激活分布(异常值被抑制)在狭窄的低精度格式(如 FP8 和 NVFP4)下改善了块缩放利用率。

https://huggingface.co/skt/A.X-K2#think-fusion-hybrid-reasoning

思考-融合(混合推理)

A. X K2 使用单一模型生成响应,可以根据使用需求启用或禁用在答案之前的推理过程。这是通过 “思考-融合” 方案实现的,该方案通过一个配对的监督微调 (SFT) 数据集,将思考和思考训练统一到一个轨道中,然后进行多阶段基于策略的强化学习。

  • 思考模式: 在给出答案之前生成推理步骤 (......),用于复杂问题解决和多步推理。
  • 非思考模式: 生成简洁、直接的响应,针对低延迟使用场景进行了优化。

A. X K2 并非采用双轨策略,而是使用一个配对的 SFT 数据集将训练统一到单个轨道中。在该数据集中,每个提示都与一个思考响应和一个非思考响应相关联,从而使模型从显式控制词元中学习模式控制,而非依赖于类别特定的伪影。

https://huggingface.co/skt/A.X-K2#training-data

训练数据

A. X K2 在大约 8.2 万亿词元的网络文本、源代码、学术论文、STEM 和问答材料、书籍以及合成数据上进行了预训练,采用三阶段、难度递增的课程(6.4T 通用知识 → 1.4T 高质量推理 → 0.36T 长上下文扩展)。第一阶段设计的语言混合比例为:英语 72.7%,韩语 15.4%,代码 8.3%,日语、西班牙语和中文各约 1%;后续阶段进一步转向英语以及推理、智能体和长上下文数据。

来源。 英语网络文本来自一个聚合语料库,其最大单一贡献者是 Nemotron-CC-v2.1 (https://huggingface.co/datasets/nvidia/Nemotron-CC-v2.1);代码来自 Nemotron-Pretraining-Code-v2 (https://huggingface.co/datasets/nvidia/Nemotron-Pretraining-Code-v2);多语言覆盖来自 FineWeb2 (https://huggingface.co/datasets/HuggingFaceFW/fineweb-2)。韩语网络文本来自内部爬取(约 1.37T 词元),辅以内部 PDF 解析流程和合成数据。这些内部组件是专有的,并未发布。上述 datasets 元数据列出的是主要公开数据集,而非详尽清单;一些较小的额外网络来源并未单独列出。

整理。 基于启发式和模型的去重质量过滤、域感知的混合与上采样,以及用于课程学习的难度评分。文档根据教育价值和难度进行评分,并由域分类器进行划分,质量阈值按域而非全局应用,并随着训练的推进而收紧;大约 16.2T 词元的候选池被缩减为实际用于训练的 8.2T 词元。

个人信息。 内部收集的语料库在训练前经过内部 PII 屏蔽流程:检测到的标识符(主要是电子邮件地址和电话号码等数字标识符)将被替换为特定类型的占位符词元(例如 <|email|>),而非删除,因此周围文本得以保留;检测规则按标识符类型进行维护,并针对误报进行审核。上面列出的公开数据集按原样使用,不进行再处理,因为其发布者已经实施了他们自己的 PII 处理。

数据来源。 训练中使用的每个语料库的来源和收集方法都记录在内部数据集清单中,并且每个来源都经过其允许使用范围的审查。内部收集的网络数据是根据 robots.txt 指令进行的。上面列出的公开数据集根据其发布的许可使用,第三方语料库是通过协议获取的,该协议许可将其用于模型训练并允许发布生成的模型,但禁止重新分发底层数据本身。

后训练。 两个监督微调阶段,随后是多任务 RL 和安全/红队 RL。SFT 阶段消耗大约 606 亿词元的配对思考/非思考示例,涵盖智能体工具使用、数学、知识与科学、代码、通用聊天、指令遵循和安全;后续的 RL 阶段运行在约 10 万个提示上。安全监督建立在 ESSA (https://openreview.net/forum?id=Imcv0X7c36)(演化安全规范对齐)之上,该机制根据演化的领域-任务安全规范来调整数据合成,并奖励安全完成而非全面拒绝。有关完整的数据流程、混合比率表和后训练方案,请参阅技术报告 (https://github.com/SKT-AI/A.X-K2/blob/main/A_X_K2_Tech_Report.pdf)。

https://huggingface.co/skt/A.X-K2#evaluation-results

评估结果

https://huggingface.co/skt/A.X-K2#thinking-mode

思考模式

所有模型均在思考模式下进行评估。标有星号 (*) 的基准测试由 Artificial Analysis (https://artificialanalysis.ai/) 评估。所有基准测试结果均以百分比形式报告。每行中的最佳得分以粗体显示。评估详情请参阅技术报告 (https://github.com/SKT-AI/A.X-K2/blob/main/A_X_K2_Tech_Report.pdf)。

领域基准测试A. X K2 (688B-A33B)A. X K1 (519B-A33B)Qwen3.5 (397B-A17B)Nemotron 3 UltraDeepSeek-V4 FlashGLM-5.1Kimi-K2.6MiniMax M2.7
数学AIME2697.191.392.585.496.795.495.488.8
Apex45.81.013.53.128.110.420.81.0
Apex-shortlist88.650.861.245.588.072.172.630.3
KMO26 (第一轮)92.585.078.885.094.478.188.180.0
韩语KMMLU-Pro80.568.978.469.278.876.573.466.6
KoBALT73.051.069.959.175.372.066.051.4
CLIcK91.685.388.484.189.688.880.976.1
代码LiveCodeBench v6 (Feb–May)84.074.982.676.489.486.486.569.8
SciCode41.024.142.039.944.943.853.547.0
科学与知识Humanity’s Last Exam27.88.327.326.632.128.035.928.1
GPQA Diamond85.676.489.386.789.486.891.187.4
通用IFBench75.963.279.078.981.278.674.073.2
AA-LCR66.026.066.067.063.062.070.069.0
智能体τ2-Bench* (电信)98.086.095.683.395.097.795.984.8
BrowseComp (≤10 次搜索)9.326.913.416.829.121.514.2

A. X K2 在数学韩语领域最强,在 AIME26、Apex、Apex-shortlist、KMMLU-Pro 和 CLIcK 上均取得了所有对比模型中的最佳分数。除了最终答案基准测试之外,A. X K2 在 IMO 2025 中获得了 35/42 的分数——在前五个问题中各获得完美的 7/7,达到金牌门槛——并使用迭代式证明改进方法,为 KMO26 第二轮的所有 8 个问题生成了正确的证明。它还在所有对比模型中取得了 τ2-Bench 电信领域的最佳分数。

https://huggingface.co/skt/A.X-K2#long-context

长上下文

A. X K2 通过调整基频 (ABF) 原生训练至 128K 上下文,并在推理时通过零样本 YaRN 缩放扩展到更长的序列。我们沿着两个互补的维度评估长上下文能力——在 RULER 上的综合理解能力和通过大海捞针 (NIAH) 进行的长程事实检索能力。详情请参阅技术报告 (https://github.com/SKT-AI/A.X-K2/blob/main/A_X_K2_Tech_Report.pdf)。

https://huggingface.co/skt/A.X-K2#ruler
RULER

RULER 衡量在递增序列长度下,跨检索、多跳追踪、聚合和问答任务的长上下文理解能力。A. X K2 在 256K 长度下保持强劲性能,实现了 94.6 的总体平均分。

模型4K8K16K32K64K128K256K总体
A. X K297.597.297.596.594.392.786.694.6
https://huggingface.co/skt/A.X-K2#needle-in-a-haystack-niah
大海捞针 (NIAH)

NIAH 通过在长上下文中的不同深度插入一个目标事实(“针”),并要求模型将其找回,来探测精确的事实检索能力。在零样本 YaRN 缩放(128K、256K 和 512K 分别使用缩放因子 1、2 和 4)下,A. X K2 在每个上下文长度和针深度均获得完美的检索分数——即使在 NVFP4(仅专家 W4A4)量化后也是如此。下面的热图显示了 256K 和 512K 的结果。

A. X K2 在 NVFP4 (仅专家 W4A4) 下 256K 上下文的大海捞针事实检索 A. X K2 在 NVFP4 (仅专家 W4A4) 下 512K 上下文的大海捞针事实检索

大海捞针事实检索,横轴为上下文长度,纵轴为

相似文章

A.X-K2 发布

Reddit r/LocalLLaMA

A.X-K2 是一款新的人工智能模型,现已发布。