XingChen-AGI/Xing4.0-29B-A4B MoE 混合专家模型

Reddit r/LocalLLaMA 模型

摘要

Xing4.0-29B-A4B 是一款由中国电信开发的下一代混合专家大语言模型,具有290亿总参数,每个令牌激活40亿参数,原生支持256K上下文长度,并针对 Ascend NPU 进行了优化,采用面向代理的架构以处理复杂工程任务。

我在 Hugging Face 上发现了另一个新模型:https://huggingface.co/XingChen-AGI/Xing4.0-29B-A4B “Xing4.0-29B-A4B 是星辰系列(前身为 TeleChat)的下一代大语言模型,由中国电信人工智能技术有限公司开发。该模型具有290亿总参数,每个令牌仅激活40亿参数,原生支持256K上下文长度,可扩展至512K。它是首个完全在 Ascend NPU 平台上使用 MindSpore 框架训练的此类规模模型,并针对复杂工程任务进行了深度优化。更多信息,请参阅我们的 GitHub 仓库。 亮点 面向代理的架构:基于 mHC + MLA + MTP 架构构建,支持多步骤规划、工具调用和复杂推理链执行,确保在长上下文下的任务连贯性和执行稳定性。 与 Ascend NPU 的深度协同优化:使用 MindSpore/MindFormers 适配了 Ascend 910C 集群,包括对 mHC 的特性适配和融合算子开发,使训练在 Ascend 平台上稳定高效。 显著的训练效率提升:通过多层次协同优化——包括细粒度 MoE 通信优化、选择性重计算、DVM 自动图算子融合和 Ascend C mHC 融合算子——整体训练吞吐量比开箱即用性能提升了约 96%。 完整的开源生态系统兼容性:支持 LLaMA-Factory 和 MindFormers 进行微调;支持 SGLang、vLLM 和 KTransformers 进行推理和部署;并对 OpenCode、Claude Code、OpenClaw 和 Hermes 等代理框架进行了针对性适配和格式对齐,实现与现有工作流的无缝集成。 易于适应特定领域场景:该模型非常适合下游任务微调,允许在私有数据上进行轻量级定制,用于意图分类、表格理解、合同审核和基于知识的问答等垂直领域,实现低成本快速领域能力开发和部署。” 参数 参数量 290亿(激活40亿) 层数 40 隐藏维度 3584 密集中间维度 9216 专家中间维度 1024 注意力类型 MLA 路由专家数 64 每个令牌激活专家数 4 共享专家数 1 上下文长度 256K(可扩展至512K) 基准测试 基准测试 Xing4.0-29B-A4B Gemma4-26B-A4B Qwen3.6-35B-A3B IFBench 69.67 72.67 65.50 AIME2026 90.00 88.30 92.70 AA.LCR 61.00 66.00 62.00 Tau3-Bench 64.63 58.90 67.20 Claw-Eval 76.55 71.49 74.54 SWE-bench Verified 75.00 53.00 76.00 Terminal-Bench 2.1 57.50 30.00 51.50 SWE-bench Multilingual 66.00 51.00 67.20 DeepresearchBII 60.80 39.30 59.70
查看原文

相似文章

XingChen-AGI/Xing4.0-29B-A4B

Hugging Face Models Trending

Xing4.0-29B-A4B 是一个开源的290亿参数大型语言模型,针对智能体任务和 Ascend NPU 进行了优化,采用 MoE 架构,实现高训练效率,并在基准测试中取得有竞争力的结果。

XiaomiMiMo/MiMo-V2.5-Pro

Hugging Face Models Trending

小米发布了 MiMo-V2.5-Pro,这是一个开源的 MoE 语言模型,拥有 1.02T 总参数和 1M token 上下文长度,专为复杂的智能体(Agent)和软件工程任务进行了优化。

meituan-longcat/LongCat-2.0

Hugging Face Models Trending

LongCat-2.0 是一个大规模 MoE 语言模型,总参数量 1.6 万亿,每个 token 激活约 48B 参数,使用 AI ASIC 超级计算集群和 1M 上下文数据训练而成。在编码和智能体任务上表现出色。

LGAI-EXAONE/K-EXAONE-2.0-750B-A37B

Hugging Face Models Trending

LG AI Research introduces K-EXAONE 2.0, a frontier-scale multilingual MoE model with 750B total parameters (37B active), upcycled and trained for advanced reasoning, agentic workflows, and long-context understanding, released under Apache 2.0.