首页
/
模型
/
XingChen-AGI/Xing4.0-29B-A4B MoE 混合专家模型
XingChen-AGI/Xing4.0-29B-A4B MoE 混合专家模型
摘要
Xing4.0-29B-A4B 是一款由中国电信开发的下一代混合专家大语言模型,具有290亿总参数,每个令牌激活40亿参数,原生支持256K上下文长度,并针对 Ascend NPU 进行了优化,采用面向代理的架构以处理复杂工程任务。
我在 Hugging Face 上发现了另一个新模型:https://huggingface.co/XingChen-AGI/Xing4.0-29B-A4B
“Xing4.0-29B-A4B 是星辰系列(前身为 TeleChat)的下一代大语言模型,由中国电信人工智能技术有限公司开发。该模型具有290亿总参数,每个令牌仅激活40亿参数,原生支持256K上下文长度,可扩展至512K。它是首个完全在 Ascend NPU 平台上使用 MindSpore 框架训练的此类规模模型,并针对复杂工程任务进行了深度优化。更多信息,请参阅我们的 GitHub 仓库。
亮点
面向代理的架构:基于 mHC + MLA + MTP 架构构建,支持多步骤规划、工具调用和复杂推理链执行,确保在长上下文下的任务连贯性和执行稳定性。
与 Ascend NPU 的深度协同优化:使用 MindSpore/MindFormers 适配了 Ascend 910C 集群,包括对 mHC 的特性适配和融合算子开发,使训练在 Ascend 平台上稳定高效。
显著的训练效率提升:通过多层次协同优化——包括细粒度 MoE 通信优化、选择性重计算、DVM 自动图算子融合和 Ascend C mHC 融合算子——整体训练吞吐量比开箱即用性能提升了约 96%。
完整的开源生态系统兼容性:支持 LLaMA-Factory 和 MindFormers 进行微调;支持 SGLang、vLLM 和 KTransformers 进行推理和部署;并对 OpenCode、Claude Code、OpenClaw 和 Hermes 等代理框架进行了针对性适配和格式对齐,实现与现有工作流的无缝集成。
易于适应特定领域场景:该模型非常适合下游任务微调,允许在私有数据上进行轻量级定制,用于意图分类、表格理解、合同审核和基于知识的问答等垂直领域,实现低成本快速领域能力开发和部署。”
参数
参数量 290亿(激活40亿)
层数 40
隐藏维度 3584
密集中间维度 9216
专家中间维度 1024
注意力类型 MLA
路由专家数 64
每个令牌激活专家数 4
共享专家数 1
上下文长度 256K(可扩展至512K)
基准测试
基准测试 Xing4.0-29B-A4B Gemma4-26B-A4B Qwen3.6-35B-A3B
IFBench 69.67 72.67 65.50
AIME2026 90.00 88.30 92.70
AA.LCR 61.00 66.00 62.00
Tau3-Bench 64.63 58.90 67.20
Claw-Eval 76.55 71.49 74.54
SWE-bench Verified 75.00 53.00 76.00
Terminal-Bench 2.1 57.50 30.00 51.50
SWE-bench Multilingual 66.00 51.00 67.20
DeepresearchBII 60.80 39.30 59.70
相似文章
Hugging Face Models Trending
Xing4.0-29B-A4B 是一个开源的290亿参数大型语言模型,针对智能体任务和 Ascend NPU 进行了优化,采用 MoE 架构,实现高训练效率,并在基准测试中取得有竞争力的结果。
Hugging Face Models Trending
小米发布了 MiMo-V2.5-Pro,这是一个开源的 MoE 语言模型,拥有 1.02T 总参数和 1M token 上下文长度,专为复杂的智能体(Agent)和软件工程任务进行了优化。
Hugging Face Models Trending
LongCat-2.0 是一个大规模 MoE 语言模型,总参数量 1.6 万亿,每个 token 激活约 48B 参数,使用 AI ASIC 超级计算集群和 1M 上下文数据训练而成。在编码和智能体任务上表现出色。
Hugging Face Models Trending
LG AI Research introduces K-EXAONE 2.0, a frontier-scale multilingual MoE model with 750B total parameters (37B active), upcycled and trained for advanced reasoning, agentic workflows, and long-context understanding, released under Apache 2.0.
X AI KOLs Following
AntLingAGI发布Ling-3.0-flash,这是一款124B参数的MoE模型,其中5.1B参数为活跃参数,现已在Nous Portal上免费提供一周。它在许多基准测试中匹配甚至超越其1T旗舰模型,专为编码和工具使用等智能体工作负载而设计。