Hunyuan-A13B 技术报告
摘要
Hunyuan-A13B 是一个开源的大型语言模型,采用专家混合架构,在推理时激活 130 亿参数,并具备双模式思维链框架,以实现对复杂任务的自适应推理。
查看缓存全文
缓存时间: 2026/09/24 03:38
论文页面 - Hunyuan-A13B 技术报告
来源:https://huggingface.co/papers/2609.27284 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
我们推出 Hunyuan‑A13B,这是一款基于混合专家架构的开源大语言模型。模型总参数量达 800 亿,但推理时仅激活 130 亿参数,在模型能力、计算效率与部署成本之间实现了平衡。该模型基于经过严格筛选的 20 万亿 token 语料库进行预训练,并强化了 STEM 数据的构建,从而提升了事实可靠性与推理能力。通过高质量的监督微调和大规模强化学习,模型的整体性能得到进一步提升。Hunyuan‑A13B 还引入了双模式思维链框架,可根据任务复杂度自适应调整推理深度:针对常规查询进行快速思考,针对复杂多步骤问题进行慢速思考。评估结果显示,该模型在数学、科学、编程、通用语言理解及智能体任务上均表现出具有竞争力的性能,常可接近规模更大的模型。其高推理吞吐量使其适用于对延迟敏感的应用场景。我们发布 Hunyuan‑A13B 以支持开放研究与大语言模型的实际部署。
查看 arXiv 页面 (https://arxiv.org/abs/2609.27284)查看 PDF (https://arxiv.org/pdf/2609.27284)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.27284)
在您的智能体中获取此论文:
hf papers read 2609\.27284
还没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型数量:0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.27284 即可从本页链接。
引用此论文的数据集数量:0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.27284 即可从本页链接。
引用此论文的 Space 数量:0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.27284 即可从本页链接。
包含此论文的收藏集数量:0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接。
相似文章
Motif 3:技术报告
Motif 3 是一个具有 3140 亿参数的混合专家语言模型,每个 token 激活 132 亿参数,采用分组差分潜在注意力,并在 12.5 万亿 token 上完成训练,在推理、编程和长上下文任务中展现出具有竞争力的性能。
JetBrains/Mellum2-12B-A2.5B-Thinking
JetBrains releases Mellum2-12B-A2.5B-Thinking, an open-source Mixture-of-Experts reasoning model with 131k context length, trained with RLVR for explicit chain-of-thought reasoning.
AIDC-AI/Ovis2.6-80B-A3B · Hugging Face
Ovis2.6-80B-A3B 是 AIDC-AI 最新发布的多模态大语言模型,采用混合专家(Mixture-of-Experts)架构,总参数达 80B,但在推理时仅激活 3B 参数。该模型具备增强的长上下文处理能力、高分辨率理解能力以及主动视觉推理能力。
XingChen-AGI/Xing4.0-29B-A4B
Xing4.0-29B-A4B 是一个开源的290亿参数大型语言模型,针对智能体任务和 Ascend NPU 进行了优化,采用 MoE 架构,实现高训练效率,并在基准测试中取得有竞争力的结果。
Nemotron 3 Ultra:用于智能体推理的高效开源混合专家Mamba-Transformer模型
Nemotron 3 Ultra 是一个550B参数的混合Mamba-Attention专家混合语言模型,在20T tokens上预训练,扩展至1M上下文,并通过SFT、RL和MOPD进行后训练。相比同等精度的一流LLM,其推理吞吐量最高可提升6倍,并已开源。