Hunyuan-A13B 技术报告

Hugging Face Daily Papers 论文

摘要

Hunyuan-A13B 是一个开源的大型语言模型,采用专家混合架构,在推理时激活 130 亿参数,并具备双模式思维链框架,以实现对复杂任务的自适应推理。

我们推出 Hunyuan-A13B,一个基于专家混合架构的开源大型语言模型。它包含 800 亿总参数,但在推理时仅激活 130 亿参数,平衡了模型能力、计算效率和部署成本。该模型在严格过滤的 20 万亿 token 语料库上进行预训练,并加强了 STEM 数据策展,提高了事实可靠性和推理能力。高质量的监督微调和大规模强化学习进一步提升了其整体性能。Hunyuan-A13B 还引入了双模式思维链框架,根据任务复杂度自适应推理深度:对常规查询采用快速思考,对复杂多步问题采用慢速思考。评估显示,该模型在数学、科学、编程、通用语言理解和代理任务等方面表现出竞争力,性能常接近更大的模型。其高推理吞吐量使其适用于延迟敏感的应用。我们发布 Hunyuan-A13B 以支持开放研究和实际 LLM 部署。
查看原文
查看缓存全文

缓存时间: 2026/09/24 03:38

论文页面 - Hunyuan-A13B 技术报告

来源:https://huggingface.co/papers/2609.27284 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

我们推出 Hunyuan‑A13B,这是一款基于混合专家架构的开源大语言模型。模型总参数量达 800 亿,但推理时仅激活 130 亿参数,在模型能力、计算效率与部署成本之间实现了平衡。该模型基于经过严格筛选的 20 万亿 token 语料库进行预训练,并强化了 STEM 数据的构建,从而提升了事实可靠性与推理能力。通过高质量的监督微调和大规模强化学习,模型的整体性能得到进一步提升。Hunyuan‑A13B 还引入了双模式思维链框架,可根据任务复杂度自适应调整推理深度:针对常规查询进行快速思考,针对复杂多步骤问题进行慢速思考。评估结果显示,该模型在数学、科学、编程、通用语言理解及智能体任务上均表现出具有竞争力的性能,常可接近规模更大的模型。其高推理吞吐量使其适用于对延迟敏感的应用场景。我们发布 Hunyuan‑A13B 以支持开放研究与大语言模型的实际部署。

查看 arXiv 页面 (https://arxiv.org/abs/2609.27284)查看 PDF (https://arxiv.org/pdf/2609.27284)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.27284)

在您的智能体中获取此论文:

hf papers read 2609\.27284

还没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型数量:0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.27284 即可从本页链接。

引用此论文的数据集数量:0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.27284 即可从本页链接。

引用此论文的 Space 数量:0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.27284 即可从本页链接。

包含此论文的收藏集数量:0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接。

相似文章

Motif 3:技术报告

Hugging Face Daily Papers

Motif 3 是一个具有 3140 亿参数的混合专家语言模型,每个 token 激活 132 亿参数,采用分组差分潜在注意力,并在 12.5 万亿 token 上完成训练,在推理、编程和长上下文任务中展现出具有竞争力的性能。

JetBrains/Mellum2-12B-A2.5B-Thinking

Hugging Face Models Trending

JetBrains releases Mellum2-12B-A2.5B-Thinking, an open-source Mixture-of-Experts reasoning model with 131k context length, trained with RLVR for explicit chain-of-thought reasoning.

AIDC-AI/Ovis2.6-80B-A3B · Hugging Face

Reddit r/LocalLLaMA

Ovis2.6-80B-A3B 是 AIDC-AI 最新发布的多模态大语言模型,采用混合专家(Mixture-of-Experts)架构,总参数达 80B,但在推理时仅激活 3B 参数。该模型具备增强的长上下文处理能力、高分辨率理解能力以及主动视觉推理能力。

XingChen-AGI/Xing4.0-29B-A4B

Hugging Face Models Trending

Xing4.0-29B-A4B 是一个开源的290亿参数大型语言模型,针对智能体任务和 Ascend NPU 进行了优化,采用 MoE 架构,实现高训练效率,并在基准测试中取得有竞争力的结果。