华为开源OpenPangu-2.0-Flash - 总参数量92B,活跃参数量6B
摘要
华为开源OpenPangu-2.0-Flash,这是一个总参数量92B、活跃参数量6B的MoE模型,支持512K上下文,并附带推理代码和训练操作。
https://x.com/Chinazhidx/status/2071877413685109071
今日:#Huawei 开源 OpenPangu-2.0-Flash #OpenPangu 2.0 包含两个支持512K上下文的模型:
• Flash:总参数量92B,活跃参数量6B — 已发布权重、推理代码和训练算子
• Pro:总参数量505B,活跃参数量18B — 旗舰模型,将于7月发布
今年晚些时候会有更多开源组件
https://preview.redd.it/29tji3noteah1.png?width=1446&format=png&auto=webp&s=836b711cc97c5efb3d37126105a11a7d20c49ca2
https://x.com/CalatheaAI/status/2071917592810496273
相似文章
README_EN.md · openpangu/openPangu-2.0-Flash at main
openPangu-2.0-Flash 是一个拥有920亿参数(其中60亿激活参数)的MoE模型,基于昇腾训练,支持512k上下文长度并具备快速思考能力。它在推理和编码基准测试上表现强劲,采用了MLA注意力及多令牌预测等架构创新。
华为发布 openPangu 2.0(将于6月30日开源)
华为宣布推出 openPangu 2.0,这是一个开源大模型,总参数量 505B,稀疏比 28:1,针对昇腾计算和鸿蒙进行了优化,核心组件将于 6 月 30 日起逐步开源。
ascend-tribe/openPangu-2.0-Flash(他们尚未上传至HuggingFace)
openPangu-2.0-Flash 是一个 92B MoE 模型,激活参数为 6B,上下文长度为 512k,在昇腾上使用 34T tokens 训练,融合了慢速/快速思维以及多个RL训练阶段。
@Chinazhidx:蚂蚁集团刚刚发布了Ling-3.0-flash • 124B MoE • 5.1B 活跃参数/令牌 • 256K 上下文,可扩展至1M,仅八分之一……
蚂蚁集团发布了Ling-3.0-flash,这是一个124B MoE模型,每个令牌5.1B活跃参数,256K上下文可扩展至1M,在大多数基准测试中匹配或超越其1T旗舰模型。
@0x0SojalSec: 最终观点:腾讯最近发布了一个295B参数的模型,每个token仅激活21B参数。而大多数实验室仍在……
腾讯发布了Hy3,一个295B参数的MoE模型,每个token激活21B参数,在代理编程和工具使用任务上与更大的模型相竞争,并提供了Apache 2.0权重。