ascend-tribe/openPangu-2.0-Flash(他们尚未上传至HuggingFace)

Reddit r/LocalLLaMA 模型

摘要

openPangu-2.0-Flash 是一个 92B MoE 模型,激活参数为 6B,上下文长度为 512k,在昇腾上使用 34T tokens 训练,融合了慢速/快速思维以及多个RL训练阶段。

https://ai.gitcode.com/ascend-tribe/openPangu-2.0-Flash openPangu-2.0-Flash 是一个在昇腾上训练的 MoE 模型。该模型总参数为 92B,激活参数为 6B,上下文长度为 512k。预训练数据总量包含 34T tokens。在后训练阶段,openPangu-2.0-Flash 通过统一的 SFT 训练,具备慢速和快速思维能力、多个专家RL训练、以及结合多个RL专家的在策略蒸馏。
查看原文

相似文章

README_EN.md · openpangu/openPangu-2.0-Flash at main

Reddit r/LocalLLaMA

openPangu-2.0-Flash 是一个拥有920亿参数(其中60亿激活参数)的MoE模型,基于昇腾训练,支持512k上下文长度并具备快速思考能力。它在推理和编码基准测试上表现强劲,采用了MLA注意力及多令牌预测等架构创新。

stepfun-ai/Step-3.7-Flash-GGUF

Hugging Face Models Trending

StepFun 发布了其 198B 参数的稀疏 MoE 视觉语言模型 Step-3.7-Flash 的 GGUF 量化版本,支持本地部署,最高 256K 上下文长度和可选择的推理级别。