标签
阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next,这是Qwen4架构的开源预览版,仅从125B参数中激活6B参数,以降低推理成本并解决硬件限制。
本文发布了Qwen3.8-Flash-Next模型的FP8量化权重,介绍了如混合注意力机制(Hybrid Attention with QSA)、门控残差(Gated Residual)和N-gram嵌入(N-gram Embedding)等架构创新,以提高大型语言模型的效率。