标签
Ling-3.0的模型发布提供了六个基础检查点,涵盖tiny和flash变体在预训练、中训练和WSM合并阶段的版本,允许用户继续训练或比较模型演进。
Ling-3.0 (BailingMoE3) 现已在 llama.cpp 中获得官方支持,基准测试显示在 Intel Arc B580 上可实现高效本地推理,包括在 12GB 显存中处理 128K 上下文。
新的 Ling 3.0 推理模型的支持已集成到 llama.cpp 中,使得通过这个开发工具可以访问它们。
蚂蚁集团发布Ling-3.0-flash,一种混合推理MoE模型,总参数量124B,每个token仅激活5.1B参数,在大多数基准测试中与其1T旗舰模型性能相当。