标签
Qwen3.8 Max 经过升级后,以45分的AI分析智能指数得分领跑中国AI排行榜,超越了GLM-5.3和Kimi K3,这是其2.4T MoE模型在30天内优化提升的结果。
在采用 slotstream 技术的低内存设备上运行 MoE 模型时,专家前瞻技术的实现带来了超过 10% 的性能提升,修正模型还能带来额外的增益。
DeepSeek-V4.1-Flash的永久修改版本,彻底移除安全护栏,保留完整功能,包括视觉、推理和工具,并在HarmBench评估中实现100%合规。
一种 llama.cpp 实现,可在推理阶段通过自适应阈值与分层线性衰减将 MoE 专家路由扩展至原生 top-K 之外,无需重新训练或微调。
一位开发者构建了 llama.cpp 的自定义分支,为混合专家(MoE)模型实现了专家扩展功能,已在 Metal 上完成测试,现寻求跨平台反馈。
据一位团队成员称,IFM AI 的 K2-Horizon-400B-MoE 在 Artificial Analysis 基准测试中持续领先于 Thinking Machine 的 Inkling,该成员强调了这家成立仅一年的实验室所取得的进步。
本文诊断了 MoE+LoRA 微调中的适配器内竞争,并介绍了 SpawnLoRA,该方法动态添加子适配器以减少跨领域的负迁移。
自一年前加入 Open Athena 以来,Marin 的全职员工数量已从 1 名增长至 10 名。该团队目前正在进行一次大规模的 535B/A23B 混合专家(Mixture of Experts)模型训练。
Ant 的 Ling 团队发布了 Ling-3.0-flash-Fin,这是一款专为金融工作流设计的金融增强版 AI 模型,OpenRouter 访问免费一个月,并计划开源权重。
ExFold是一个统一的无训练框架,通过将被排除专家的贡献折叠到保留专家中,加速MoE模型推理,实现高达1.41倍的加速,同时保持高质量。
阿里巴巴将于今晚23点在魔搭开源Qwen3.8-Flash-Next模型,采用Qwen4的GDN混合层和稀疏注意力架构,但缺乏基准测试数据。
作者分享了测试量化对本地LLM在智能体使用中的影响的结果,发现许多量化版本在统计上无法区分,MoE模型受量化影响小于密集模型,而在Q4量化以下会出现显著性能下降。
PyTorch 提供了一个原生微调库,支持首日 Hugging Face 检查点,适用于阿里巴巴的开源权重 Qwen3.8-2.4T-A95B 模型,可在 NVIDIA 系统上进行高效训练和部署,并支持可配置推理。
Ornith-1.5,一个开源大语言模型家族,推出版本高达397B MoE,在同类模型中达到最先进的性能,并在基准测试中与Claude Opus相媲美。
本文对比了NVIDIA DGX Spark和魔改RTX 4090在本地部署Qwen3.8-27B和Ling-3.0-flash模型的性能,提供了基准测试数据和购买建议。
英伟达发布了其针对 MOPD 的专家模型,并通过专为竞赛编程和代码推理设计的 NVIDIA-Nemotron-Labs-Teacher-Competition-Coding 模型,使人工智能研究更加易于访问。
围绕即将发布的 Qwen 3.8 的猜测,质疑它会是稠密 27B 模型还是类似此前 35B-A3B 的 MoE 变体,并讨论了对本地硬件性能的影响。
本文介绍了双流Transformer,一种通过添加辅助流进行续写预测、同时共享权重和主KV缓存来解耦预填充和解码计算的架构,从而实现分阶段计算分配并提高效率。
讨论在12GB显存上运行LLM,注意到当前焦点是稠密模型,如Muse Glimmer 30B和Qwen 3.8 27B,并质疑是否需要升级到24GB显存。
作者在10万个样本上训练了一个40M参数的连接器,使DeepSeek V4 Flash获得基础的视觉能力,同时冻结语言模型和MoonViT图像编码器,展示了将纯文本MoE转变为基础VLM的低成本方法。