moe

标签

Cards List
#moe

Qwen3.8 Max (0902) 在人工智能分析智能指数上获得45分,一个月内提升5分,重返中国排行榜榜首,以微弱优势超越GLM-5.3 (44.9分) 和Kimi K3 (43.8分)

Reddit r/LocalLLaMA ↗ · 2026-09-16

Qwen3.8 Max 经过升级后,以45分的AI分析智能指数得分领跑中国AI排行榜,超越了GLM-5.3和Kimi K3,这是其2.4T MoE模型在30天内优化提升的结果。

0 人收藏 0 人点赞
#moe

通过专家前瞻技术,在 MoE ssd-streaming 上实现 10% 以上的性能提升

Reddit r/LocalLLaMA ↗ · 2026-09-15

在采用 slotstream 技术的低内存设备上运行 MoE 模型时,专家前瞻技术的实现带来了超过 10% 的性能提升,修正模型还能带来额外的增益。

0 人收藏 0 人点赞
#moe

dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8

Hugging Face Models Trending ↗ · 2026-09-10 缓存

DeepSeek-V4.1-Flash的永久修改版本,彻底移除安全护栏,保留完整功能,包括视觉、推理和工具,并在HarmBench评估中实现100%合规。

0 人收藏 0 人点赞
#moe

一种稀疏 MoE 模型推理架构:通过分层与线性衰减增加激活参数量,无需训练或微调即可实现精简推理 [p]

Reddit r/MachineLearning ↗ · 2026-09-06

一种 llama.cpp 实现,可在推理阶段通过自适应阈值与分层线性衰减将 MoE 专家路由扩展至原生 top-K 之外,无需重新训练或微调。

0 人收藏 0 人点赞
#moe

基于 llama.cpp 的专家扩展

Reddit r/LocalLLaMA ↗ · 2026-09-06

一位开发者构建了 llama.cpp 的自定义分支,为混合专家(MoE)模型实现了专家扩展功能,已在 Metal 上完成测试,现寻求跨平台反馈。

0 人收藏 0 人点赞
#moe

@ssahoo_: 根据 Artificial Analysis 的最新评测,我们的 K2-Horizon-400B-Moe 模型仍然领先于 Thinking Machine 的 Inkling 模型。…

X AI KOLs Timeline ↗ · 2026-09-05 缓存

据一位团队成员称,IFM AI 的 K2-Horizon-400B-MoE 在 Artificial Analysis 基准测试中持续领先于 Thinking Machine 的 Inkling,该成员强调了这家成立仅一年的实验室所取得的进步。

0 人收藏 0 人点赞
#moe

路由不够:诊断 MoE+LoRA 微调中的适配器子空间竞争

arXiv cs.LG ↗ · 2026-09-04 缓存

本文诊断了 MoE+LoRA 微调中的适配器内竞争,并介绍了 SpawnLoRA,该方法动态添加子适配器以减少跨领域的负迁移。

0 人收藏 0 人点赞
#moe

@percyliang:一年前,David 是 Marin 唯一的全职员工。如今,在 Open Athena 的支持下,Marin 已拥有 10 名全职员工。阅读他的帖子,以更好地了解……

X AI KOLs Following ↗ · 2026-09-03 缓存

自一年前加入 Open Athena 以来,Marin 的全职员工数量已从 1 名增长至 10 名。该团队目前正在进行一次大规模的 535B/A23B 混合专家(Mixture of Experts)模型训练。

0 人收藏 0 人点赞
#moe

Ant 发布 Ling-3.0-flash-Fin 用于金融工作流;OpenRouter 访问免费一个月

Reddit r/ArtificialInteligence ↗ · 2026-08-28

Ant 的 Ling 团队发布了 Ling-3.0-flash-Fin,这是一款专为金融工作流设计的金融增强版 AI 模型,OpenRouter 访问免费一个月,并计划开源权重。

0 人收藏 0 人点赞
#moe

ExFold:统一专家折叠框架实现无训练MoE预填充-解码加速

arXiv cs.LG ↗ · 2026-08-27 缓存

ExFold是一个统一的无训练框架,通过将被排除专家的贡献折叠到保留专家中,加速MoE模型推理,实现高达1.41倍的加速,同时保持高质量。

0 人收藏 0 人点赞
#moe

@threerouter_com: 今晚 23 点阿里要在魔搭开源 Qwen3.8-Flash-Next,消息是准的。 但说实话,没跑分就放出来,我持保留态度。官方说是为了给完整 Qwen4 家族做适配,意思就是“你们先试用,我们后面再补成绩单”。架构看着是挺牛——Qwen…

X AI KOLs Timeline ↗ · 2026-08-26 缓存

阿里巴巴将于今晚23点在魔搭开源Qwen3.8-Flash-Next模型,采用Qwen4的GDN混合层和稀疏注意力架构,但缺乏基准测试数据。

0 人收藏 0 人点赞
#moe

量化在智能体使用与本地LLM中的影响?

Reddit r/AI_Agents ↗ · 2026-08-23

作者分享了测试量化对本地LLM在智能体使用中的影响的结果,发现许多量化版本在统计上无法区分,MoE模型受量化影响小于密集模型,而在Q4量化以下会出现显著性能下降。

0 人收藏 0 人点赞
#moe

@PyTorch:利用支持首日Hugging Face检查点的PyTorch原生微调库,适用于最近发布的Alib…

X AI KOLs Following ↗ · 2026-08-20 缓存

PyTorch 提供了一个原生微调库,支持首日 Hugging Face 检查点,适用于阿里巴巴的开源权重 Qwen3.8-2.4T-A95B 模型,可在 NVIDIA 系统上进行高效训练和部署,并支持可配置推理。

0 人收藏 0 人点赞
#moe

@with_gene2626: 什么?397b nvfp4 是一个3或4 Spark配置……显示比所有当前开放权重模型更好的基准测试?有人……

X AI KOLs Following ↗ · 2026-08-19 缓存

Ornith-1.5,一个开源大语言模型家族,推出版本高达397B MoE,在同类模型中达到最先进的性能,并在基准测试中与Claude Opus相媲美。

0 人收藏 0 人点赞
#moe

@MinLiBuilds: https://x.com/MinLiBuilds/status/2089338660386992295

X AI KOLs Timeline ↗ · 2026-08-17 缓存

本文对比了NVIDIA DGX Spark和魔改RTX 4090在本地部署Qwen3.8-27B和Ling-3.0-flash模型的性能,提供了基准测试数据和购买建议。

0 人收藏 0 人点赞
#moe

@natolambert: 很高兴看到 @NVIDIAAI 发布了他们的 MOPD 专家模型。这使得该领域的研究变得更加容易访问(尽管…

X AI KOLs Following ↗ · 2026-08-14 缓存

英伟达发布了其针对 MOPD 的专家模型,并通过专为竞赛编程和代码推理设计的 NVIDIA-Nemotron-Labs-Teacher-Competition-Coding 模型,使人工智能研究更加易于访问。

0 人收藏 0 人点赞
#moe

我们会迎来 Qwen 3.8 35-A3B 吗?

Reddit r/LocalLLaMA ↗ · 2026-08-14

围绕即将发布的 Qwen 3.8 的猜测,质疑它会是稠密 27B 模型还是类似此前 35B-A3B 的 MoE 变体,并讨论了对本地硬件性能的影响。

0 人收藏 0 人点赞
#moe

双流Transformer:将主预填充路径与额外解码计算解耦

arXiv cs.AI ↗ · 2026-08-14 缓存

本文介绍了双流Transformer,一种通过添加辅助流进行续写预测、同时共享权重和主KV缓存来解耦预填充和解码计算的架构,从而实现分阶段计算分配并提高效率。

0 人收藏 0 人点赞
#moe

12GB显存的小伙伴们,我们的计划是什么?

Reddit r/LocalLLaMA ↗ · 2026-08-11

讨论在12GB显存上运行LLM,注意到当前焦点是稠密模型,如Muse Glimmer 30B和Qwen 3.8 27B,并质疑是否需要升级到24GB显存。

0 人收藏 0 人点赞
#moe

我通过在10万个示例上训练一个40M连接器,为DeepSeek V4 Flash赋予了基础视觉能力

Reddit r/LocalLLaMA ↗ · 2026-08-11

作者在10万个样本上训练了一个40M参数的连接器,使DeepSeek V4 Flash获得基础的视觉能力,同时冻结语言模型和MoonViT图像编码器,展示了将纯文本MoE转变为基础VLM的低成本方法。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈