mixture-of-experts

标签

Cards List
#mixture-of-experts

内存墙的另一半:使用训练路由预测从SSD服务35B MoE模型

arXiv cs.AI ↗ · 2026-09-17 缓存

Edge0是一个流式MoE推理引擎,它使用训练路由预测从SSD服务35B混合专家模型,在消费级硬件上实现接近fp16的性能,且内存使用率低。

0 人收藏 0 人点赞
#mixture-of-experts

Colla-Q:通过最小最大精度平衡在MoE量化中实现协作专家

arXiv cs.LG ↗ · 2026-09-17 缓存

本文介绍了Colla-Q,一种基于激活熵的比特分配框架,用于量化混合专家模型,以平衡专家性能,提高整体模型效率并减少对校准数据集的依赖。

0 人收藏 0 人点赞
#mixture-of-experts

超越前一层:稀疏MoE路由中的残差预测结构

arXiv cs.LG ↗ · 2026-09-17 缓存

本文研究稀疏混合专家模型中早期专家选择在超越最近层后的预测价值,发现跨层路由预测有显著增益。

0 人收藏 0 人点赞
#mixture-of-experts

DeepSeek-V4.1-Flash:推动KV缓存压缩的极限

Hugging Face Daily Papers ↗ · 2026-09-17 缓存

介绍了DeepSeek-V4.1-Flash,一个多模态混合专家(MoE)模型,拥有552B参数,采用先进的KV缓存压缩技术,以降低部署成本并提升长上下文代理工作负载的效率。

0 人收藏 0 人点赞
#mixture-of-experts

@EmperoAI: Qwen3.8-35B-A3B-Distill - 我们的首个MoE模型。Qwen3.8推理能力蒸馏至Qwen3.6-35B-A3B:总参数35B,活跃参数约3B。ARC-C…

X AI KOLs Following ↗ · 2026-09-16 缓存

Empero AI发布其首个MoE模型Qwen3.8-35B-A3B-Distill,该模型将Qwen3.8的推理能力蒸馏到一个更小、更高效的架构中,在ARC-Challenge基准测试上显示出改进。

0 人收藏 0 人点赞
#mixture-of-experts

XingChen-AGI/Xing4.0-29B-A4B

Hugging Face Models Trending ↗ · 2026-09-16 缓存

Xing4.0-29B-A4B 是一个开源的290亿参数大型语言模型,针对智能体任务和 Ascend NPU 进行了优化,采用 MoE 架构,实现高训练效率,并在基准测试中取得有竞争力的结果。

0 人收藏 0 人点赞
#mixture-of-experts

密集输出头和稀疏路由器中的Z-Loss反向几何

arXiv cs.LG ↗ · 2026-09-16 缓存

本文分析了Z-loss在人工智能模型训练中的反向传播几何,提供了一个框架来理解和优化密集输出头与稀疏混合专家路由器中的梯度,并在GPT-2和Pythia模型上进行了评估。

0 人收藏 0 人点赞
#mixture-of-experts

North Small Translate: 先进的性价比翻译 (Cohere CAT+)

arXiv cs.CL ↗ · 2026-09-15 缓存

North Small Translate 是一个基于LLM的开源机器翻译模型,拥有250亿活动参数,无需在推理时进行昂贵推理,即可在其类别中实现跨50种语言的顶级性能。

0 人收藏 0 人点赞
#mixture-of-experts

任务感知的基于MoE大型语言模型的联邦微调

arXiv cs.LG ↗ · 2026-09-15 缓存

本文提出了FedTAR,一种针对基于MoE的大型语言模型的任务感知联邦微调方法,该方法通过将本地更新与任务偏好对齐,以在异构数据下保留专家专业化并提高性能。

0 人收藏 0 人点赞
#mixture-of-experts

MoE强化学习中的专家空间探索

arXiv cs.CL ↗ · 2026-09-14 缓存

本文提出ESRL,一种通过探索专家路由路径来增强混合专家模型训练的强化学习框架,从而在数学、科学和编程任务上取得性能提升。

0 人收藏 0 人点赞
#mixture-of-experts

平滑长上下文混合专家训练中的所有内存峰值

Hugging Face Daily Papers ↗ · 2026-09-13 缓存

本文介绍了管理长上下文长度下训练大型混合专家模型内存峰值的技术,包括Pipelined LLEP、Ring-DTP、SCO和OffloadStreamAdamW,这些技术实现了固定的GPU工作集,并将吞吐量提高了多达10.4倍。

0 人收藏 0 人点赞
#mixture-of-experts

yandex/AliceAI-Foundation-80B-A3B-Base

Hugging Face Models Trending ↗ · 2026-09-12 缓存

Yandex 发布了 AliceAI-Foundation-80B-A3B-Base,这是一种基础语言模型,采用混合架构和 MoE 层,拥有 800 亿参数(每个 token 激活 30 亿参数),从头开始训练,在俄语事实知识任务中表现出色。

0 人收藏 0 人点赞
#mixture-of-experts

有人在使用 K2-Horizon-MoVA-36B-A4B 吗?如果有的话,用途是什么?

Reddit r/LocalLLaMA ↗ · 2026-09-11

本文讨论了最近发布的 K2-Horizon-MoVA-36B-A4B MoE 模型,并询问其当前使用情况和潜在用例,提供了一个模型比较的链接。

0 人收藏 0 人点赞
#mixture-of-experts

internlm/Atria-Dawn-Preview

Hugging Face Models Trending ↗ · 2026-09-11 缓存

Atria Dawn Preview 是来自 Shanghai AI Lab 的一款新型代理AI模型,基于744B参数MoE GLM-5.2基础构建,专为需要持续环境理解和工具使用的研究和工程任务设计。

0 人收藏 0 人点赞
#mixture-of-experts

M3-Former: 用于长期船舶轨迹预测的多模态变换器与混合专家模型

arXiv cs.LG ↗ · 2026-09-11 缓存

M3-Former 是一个多模态变换器模型,它使用混合专家模型和大语言模型增强的语义融合来预测长期船舶轨迹,并具有更高的准确性和鲁棒性。

0 人收藏 0 人点赞
#mixture-of-experts

North Small Translate 模型卡 (8分钟阅读)

TLDR AI ↗ · 2026-09-11 缓存

CohereLabs 发布了 North Small Translate,这是一个开放权重的稀疏混合专家模型,拥有250亿活跃参数,用于支持50种语言的高质量机器翻译。

0 人收藏 0 人点赞
#mixture-of-experts

Cognition的SWE-2在Terminal-Bench 2.1上达到92.8分

Hacker News Top ↗ · 2026-09-10 缓存

Cognition的SWE-2模型,基于Kimi K3进行后训练,在Terminal-Bench 2.1上获得92.8分,相较于前沿模型如Fable 5.1和GPT-6 Astra,提供具有竞争力的性能且成本更低。

0 人收藏 0 人点赞
#mixture-of-experts

deepseek-ai/DeepSeek-V4.1-Flash · Hugging Face

Reddit r/LocalLLaMA ↗ · 2026-09-10 缓存

该仓库为 DeepSeek-V4.1-Flash AI 模型提供提示编码和最小 PyTorch 推理实现,包括视觉编码器、MoE 和 Hyper-Connections 等组件,基于 MIT 许可证。

0 人收藏 0 人点赞
#mixture-of-experts

超越无重训练MoE压缩:后压缩调整的成本标准化研究

arXiv cs.LG ↗ · 2026-09-10 缓存

本文认为,无重训练的MoE压缩检查点应被视为受益于小型后压缩调整的压缩初始化。研究表明,仅使用3,000个样本和一个周期,语言模型微调即可恢复性能损失的大部分,并且比知识蒸馏更具成本效益。

0 人收藏 0 人点赞
#mixture-of-experts

ACE:MoE大语言模型参数高效微调的跨专家适配器整合

arXiv cs.LG ↗ · 2026-09-10 缓存

ACE提出了一种方法,用于整合MoE大语言模型中跨专家的冗余适配器,以实现更高效的参数高效微调,训练速度提升最高可达1.48倍,且不增加峰值内存。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈