mixture-of-experts

标签

Cards List
#mixture-of-experts

@rohanpaul_ai: 阿里巴巴发布了Qwen3.8-Max,一个2.4万亿参数模型,每个token仅激活约950亿参数。一个……

X AI KOLs Timeline · 昨天 缓存

阿里巴巴发布了Qwen3.8-Max,这是一个2.4万亿参数的稀疏MoE模型,每个token激活950亿参数,支持100万token的上下文,并具有强大的智能体能力和基准测试结果,包括自主编码数天、电路设计,以及在Terminal Bench和PaperBench上超越竞争对手。

0 人收藏 0 人点赞
#mixture-of-experts

An Emerging Retail Portfolio Management Application: Personalized, Tax-Aware Reinforcement Learning with Natural Language Goals

arXiv cs.LG · 2天前 缓存

Presents an emerging retail portfolio management application that uses personalized, tax-aware reinforcement learning with natural language goal input, featuring a three-phase pipeline and integration with live brokerage APIs.

0 人收藏 0 人点赞
#mixture-of-experts

模态如何共同学习(49分钟阅读)

TLDR AI · 2天前 缓存

来自Meta FAIR、Reality Labs和牛津大学的一项关于多模态预训练的系统性研究,揭示了模态之间的不对称知识流动、协同与竞争动态、早期统一的益处,以及通过13.5B MoE模型验证的高效训练方案。

0 人收藏 0 人点赞
#mixture-of-experts

MESH:用于混合专家训练的内存高效Sinkhorn优化

arXiv cs.LG · 3天前 缓存

本文介绍了MESH,一种用于混合专家(MoE)训练的内存高效Sinkhorn优化器,它在不存储完整优化器状态的情况下恢复时间动量,相比AdamW将内存减少62.5%,同时保持有竞争力的评估损失。

0 人收藏 0 人点赞
#mixture-of-experts

基于肘部的MoE路由:一种免训练的推理时插件用于专家选择

arXiv cs.LG · 3天前 缓存

本文介绍了基于肘部的路由,这是一种针对MoE模型的免训练推理时方法,通过检测路由器概率分布中的肘部点,动态调整每个令牌的活跃专家数量,在保持准确率的同时实现了平均5.3%的延迟降低。

0 人收藏 0 人点赞
#mixture-of-experts

基于资源感知的语音编码器混合体打破多对多语音到文本翻译中的多语言诅咒

arXiv cs.CL · 3天前 缓存

本文介绍了MSRT,一个采用资源感知的语音编码器混合体(MoSE)的框架,以克服多对多语音到文本翻译中的多语言诅咒。该4B参数模型在45种语言上取得了最先进的结果,特别是在每种语言仅有10小时配对数据的情况下显著改善了低资源语音翻译。

0 人收藏 0 人点赞
#mixture-of-experts

K-EXAONE 2.0 Technical Report

arXiv cs.CL · 3天前 缓存

LG AI Research presents K-EXAONE 2.0, a 750B-parameter MoE foundation model upcycled from K-EXAONE, supporting 256K context and six languages, with self-speculative decoding for efficient inference.

0 人收藏 0 人点赞
#mixture-of-experts

SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization

arXiv cs.LG · 3天前 缓存

This paper introduces SpecDrop, a parameter-free category-conditioned routing scheme for modular networks, showing that on vision tasks it achieves competitive accuracy while on fuzzy language partitions it reduces to no-routing baselines, suggesting granularity alignment matters more than router design.

0 人收藏 0 人点赞
#mixture-of-experts

C$^2$MOE:基于一致性与互补性引导的混合专家框架用于不完整多模态情感学习

arXiv cs.AI · 3天前 缓存

论文提出C²MOE,一种基于一致性与互补性引导的混合专家框架,用于对话中的不完整多模态情感识别,利用信息论分解在模态缺失时提高鲁棒性。

0 人收藏 0 人点赞
#mixture-of-experts

DyPES-VLA:面向跨具身操作的学习共享动力学先验与具身特定控制

Hugging Face Daily Papers · 3天前 缓存

DyPES-VLA是一种跨具身VLA模型,通过未来预测学习共享动力学先验,并使用具身特定的混合专家(MoE)动作头在机器人原生动作空间中控制机器人,在LIBERO、RoboCasa和RoboTwin基准上取得了最先进的结果。

0 人收藏 0 人点赞
#mixture-of-experts

MoE训练提速40%:更快的megakernel,居然来自Cursor(针对B200)

Reddit r/LocalLLaMA · 3天前 缓存

Cursor开源了Mixture-of-Kittens (MoK),这是一个面向NVIDIA Blackwell GPU的确定性MoE训练megakernel,它融合了计算与通信,相比基线实现最高可提供2.37倍加速。

0 人收藏 0 人点赞
#mixture-of-experts

MoEGen:用于实例自适应LoRA生成的专家混合方法

arXiv cs.CL · 4天前 缓存

本文提出MoEGen,一种参数高效的微调框架,利用专家混合技术通过专家码和轻量级超网络生成实例自适应的LoRA更新,在不针对每个专家存储独立适配器的情况下提升了常识推理基准的性能。

0 人收藏 0 人点赞
#mixture-of-experts

AcceptMoE: Commitment-Weighted Self-Sizing Verifier Expert Sets for Efficient MoE Speculative Decoding

arXiv cs.LG · 4天前 缓存

AcceptMoE is a verifier-side expert selection method for speculative decoding of MoE LLMs, which reduces expert-weight traffic and improves throughput by up to 2.06x under expert offloading with minimal accuracy loss.

0 人收藏 0 人点赞
#mixture-of-experts

多模态预训练的物理:知识流动、模态协同、早期统一与配方

Hugging Face Daily Papers · 4天前 缓存

本文系统性地探索了多模态预训练的物理机制,揭示了知识在模态之间如何流动、协同与竞争的条件、早期统一的优势,以及在13.5B MoE模型上验证的高效预训练配方。

0 人收藏 0 人点赞
#mixture-of-experts

K-EXAONE 2.0 技术报告

Hugging Face Daily Papers · 4天前 缓存

K-EXAONE 2.0 是 LG AI Research 推出的开源权重多语言 MoE 基础模型,总参数达 750B,激活参数为 37B,支持 10 种语言和 256K 上下文,在智能体编码、长上下文理解和安全性方面均有显著提升。

0 人收藏 0 人点赞
#mixture-of-experts

@cursor_ai:我们正在开源 Mixture-of-Kittens (MoK),这是我们为 NVL72 打造的 MoE 训练巨型内核。它融合了所有 Mixture-of-Experts 的…

X AI KOLs Timeline · 5天前 缓存

Cursor 正在开源 Mixture-of-Kittens (MoK),这是一个针对 NVIDIA NVL72 的融合式 MoE 训练巨型内核,其运行速度比最强的公开基线快达 2.37 倍。

0 人收藏 0 人点赞
#mixture-of-experts

inclusionAI/Ling-3.0-flash 权重已上架 Hugging Face —— MIT 许可、BF16 以及官方 FP8

Reddit r/LocalLLaMA · 5天前

InclusionAI 在 Hugging Face 上发布了 Ling-3.0-flash 模型的权重,采用 MIT 许可,包含 BF16 和官方 FP8 版本。该模型使用细粒度 MoE 架构,有 512 个专家,每个 token 激活 8 个,总参数 127.5B,激活参数 5.1B。

0 人收藏 0 人点赞
#mixture-of-experts

LLaDA MoE v2:扩展混合专家扩散语言模型

Hugging Face Daily Papers · 5天前 缓存

一篇研究论文,提出了混合专家扩散语言模型的扩展定律和设计原则,并以 LLaDA MoE v2(30B-A3B)在 23.5T token 上进行训练,在多个基准测试上以更少的预训练 token 接近 Qwen3。

0 人收藏 0 人点赞
#mixture-of-experts

Mind Lab 用 Macaron-V1 检验持续学习(11 分钟阅读)

TLDR AI · 5天前

Mind Lab 声称其 Macaron-V1 模型在基准测试中超越 GLM-5.2。该模型通过将五个 LoRA 专家模块(每个约十亿参数)附加到 GLM-5.1 上构建而成,系统会根据任务动态切换到最适合的专家模型。模型使用过程中积累的数据可被提炼到专门的 LoRA 适配器中,随着模型的调用而持续更新。

0 人收藏 0 人点赞
#mixture-of-experts

@modal:DeepSeek-V4-Flash 总参数为 284B,每个 token 激活 13B。结合混合压缩注意力机…

X AI KOLs Following · 5天前 缓存

DeepSeek-V4-Flash 是一个 284B 参数的 MoE 模型,每 token 激活 13B 参数,采用混合压缩注意力机制,可降低 1M token 上下文的 KV 缓存需求。可使用 Modal 上的 SGLang 提供服务,在单个 B300 上实现快速解码。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈