mixture-of-experts

标签

Cards List
#mixture-of-experts

TEXAS:面向下游混合专家大语言模型适配的任务专家感知监督

arXiv cs.CL · 6小时前 缓存

提出TEXAS方法,用于混合专家大语言模型的下游适配,通过正确性条件激活发现任务相关专家,并应用词元级监督分配,在多个基准上提升性能。

0 人收藏 0 人点赞
#mixture-of-experts

超越路由权重:通过贡献对比对混合专家奖励模型进行忠实的响应级解释

arXiv cs.AI · 6小时前 缓存

本文提出了贡献对比(CoCo),一种新颖的响应级解释方法,用于混合专家奖励模型,相比基于路由权重的方法,能更忠实地捕捉路由和偏好行为。

0 人收藏 0 人点赞
#mixture-of-experts

EntropyMoE:面向无分词器大语言模型的熵感知稀疏专家路由

arXiv cs.AI · 6小时前 缓存

EntropyMoE 为无分词器大语言模型引入了一种熵感知的专家混合架构,使用动态字节补丁作为路由单元,以实现稀疏条件计算。实验表明,在保持下游精度的同时,它在基线中取得了最低的留出法每字节比特数(bits-per-byte)。

0 人收藏 0 人点赞
#mixture-of-experts

@rohanpaul_ai: 阿里巴巴发布了Qwen3.8-Max,一个2.4万亿参数模型,每个token仅激活约950亿参数。一个……

X AI KOLs Timeline · 2天前 缓存

阿里巴巴发布了Qwen3.8-Max,这是一个2.4万亿参数的稀疏MoE模型,每个token激活950亿参数,支持100万token的上下文,并具有强大的智能体能力和基准测试结果,包括自主编码数天、电路设计,以及在Terminal Bench和PaperBench上超越竞争对手。

0 人收藏 0 人点赞
#mixture-of-experts

An Emerging Retail Portfolio Management Application: Personalized, Tax-Aware Reinforcement Learning with Natural Language Goals

arXiv cs.LG · 3天前 缓存

Presents an emerging retail portfolio management application that uses personalized, tax-aware reinforcement learning with natural language goal input, featuring a three-phase pipeline and integration with live brokerage APIs.

0 人收藏 0 人点赞
#mixture-of-experts

模态如何共同学习(49分钟阅读)

TLDR AI · 3天前 缓存

来自Meta FAIR、Reality Labs和牛津大学的一项关于多模态预训练的系统性研究,揭示了模态之间的不对称知识流动、协同与竞争动态、早期统一的益处,以及通过13.5B MoE模型验证的高效训练方案。

0 人收藏 0 人点赞
#mixture-of-experts

MESH:用于混合专家训练的内存高效Sinkhorn优化

arXiv cs.LG · 4天前 缓存

本文介绍了MESH,一种用于混合专家(MoE)训练的内存高效Sinkhorn优化器,它在不存储完整优化器状态的情况下恢复时间动量,相比AdamW将内存减少62.5%,同时保持有竞争力的评估损失。

0 人收藏 0 人点赞
#mixture-of-experts

基于肘部的MoE路由:一种免训练的推理时插件用于专家选择

arXiv cs.LG · 4天前 缓存

本文介绍了基于肘部的路由,这是一种针对MoE模型的免训练推理时方法,通过检测路由器概率分布中的肘部点,动态调整每个令牌的活跃专家数量,在保持准确率的同时实现了平均5.3%的延迟降低。

0 人收藏 0 人点赞
#mixture-of-experts

基于资源感知的语音编码器混合体打破多对多语音到文本翻译中的多语言诅咒

arXiv cs.CL · 4天前 缓存

本文介绍了MSRT,一个采用资源感知的语音编码器混合体(MoSE)的框架,以克服多对多语音到文本翻译中的多语言诅咒。该4B参数模型在45种语言上取得了最先进的结果,特别是在每种语言仅有10小时配对数据的情况下显著改善了低资源语音翻译。

0 人收藏 0 人点赞
#mixture-of-experts

K-EXAONE 2.0 Technical Report

arXiv cs.CL · 4天前 缓存

LG AI Research presents K-EXAONE 2.0, a 750B-parameter MoE foundation model upcycled from K-EXAONE, supporting 256K context and six languages, with self-speculative decoding for efficient inference.

0 人收藏 0 人点赞
#mixture-of-experts

SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization

arXiv cs.LG · 4天前 缓存

This paper introduces SpecDrop, a parameter-free category-conditioned routing scheme for modular networks, showing that on vision tasks it achieves competitive accuracy while on fuzzy language partitions it reduces to no-routing baselines, suggesting granularity alignment matters more than router design.

0 人收藏 0 人点赞
#mixture-of-experts

C$^2$MOE:基于一致性与互补性引导的混合专家框架用于不完整多模态情感学习

arXiv cs.AI · 4天前 缓存

论文提出C²MOE,一种基于一致性与互补性引导的混合专家框架,用于对话中的不完整多模态情感识别,利用信息论分解在模态缺失时提高鲁棒性。

0 人收藏 0 人点赞
#mixture-of-experts

DyPES-VLA:面向跨具身操作的学习共享动力学先验与具身特定控制

Hugging Face Daily Papers · 4天前 缓存

DyPES-VLA是一种跨具身VLA模型,通过未来预测学习共享动力学先验,并使用具身特定的混合专家(MoE)动作头在机器人原生动作空间中控制机器人,在LIBERO、RoboCasa和RoboTwin基准上取得了最先进的结果。

0 人收藏 0 人点赞
#mixture-of-experts

MoE训练提速40%:更快的megakernel,居然来自Cursor(针对B200)

Reddit r/LocalLLaMA · 4天前 缓存

Cursor开源了Mixture-of-Kittens (MoK),这是一个面向NVIDIA Blackwell GPU的确定性MoE训练megakernel,它融合了计算与通信,相比基线实现最高可提供2.37倍加速。

0 人收藏 0 人点赞
#mixture-of-experts

MoEGen:用于实例自适应LoRA生成的专家混合方法

arXiv cs.CL · 5天前 缓存

本文提出MoEGen,一种参数高效的微调框架,利用专家混合技术通过专家码和轻量级超网络生成实例自适应的LoRA更新,在不针对每个专家存储独立适配器的情况下提升了常识推理基准的性能。

0 人收藏 0 人点赞
#mixture-of-experts

AcceptMoE: Commitment-Weighted Self-Sizing Verifier Expert Sets for Efficient MoE Speculative Decoding

arXiv cs.LG · 5天前 缓存

AcceptMoE is a verifier-side expert selection method for speculative decoding of MoE LLMs, which reduces expert-weight traffic and improves throughput by up to 2.06x under expert offloading with minimal accuracy loss.

0 人收藏 0 人点赞
#mixture-of-experts

多模态预训练的物理:知识流动、模态协同、早期统一与配方

Hugging Face Daily Papers · 5天前 缓存

本文系统性地探索了多模态预训练的物理机制,揭示了知识在模态之间如何流动、协同与竞争的条件、早期统一的优势,以及在13.5B MoE模型上验证的高效预训练配方。

0 人收藏 0 人点赞
#mixture-of-experts

K-EXAONE 2.0 技术报告

Hugging Face Daily Papers · 5天前 缓存

K-EXAONE 2.0 是 LG AI Research 推出的开源权重多语言 MoE 基础模型,总参数达 750B,激活参数为 37B,支持 10 种语言和 256K 上下文,在智能体编码、长上下文理解和安全性方面均有显著提升。

0 人收藏 0 人点赞
#mixture-of-experts

@cursor_ai:我们正在开源 Mixture-of-Kittens (MoK),这是我们为 NVL72 打造的 MoE 训练巨型内核。它融合了所有 Mixture-of-Experts 的…

X AI KOLs Timeline · 5天前 缓存

Cursor 正在开源 Mixture-of-Kittens (MoK),这是一个针对 NVIDIA NVL72 的融合式 MoE 训练巨型内核,其运行速度比最强的公开基线快达 2.37 倍。

0 人收藏 0 人点赞
#mixture-of-experts

inclusionAI/Ling-3.0-flash 权重已上架 Hugging Face —— MIT 许可、BF16 以及官方 FP8

Reddit r/LocalLLaMA · 5天前

InclusionAI 在 Hugging Face 上发布了 Ling-3.0-flash 模型的权重,采用 MIT 许可,包含 BF16 和官方 FP8 版本。该模型使用细粒度 MoE 架构,有 512 个专家,每个 token 激活 8 个,总参数 127.5B,激活参数 5.1B。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈