MaximeRivest: 这基本上就是我在他们实现之前,自己在家摸索如何实现jev的历程。
摘要
作者分享了过去为了在大规模场景下实现高质量的令牌级分类,而探索高效单专家加载方法的经历,呼应了Maxime Rivest关于特定领域专家模型实用性的观点。
这基本上就是我在他们实现之前,自己在家摸索如何实现jev的历程。
查看缓存全文
缓存时间: 2026/09/17 20:22
这本质上就是我在尝试寻找在家实现jev的方法,就在他们制作出来之前。
Maxime Rivest 🧙♂️🦙🐧 (@MaximeRivest): 希望能只加载单个专家模型,并在大规模场景下进行单token高质量分类。如果同一个专家能在特定领域内复用,这对数据应用来说依然极具价值。
相似文章
@rohanpaul_ai: 大型MoE模型可能浪费了一半的专家计算资源在几乎不需要专家帮助的token上。本文中50%的e…
一种名为Zero-Expert Self-Distillation Adaptation (ZEDA)的新方法,允许像Qwen3和GLM这样的MoE模型在简单token上跳过一半的专家计算,而精度损失极小,通过添加输出为空的虚拟专家,实现约20%的推理加速。
@_avichawla: https://x.com/_avichawla/status/2100876555409039605
这篇文章解释了Mixture-of-Experts (MoE) 推理的工程方面,详细介绍了令牌路由、专家批处理、GPU分配和性能权衡,以实现高效的服务。
@nrehiew_: 给视觉学习者
一条推文描述了一个大型混合专家模型,总参数975B(活跃参数41B),在45T词元的多模态数据上训练而成,包含6个路由专家和2个共享专家,并与DeepSeek-V3进行了比较。
@lateinteraction: 对 @jacobli99 的这项工作感到非常兴奋!我们对当前智能体在新领域获取专业知识的方式感到失望…
探讨了让AI系统像人类阅读教科书一样从文档中发展深层专业知识的挑战,强调了一种持续学习的形式。
@vanstriendaniel: 真正的 tokenmaxxing 行动:使用前沿代理构建用于大规模数据整理的小型分类器。小型分类…
使用前沿代理构建用于数据整理的小型分类器可以显著降低成本,相比 LLM 标注,这在 FinePDFs-Edu 数据集的案例研究中得到了证明。