MaximeRivest: 这基本上就是我在他们实现之前,自己在家摸索如何实现jev的历程。

X AI KOLs Following 新闻

摘要

作者分享了过去为了在大规模场景下实现高质量的令牌级分类,而探索高效单专家加载方法的经历,呼应了Maxime Rivest关于特定领域专家模型实用性的观点。

这基本上就是我在他们实现之前,自己在家摸索如何实现jev的历程。
查看原文
查看缓存全文

缓存时间: 2026/09/17 20:22

这本质上就是我在尝试寻找在家实现jev的方法,就在他们制作出来之前。

Maxime Rivest 🧙♂️🦙🐧 (@MaximeRivest): 希望能只加载单个专家模型,并在大规模场景下进行单token高质量分类。如果同一个专家能在特定领域内复用,这对数据应用来说依然极具价值。

相似文章

@nrehiew_: 给视觉学习者

X AI KOLs Timeline

一条推文描述了一个大型混合专家模型,总参数975B(活跃参数41B),在45T词元的多模态数据上训练而成,包含6个路由专家和2个共享专家,并与DeepSeek-V3进行了比较。