@no_stp_on_snek: 在90亿参数规模下,RL带来的最直接好处并非智能,而是效率。Ornith-9B用约56%的token就能达到相同答案……

X AI KOLs Following 模型

摘要

Ornith-9B证明了在90亿参数规模下,RL训练主要带来的是效率提升:仅用约56%的token和两倍于基础模型的速度就能得到相同答案,为按token付费的方式提供了实实在在的成本节约。

RL在90亿参数规模下带来的最直接好处并非智能,而是效率。Ornith-9B用约56%的token就能达到其基础模型需要的相同答案(每轮1299对2312个token),且重试次数减半。相同的目的地,路径曲折大大减少,实际时间大约快一倍。如果你按token付费,这才是关键。
查看原文
查看缓存全文

缓存时间: 2026/06/29 10:34

RL 在 9B 上获得的最纯粹的东西不是智能,而是效率。Ornith-9B 使用其基础模型所需 token 数的约 56% 就能得出相同答案(每轮 1,299 vs 2,312),并且重试次数减半。相同目的地,少走很多弯路,实际运行时间大约快 2 倍。如果你按 token 付费,这就是重点。

Tom Turney (@no_stp_on_snek): 事先说明结论:在某些类别中,以我的标准算是“及格”,只是比 35B 的范围更窄。你在这里买到的是真正的效率和持续的编码连贯性,而不是对基础模型的全面升级。

在 Ornith-1.0 的小兄弟上运行了同样的质疑测试,

相似文章