@no_stp_on_snek: 在90亿参数规模下,RL带来的最直接好处并非智能,而是效率。Ornith-9B用约56%的token就能达到相同答案……
摘要
Ornith-9B证明了在90亿参数规模下,RL训练主要带来的是效率提升:仅用约56%的token和两倍于基础模型的速度就能得到相同答案,为按token付费的方式提供了实实在在的成本节约。
查看缓存全文
缓存时间: 2026/06/29 10:34
RL 在 9B 上获得的最纯粹的东西不是智能,而是效率。Ornith-9B 使用其基础模型所需 token 数的约 56% 就能得出相同答案(每轮 1,299 vs 2,312),并且重试次数减半。相同目的地,少走很多弯路,实际运行时间大约快 2 倍。如果你按 token 付费,这就是重点。
Tom Turney (@no_stp_on_snek): 事先说明结论:在某些类别中,以我的标准算是“及格”,只是比 35B 的范围更窄。你在这里买到的是真正的效率和持续的编码连贯性,而不是对基础模型的全面升级。
在 Ornith-1.0 的小兄弟上运行了同样的质疑测试,
相似文章
@no_stp_on_snek: 结论先行:在某些类别中,它算是“及格”了,但比35B适用范围更窄。你实际买到的是真正的……
作者将Ornith-9B与其基础模型Qwen3.5-9B进行了对比,发现RL后训练提升了token效率和持续编码的一致性,但牺牲了单轮判断能力和对误导输入的鲁棒性,使得9B版本相较于35B版本升级幅度更窄。
@no_stp_on_snek: 有人会晃着成绩卡对我说:9B模型在编程基准测试中碾压了它的基础模型(SWE-bench 69 vs 53)。确实如此。但关于……
一位评论员讨论了9B模型在编程基准测试中的表现,指出虽然在SWE-bench上它击败了基础模型(69 vs 53),但在行为测试和长程测试中优势缩小,说明在基准分布之外收益有限。
@rohanpaul_ai: TokenPilot 通过摄入感知压缩和生命周期感知驱逐来降低 LLM 智能体成本,实现了 61–87% 的成本降低。
TokenPilot 通过摄入感知压缩和生命周期感知驱逐来降低 LLM 智能体成本,在 PinchBench 和 Claw-Eval 上实现了 61–87% 的成本降低,且得分具备竞争力。
Ornith-1.5-35B-A3B Q4 在 4070Ti 上运行速度达 60 tok/s。
一位用户报告在 NVIDIA RTX 4070 Ti 上使用 Ornith-1.5-35B-A3B MOE 模型达到了每秒 60 个令牌的速度,展示了高效的本地推理优化。
用500美元微调9B开源模型,在目录审核上超越前沿模型
一次仅花费500美元的RL微调,使9B开源模型在目录审核质量上达到87%,每1000条列表成本仅0.50美元,显著优于GPT-4和Claude等前沿模型(成本19-172美元,质量仅70-76%)。