@no_stp_on_snek: 有人会晃着成绩卡对我说:9B模型在编程基准测试中碾压了它的基础模型(SWE-bench 69 vs 53)。确实如此。但关于……
摘要
一位评论员讨论了9B模型在编程基准测试中的表现,指出虽然在SWE-bench上它击败了基础模型(69 vs 53),但在行为测试和长程测试中优势缩小,说明在基准分布之外收益有限。
查看缓存全文
缓存时间: 2026/06/30 07:41
有人会拿这个数据来压我:9B模型在编程基准测试上完胜其基础版(SWE-bench 69 vs 53)。
确实如此。但在我的保留行为测试和长周期测试中,这个优势就缩小到了旗鼓相当的程度。一旦偏离基准测试的分布区间,差距就开始收窄。
这正是我不单独信任公开基准测试的原因。
Tom Turney (@no_stp_on_snek): 先说结论:在我看来,它在某些类别上算是“及格“,只是比35B模型要窄一些。你真正买到的是实打实的效率和可持续的编码连贯性,而不是全面超越基础版的升级。
我在Ornith-1.0的小兄弟上也跑了同样的质疑测试——
相似文章
@no_stp_on_snek: 一款新的35B编码模型发布了(Ornith-1.0),一篇推广博客说它"碾压"了基准测试。我的第一直觉是这是benchmaxx……
一款新的35B编码模型Ornith-1.0与Qwen3.6-35B在自定义测试中进行了对比。用户发现Ornith-1.0在长期自主编码方面确实更强,能够抵抗不良上下文并完成大型任务,但它更加谨慎和冗长,有时会对简单请求过度限制。
@no_stp_on_snek: 结论先行:在某些类别中,它算是“及格”了,但比35B适用范围更窄。你实际买到的是真正的……
作者将Ornith-9B与其基础模型Qwen3.5-9B进行了对比,发现RL后训练提升了token效率和持续编码的一致性,但牺牲了单轮判断能力和对误导输入的鲁棒性,使得9B版本相较于35B版本升级幅度更窄。
@ArizePhoenix: 结果:在内部Code Bench上相比5.2提升了50%,Terminal-Bench 3.0从4.6提升到28.3,DeepSWE v1.1 从…
DeepSWE v1.1在内部Code Bench上提升了50%,并在Terminal-Bench 3.0和Agents' Last Exam上取得了新的SOTA成绩,同时新兴的网络能力发展超出预期。
@LeonEnglaender: 我们核心代码团队只有8个人,我们的30B-A3B模型与Claude Haiku 4.5性能相当,并超越了NVIDIA…
一个8人团队发布了采用Apache 2.0许可的30B-A3B编码模型,其性能与Claude Haiku 4.5相当,并在Artificial Analysis Coding Index上击败了NVIDIA的120B-A12B Nemotron 3 Super。
在我的编码代理上,一个35B模型以95%对53%击败了120B模型。构建你自己的基准测试。
一位开发者为编码AI代理构建了自定义基准测试,并发现当测试框架优化时,一个35B参数模型优于120B参数模型,凸显了定制化评估相对于通用规格的重要性。