应某人要求,我进行了35B智能体对比(原版 vs Ornith vs KAT-Coder,120次运行)
摘要
针对35B编程模型(KAT-Coder-V2.5-Dev、Qwen3.5、Ornith等)的详细对比评测,通过120次运行显示:KAT-Coder与最佳原版通过率持平,且工具行为更规范;而Ornith因执行机制问题失败。完整方法和结果见链接。
在我之前27B后训练对比评测的评论中,有人要求进行35B版本的对比,于是我就运行了。设置与上次相同:在我的k8s集群上创建全新的Coder工作区,每个工作区无头驱动我自己的代理(Hermes),模型通过llama-swap在单块5090上运行于llama.cpp,每次调用通过OTel垫片追踪到SigNoz,每次运行的完整转录。4个模型,6个自评分任务,5次重复,120次运行,每个分支都启用MTP,相同的采样,假设预先注册。KAT-Coder-V2.5-Dev 与最佳原版通过率持平(29/30,与 Qwen3.5-35B 并列),而输入 token 数量仅为两个原版模型的一半,并且在我看来工具行为最为规范(30次运行中零格式错误的工具调用泄露;原版 Qwen3.6 在某一个任务上泄露了195次)。所有六位分析器(来自三个模型家族)都独立指出其效率纪律而非偷工减料:每次编辑前进行基线测试,每个 bug 只做一个针对性补丁,每次重复都在正确路径交付成果。Ornith 的成绩是25/30,输给了自己的基础模型。它的失败在于执行机制而非知识:格式泄露在23秒时导致运行失败,全文件重写损坏了不相关的文件,还有一次研究运行虚构了一个 llama.cpp 发布标签,尽管其自身的推理说“我在草稿中提到的v4659是编造的”,但仍然提交了该标签。评分器通过了它。原版3.6是最强的原始分析器,也是最大的token消耗者;原版3.5则是安静可靠的那个。完整的报告包含方法、表格以及所有六次引用的逐任务分析:https://kmarble.dev/posts/35b-coder-bakeoff/。转录由AI分析器阅读,我对其中的每一项重要声明进行了抽查验证。
相似文章
@no_stp_on_snek: 一款新的35B编码模型发布了(Ornith-1.0),一篇推广博客说它"碾压"了基准测试。我的第一直觉是这是benchmaxx……
一款新的35B编码模型Ornith-1.0与Qwen3.6-35B在自定义测试中进行了对比。用户发现Ornith-1.0在长期自主编码方面确实更强,能够抵抗不良上下文并完成大型任务,但它更加谨慎和冗长,有时会对简单请求过度限制。
KAT Coder 2.5 dev:帮自己一个忙,试试吧!
一位开发者热情推荐 KAT Coder 2.5 dev,称其比 Qwen 3.6 35b a3b 更快、更准确、使用更少的 token,并且在他们的设置上优于 Gemma 4 模型,同时附有包含详细基准测试的 GitHub 仓库。
@SlimTradeyBaby:刚读了 @no_stp_on_snek 对全新 Ornith-1.0 35B 编码器的评测,这绝对是我很久以来见过的最好的模型测评之一……
对全新 Ornith-1.0 35B 编码模型的评测,绕过公开基准,在真实代理任务上进行测试,突出其在长程编码和连贯性方面的优势,以及诸如冗长性等代价。
Kwaipilot/KAT-Coder-V2.5-Dev
KAT-Coder-V2.5-Dev 是一个开放权重的 MoE 编码模型,总参数为 35B(3B 激活),通过 SFT 和 RL 训练在代理编码基准测试上取得了最先进的结果。
@no_stp_on_snek: 最后一点:我在测试 Ornith-1.0(新型智能编程代理)时发现的真正缺点是:它对合理工作过度设限。关于…
一位测试人员报告称,新型 Ornith-1.0 智能编程模型因要求过多先决条件而对合理工作过度设限,这是其谨慎训练带来的权衡;而标准版 Qwen3.6 则直接执行简单任务。