应某人要求,我进行了35B智能体对比(原版 vs Ornith vs KAT-Coder,120次运行)

Reddit r/LocalLLaMA 新闻

摘要

针对35B编程模型(KAT-Coder-V2.5-Dev、Qwen3.5、Ornith等)的详细对比评测,通过120次运行显示:KAT-Coder与最佳原版通过率持平,且工具行为更规范;而Ornith因执行机制问题失败。完整方法和结果见链接。

在我之前27B后训练对比评测的评论中,有人要求进行35B版本的对比,于是我就运行了。设置与上次相同:在我的k8s集群上创建全新的Coder工作区,每个工作区无头驱动我自己的代理(Hermes),模型通过llama-swap在单块5090上运行于llama.cpp,每次调用通过OTel垫片追踪到SigNoz,每次运行的完整转录。4个模型,6个自评分任务,5次重复,120次运行,每个分支都启用MTP,相同的采样,假设预先注册。KAT-Coder-V2.5-Dev 与最佳原版通过率持平(29/30,与 Qwen3.5-35B 并列),而输入 token 数量仅为两个原版模型的一半,并且在我看来工具行为最为规范(30次运行中零格式错误的工具调用泄露;原版 Qwen3.6 在某一个任务上泄露了195次)。所有六位分析器(来自三个模型家族)都独立指出其效率纪律而非偷工减料:每次编辑前进行基线测试,每个 bug 只做一个针对性补丁,每次重复都在正确路径交付成果。Ornith 的成绩是25/30,输给了自己的基础模型。它的失败在于执行机制而非知识:格式泄露在23秒时导致运行失败,全文件重写损坏了不相关的文件,还有一次研究运行虚构了一个 llama.cpp 发布标签,尽管其自身的推理说“我在草稿中提到的v4659是编造的”,但仍然提交了该标签。评分器通过了它。原版3.6是最强的原始分析器,也是最大的token消耗者;原版3.5则是安静可靠的那个。完整的报告包含方法、表格以及所有六次引用的逐任务分析:https://kmarble.dev/posts/35b-coder-bakeoff/。转录由AI分析器阅读,我对其中的每一项重要声明进行了抽查验证。
查看原文

相似文章

KAT Coder 2.5 dev:帮自己一个忙,试试吧!

Reddit r/LocalLLaMA

一位开发者热情推荐 KAT Coder 2.5 dev,称其比 Qwen 3.6 35b a3b 更快、更准确、使用更少的 token,并且在他们的设置上优于 Gemma 4 模型,同时附有包含详细基准测试的 GitHub 仓库。

Kwaipilot/KAT-Coder-V2.5-Dev

Hugging Face Models Trending

KAT-Coder-V2.5-Dev 是一个开放权重的 MoE 编码模型,总参数为 35B(3B 激活),通过 SFT 和 RL 训练在代理编码基准测试上取得了最先进的结果。