@_alejandroao: https://x.com/_alejandroao/status/2066548511106076932
摘要
一项研究引入了DuoBench,这是一个用于评估编码智能体中规划者-实现者配对的基准测试。它在CPython问题上测试了Kimi K2.7、K2.6、GPT-5.5和Claude Opus 4.8的组合,发现作为实现者的Kimi K2.7以低成本提供高质量,性能优于更昂贵的配对。
查看缓存全文
缓存时间: 2026/06/16 11:51
研究:将Kimi K2.7作为实施器与其他架构型LLM搭配使用
大多数代码模型基准测试只问一个笼统的问题:哪个模型最好?
这虽然有用,但并非我实际使用代码智能体的方式。实际操作中,我常将工作流拆分为两个角色:
-
规划器,负责读取问题并决定应该修改什么
-
实施器,负责根据规划执行代码变更
这种拆分引出了一个更实际的问题:哪种规划器和实施器的组合,能让你的每一分钱都花得最值?
DuoBench 正是为此而生。它是以 Skill 形式封装的小型基准测试工具,用于在真实 GitHub issue 上运行规划器-实施器组合。它收集生成的提交记录,用 LLM 评委组打分,并将质量与令牌成本进行对比。
DuoBench 工作流
DuoBench 工作流
基准测试任务
此次运行中,我选用了 CPython issue #150700,这是一个于2026年6月1日提交、2026年6月9日修复的缺陷。
被测试的模型需要检查一个大型的真实 C 代码库,理解编译器边缘情况,做出节制的补丁,并添加正确的测试。
该 issue 也是较新的。这一点很重要,因为较旧的公开 issue 更可能出现在模型的训练数据中。
DuoBench 的工作原理
我让智能体对以下模型及其所有组合进行了基准测试:
- Kimi K2.7
- Kimi K2.6
- GPT-5.5
- Claude Opus 4.8
每个条件都遵循相同的流水线。
- 首先,规划器读取 issue 并探索代码仓库。它撰写一份交接计划,但不编辑代码。
- 然后,实施器接收该计划,并精确生成一个本地提交。
- 最后,评委组根据任务完成度、正确性、代码质量和验证对提交进行打分。本次运行中,评委组使用了 GPT-5.5 和 Claude Opus 4.8,我将它们的评分取平均值。
输出包括一组漂亮的图表、一个排行榜、每组配对的任务代码解决方案以及原始数据(评分和成本)。
结果
最有趣的结果并非单纯的最高分模型,而是质量与成本之间的关系。
Kimi K2.7 单独使用位于图表的最优区域:高质量且低成本。Kimi 实施器的运行点集中在高效前沿一侧,而 Opus 偏重的运行成本更高,但在这个 issue 上并没有明显的质量优势。
这并不意味着 Opus 不好。它说明,针对这个特定的 CPython issue,为 Opus 作为实施器付出额外成本并没有换来足够的额外质量来证明其合理性。
更广泛的模式也很重要:Kimi 作为实施器时表现最强。最优条件下,大多数情况下使用 Kimi K2.6 或 Kimi K2.7 来完成最终的代码变更。
这很合理:使用最新的封闭 SOTA 模型作为架构师,搭配 Kimi K2.7 作为实施器/工程师,能得到最佳结果。
钱都花在了哪里
成本分解揭示了为何实施器如此重要。
规划相对便宜。实施才是账单膨胀的地方。
这正是 DuoBench 测试配对而非仅测试独立模型的核心原因。一个昂贵但强大的规划器搭配一个较便宜的实施器是可行的。但如果较便宜的模型本身也是一个强大的独立实施器,那么最佳答案可能更简单:直接使用它。
在这次运行中,Kimi K2.7 单独使用正是这样的结果。
Kimi K2.7 改变了什么
Kimi K2.7 是本对比中的新模型。可通过 Moonshot AI 的 Kimi 发布版以及 Hugging Face 获取。
与本次运行中的 Kimi K2.6 相比,Kimi K2.7 的独立评分从 8.62 提升至 9.00,同时成本略有下降。作为与 Opus 规划搭配的实施器,其评分也高于 K2.6 实施器的条件。
这并不能证明 K2.7 普遍更优。这只是一个 issue、每个条件一次试验以及 LLM 打分的结果。但它是一个有用的信号:K2.7 值得在你的代码仓库中作为代码实施器进行测试。
评委偏见
LLM 评委也有自己的偏好。
本次运行中,自我偏见程度较轻。GPT-5.5 和 Claude Opus 4.8 在某些地方各有微小偏向,但取两者平均值有助于平滑效果。
我仍然不会将评委分数视为绝对真理。评委组是一个分类工具。最终决策应来自阅读补丁、运行测试并判断该解决方案是否真正可接受。
我打算如何使用
我不会只运行一次 DuoBench 就宣布一个通用赢家。这不是一份科学报告。这是一个工具演示,你可以用它来为自己的用例选择最佳的模型配对。
要成为科学报告,我们需要对每个 issue 在数十个代码问题上多次运行。这并非本次目标。
目标是向你展示,你可以使用开源模型来改善你的质量-成本比。
我相信我们达到了这个目标。希望这能促使你在工作流中使用开源模型!
参考
- Kimi K2.7 代码发布页面
- Kimi K2.7 代码在 Hugging Face 上
- DuoBench 仓库
- CPython issue #150700
相似文章
在Fable 5、Kimi K3和GPT-5.6 Sol上运行了12个真实的多应用代理任务。最便宜的模型与最贵的模型打平。
对三个AI代理在12个多应用任务上的基准测试显示,Kimi K3以极低的成本与最贵的模型GPT-5.6 Sol打平,尽管三者都未能通过跨应用协调任务,这突显了在生产环境中进行验证的必要性。
Kimi K2.6 Agent 是否比 Claude Code/Claude Co-work 更好?
本文比较了 Kimi K2.6 Agent 与 Claude Code 和 Claude Co-work,评估哪个更适合编程任务。
Kimi K2.7 Code 务实胜过炫技
Kimi 发布了 K2.7 Code,这是一款专注于编程的 AI 模型,其基准测试成绩提升,且思考令牌使用量降低 30%。它更强调在长代码循环和智能体工具集成中的实际性能,而非炫目的分数。
@fitchmultz: 使用 GPT-5.5 xhigh 作为规划者 + Composer 2.5 子代理作为实现者,比单独使用任一模型完成所有任务效果更好。在 pi (pi-…
一条推文介绍了一种工作流程:通过 pi-cursor-sdk,使用 GPT-5.5 xhigh 进行规划,并将实现委托给 Composer 2.5 子代理,声称这比单独使用任一模型效果更佳。所链接的 GitHub 仓库是一个开源 SDK,用于将 Cursor 模型集成到 pi agent 运行时中。
@kirillk_web3:你明白 Kimi K2.6 刚刚发布意味着什么吗?开源。免费。1 万亿参数。这才是大家没在谈论的关键……
Kimi K2.6 作为一款免费、开源的 1 万亿参数模型正式推出,能够运行 300 个并行智能体以进行持续执行,据报在 SWE-Bench Pro 任务上的表现优于 Claude Opus 4.6。