标签
一项研究引入了DuoBench,这是一个用于评估编码智能体中规划者-实现者配对的基准测试。它在CPython问题上测试了Kimi K2.7、K2.6、GPT-5.5和Claude Opus 4.8的组合,发现作为实现者的Kimi K2.7以低成本提供高质量,性能优于更昂贵的配对。