标签
一个团队分享了他们将AI智能体从GPT-4o切换到Kimi K2.7的经验,实现了约70%的推理成本降低,同时记录了哪些功能出现问题以及哪些保持不变。
开源权重模型已追赶上专有模型,GLM 5.2在浏览器代理任务中以低成本实现了接近Opus级别的得分。其他模型如Minimax M3和Kimi k2.7也显示出显著的改进。
一项研究引入了DuoBench,这是一个用于评估编码智能体中规划者-实现者配对的基准测试。它在CPython问题上测试了Kimi K2.7、K2.6、GPT-5.5和Claude Opus 4.8的组合,发现作为实现者的Kimi K2.7以低成本提供高质量,性能优于更昂贵的配对。