在github-copilot、pi、claude-code和opencode中使用Qwen3.6 27B完成相同任务
摘要
作者使用相同的 Qwen3.6 27B 模型测试了多个编码代理框架(GitHub Copilot、Pi、Claude Code、OpenCode),发现框架设计对性能影响显著,其中 OpenCode 在网络搜索和 Web 开发方面表现出色,而 GitHub Copilot 在文件编辑工具方面表现不佳。
我想知道编码代理的性能有多少来自模型本身,又有多少来自框架,因此我构思了一套方案,以便在同一任务上测试多种代理框架与模型的组合。上面所有图片都来自同一模型,但使用了不同的框架。我仍在努力实现自动化/量化评估,而不是主观判断。以下是图片中未体现的几点观察:
1. OpenCode 默认可以搜索互联网,这使它在某些任务上的结果好得多。例如,在 3D 打印机说明页面中,它列出了具体的耗材温度等数据。
2. 在 Web 开发方面,OpenCode 给出了非常好的结果。虽然此处无法交互,但它创建了效果很好的交互式小部件。
3. 该模型在 GitHub Copilot 上确实表现不佳。通常需要尝试五六次才能写入一个文件。它经常搞乱 Copilot 的文件编辑工具,但在其他框架上没有这个问题。Claude Code、Pi 和 OpenCode 都只需 4 次 LLM 请求就能创建 pelican.svg,而 GitHub Copilot 需要 13 次!它先尝试编辑工具,然后尝试 bash,再尝试编辑工具……无论它们使用什么工具架构,在我的测试中,该 LLM 都很难应对。这导致速度非常慢,因为它必须一遍又一遍地重新生成相同的差异。
4. Qwen3-vl-4 在 OpenCode 中陷入无限循环,甚至无法将 pelican.svg 写入磁盘。
相似文章
最喜欢的代理式编码工具
作者比较了几种代理式编码工具(Codex CLI、Claude Code、Gemini CLI、OpenCode、Pi),认为Pi最精简且最适合本地模型,赞赏其简洁性以及与Qwen 27B-MXFP8的兼容性。
工具对决:Claude Code vs OpenCode vs Pi 搭配 DeepSeek V4 Flash
一篇对比文章,将AI编码工具Claude Code、OpenCode和Pi与DeepSeek V4 Flash进行较量。
一直在通过3批评判器流程运行Qwen3.6-27B。这个流程的重要性远超我的想象。
报告了通过3批评判器编码流程运行Qwen3.6-27B(8位)的情况,发现该流程能有效捕捉错误,使最终输出质量与前沿模型相当,并提出了一种工作流:前沿模型负责规划,Qwen负责执行。
@MiaAI_lab: Qwopus 3.6-27b Coder 我收到很多请求让我测试它,于是我进行了测试。我运行了与其他模型相同的测试。它…
MiaAI Lab 测试了 Qwopus 3.6-27b Coder,发现在工具调用和代码生成方面表现不如 Qwen 3.6 27b 和 35b,且 HTML 演示出现故障。
搭配合适代理后,Qwen3.6-35B 可与云端模型一较高下
将 Qwen3.6-35B 与 little-coder 代理框架结合,在 Polyglot 编程基准上达到 78.7%,跻身公开榜前十,直追云端模型。