在github-copilot、pi、claude-code和opencode中使用Qwen3.6 27B完成相同任务

Reddit r/LocalLLaMA 新闻

摘要

作者使用相同的 Qwen3.6 27B 模型测试了多个编码代理框架(GitHub Copilot、Pi、Claude Code、OpenCode),发现框架设计对性能影响显著,其中 OpenCode 在网络搜索和 Web 开发方面表现出色,而 GitHub Copilot 在文件编辑工具方面表现不佳。

我想知道编码代理的性能有多少来自模型本身,又有多少来自框架,因此我构思了一套方案,以便在同一任务上测试多种代理框架与模型的组合。上面所有图片都来自同一模型,但使用了不同的框架。我仍在努力实现自动化/量化评估,而不是主观判断。以下是图片中未体现的几点观察: 1. OpenCode 默认可以搜索互联网,这使它在某些任务上的结果好得多。例如,在 3D 打印机说明页面中,它列出了具体的耗材温度等数据。 2. 在 Web 开发方面,OpenCode 给出了非常好的结果。虽然此处无法交互,但它创建了效果很好的交互式小部件。 3. 该模型在 GitHub Copilot 上确实表现不佳。通常需要尝试五六次才能写入一个文件。它经常搞乱 Copilot 的文件编辑工具,但在其他框架上没有这个问题。Claude Code、Pi 和 OpenCode 都只需 4 次 LLM 请求就能创建 pelican.svg,而 GitHub Copilot 需要 13 次!它先尝试编辑工具,然后尝试 bash,再尝试编辑工具……无论它们使用什么工具架构,在我的测试中,该 LLM 都很难应对。这导致速度非常慢,因为它必须一遍又一遍地重新生成相同的差异。 4. Qwen3-vl-4 在 OpenCode 中陷入无限循环,甚至无法将 pelican.svg 写入磁盘。
查看原文

相似文章

最喜欢的代理式编码工具

Reddit r/LocalLLaMA

作者比较了几种代理式编码工具(Codex CLI、Claude Code、Gemini CLI、OpenCode、Pi),认为Pi最精简且最适合本地模型,赞赏其简洁性以及与Qwen 27B-MXFP8的兼容性。