Opus 5 对比 Opus 4.8 与 GPT-5.6 Sol,免费测试。模型选择从来不是我的问题。
摘要
一位独立开发者通过多模型路由器,利用免费额度测试了 Opus 5、Opus 4.8、GPT-5.6 Sol 和 Kimi K3,发现评估预算和输入预处理比原始模型选择更重要。
独自开发时,我的瓶颈与代码无关:我变得害怕自己的实验。每次管线改动,都得重新跑完整批数据,才能知道我是改进了还是弄坏了。Opus 5 和 Opus 4.8 都是输入 $5 / 输出 $25。Sol 更便宜,但有一百万 token 的上下文,我总是不停地填满它。所以每一次诚实的测试都要花钱,于是我不再测试,转而开始猜测。没有人审查你的代码差异,这是最糟糕的失败模式。我试了一个多模型路由器,本以为会遇到挂羊头卖狗肉的事。注册送额度,无需信用卡,三个模型外加 Kimi K3 都在一个兼容 OpenAI 的 URL 后面。(请相应调整对我热情的打折:这些有推荐计划。我没放链接,从中得不到任何好处。)不是骗局。但它的运作方式和我的预期不同,而这正是有用的部分。我原本以为免费额度意味着免费的算力。实际上它买到的是一个评估预算:跑一个真实的批次,每个候选模型各跑一次,把输出并排对比,选一个,提交,然后停止挑选。有三件事出乎我的意料:推理级别对账单的影响比模型选择大得多。Opus 5 默认进行推理,适合棘手的 bug,但用于查找替换就悄悄变得昂贵。我最大的收获来自在模型看到输入之前对输入进行预处理,而不是选择更强的模型。在我害怕比较的时候,永远不可能发现这一点。能力和遵循指令是两个独立的维度。当你是唯一的审查者时,最强的模型不自动等同于你想放进代码库的那个。我让前沿模型写出一个华丽的计划,列出它们将要编辑的文件,然后停下来,为思考过程向我收费。到底是模型的问题还是路由器的管道问题?真的无法分辨。生产关键任务就直连。真正的解决办法不是钱。而是我重新开始度量一切。乐意深入聊设置或评估批次,但请留在帖子里,别用私信。你们是怎么处理的:手动切换、用一个路由器,还是选定一个然后自己承担成本?
相似文章
@mattshumer_: 我测试GPT-6 Sol有一段时间了。它很可靠,但我仍然更喜欢Astra/Fable 5.1(现在可能是Opus 5.5)用于日常……
Matt Shumer测试GPT-6 Sol并分享他对Astra/Fable 5.1和Opus 5.5模型的偏好,同时提到OpenAI宣布的更快、更实惠的GPT-6 Sol和Luna模型。
GPT 5.6 Sol 对决 Claude Opus 5
作者比较了 GPT 5.6 Sol 和 Claude Opus 5,并表达了对 GPT 5.6 Sol 的偏好,原因是其清晰简洁的写作风格。
@philipkiely: 关于示例工作负载:Opus 4.8 -> Kimi 2.7 Code | 节省82% GPT 5.5 -> GLM 5.2 | 节省77% Gemini 3.5 Flash -> Nemot…
菲利普·基利(Philip Kiely)的一条推文强调,使用Baseten的ROI计算器工具,从闭源AI模型切换到开源替代方案可节省成本。
@browser_use: Opus 5 和 GPT-5.6 Sol 在此不相上下!
Alexander Yue 推出了一项新的浏览器使用基准测试,其中 Opus 5 和 GPT-5.6 Sol 表现相似,强调了基准测试的稳健设计,包括为大语言模型评委提供的经过验证的评分标准。
Opus 5.5 与 GPT-6 Astra/Sol 的所有基准测试对比
如图所示,在基准测试对比中,Opus 5.5 的表现优于 GPT-6 Astra 和 Sol,但成本更高。