Opus 5 对比 Opus 4.8 与 GPT-5.6 Sol,免费测试。模型选择从来不是我的问题。

Reddit r/AI_Agents 新闻

摘要

一位独立开发者通过多模型路由器,利用免费额度测试了 Opus 5、Opus 4.8、GPT-5.6 Sol 和 Kimi K3,发现评估预算和输入预处理比原始模型选择更重要。

独自开发时,我的瓶颈与代码无关:我变得害怕自己的实验。每次管线改动,都得重新跑完整批数据,才能知道我是改进了还是弄坏了。Opus 5 和 Opus 4.8 都是输入 $5 / 输出 $25。Sol 更便宜,但有一百万 token 的上下文,我总是不停地填满它。所以每一次诚实的测试都要花钱,于是我不再测试,转而开始猜测。没有人审查你的代码差异,这是最糟糕的失败模式。我试了一个多模型路由器,本以为会遇到挂羊头卖狗肉的事。注册送额度,无需信用卡,三个模型外加 Kimi K3 都在一个兼容 OpenAI 的 URL 后面。(请相应调整对我热情的打折:这些有推荐计划。我没放链接,从中得不到任何好处。)不是骗局。但它的运作方式和我的预期不同,而这正是有用的部分。我原本以为免费额度意味着免费的算力。实际上它买到的是一个评估预算:跑一个真实的批次,每个候选模型各跑一次,把输出并排对比,选一个,提交,然后停止挑选。有三件事出乎我的意料:推理级别对账单的影响比模型选择大得多。Opus 5 默认进行推理,适合棘手的 bug,但用于查找替换就悄悄变得昂贵。我最大的收获来自在模型看到输入之前对输入进行预处理,而不是选择更强的模型。在我害怕比较的时候,永远不可能发现这一点。能力和遵循指令是两个独立的维度。当你是唯一的审查者时,最强的模型不自动等同于你想放进代码库的那个。我让前沿模型写出一个华丽的计划,列出它们将要编辑的文件,然后停下来,为思考过程向我收费。到底是模型的问题还是路由器的管道问题?真的无法分辨。生产关键任务就直连。真正的解决办法不是钱。而是我重新开始度量一切。乐意深入聊设置或评估批次,但请留在帖子里,别用私信。你们是怎么处理的:手动切换、用一个路由器,还是选定一个然后自己承担成本?
查看原文

相似文章

GPT 5.6 Sol 对决 Claude Opus 5

Reddit r/AI_Agents

作者比较了 GPT 5.6 Sol 和 Claude Opus 5,并表达了对 GPT 5.6 Sol 的偏好,原因是其清晰简洁的写作风格。

@browser_use: Opus 5 和 GPT-5.6 Sol 在此不相上下!

X AI KOLs Timeline

Alexander Yue 推出了一项新的浏览器使用基准测试,其中 Opus 5 和 GPT-5.6 Sol 表现相似,强调了基准测试的稳健设计,包括为大语言模型评委提供的经过验证的评分标准。