以前交给初级同事的活,现在 Opus 5.5 五分钟就干完了。我觉得大家还没意识到我们已经比 GDPval 前进了多远
摘要
作者认为,像 Opus 5.5 这样的前沿模型如今已经能完成大量以往交给初级同事的工作;在 GDPval 类任务上(GPT-5.2 → 5.5、Opus 4.7 → 5.5),基准测试成绩的飞速提升已经超出了公众讨论的节奏。他向社区提问:AI 委派正在如何重塑日常办公工作?
去年 12 月,GPT-5.2 在 71% 的任务上赢过或打平了行业专业人士。到 4 月,GPT-5.5 已经达到 85%,Opus 4.7 达到 80%。随后 OpenAI 悄悄停止发布自己由人类评分的成绩,然后大家就当没这回事,继续往前走了。(artificial analysis 发布的 GDPval-AA v2.1 是由 AI 评分的,所以我就不算在内)
我知道这些都是界定清晰的任务,而不是完整的工作岗位。但它们占据了我工作日的相当大一部分,而更新的模型自那之后又有了进一步的提升。有了 Opus 5.5,有些任务以前我会交给初级同事,现在几分钟就能完成,而且几乎不出错。我几乎不再从零开始构建东西了。我描述我想要什么,模型产出它,然后我来审核。根据我的审核结果,它 95% 以上的时候都做对了。
很期待 Fable 5.5 以及后续的模型。我预计会有越来越多、难度越来越大的领域达到类似的水平。在我看来,这就像正常性偏误(normality bias)——每一代模型相比上一代都只是迈出了一小步,所以没有人真正感受到我们已经走了多远。
大家在日常办公工作中是怎么感觉的?你们是不是发现自己越来越多地把工作委派给 AI、自己只负责审核,而不是大量亲自动手?很想听听大家的想法。
相似文章
@browser_use:浏览器使用基准测试 v2 帕累托前沿今日完全重塑 > Claude Opus 5.5:59.4 > GPT‑6 Sol medium:66.9 (3.5...
浏览器使用基准测试 v2 更新了其帕累托前沿,展示了来自 OpenAI 的 GPT-6 模型在性能和成本效益上均超越了来自 Anthropic 的 Claude Opus 5.5。
Opus 5.5 在 Terminal-Bench 4.0 上的成本与性能对比
本文评估了 Opus 5.5 AI 模型在 Terminal-Bench 4.0 基准测试中的成本效益和性能。
@omarsar0: 效率前沿!你认为 GPT-5.6 会落在哪里?
讨论 Claude Opus 4.8 和 GPT-5.5 在 DeepSWE Bench 上的最新基准测试结果,并推测未来 GPT-5.6 的性能和效率趋势。
OSWorld2.0:长周期真实世界任务中计算机使用代理的基准评测
OSWorld 2.0 是一个新的基准测试,用于评估计算机使用代理在 108 个长周期真实工作流程上的表现。当前像 Claude Opus 4.8 和 GPT-5.5 这样的代理完成率较低,凸显了它们在处理复杂多步骤任务时的显著局限性。
开源模型正以约1.5倍于前沿模型的速度缩小与GPT/Claude/Gemini的编码差距,且在去污染基准测试中,一个27B模型已经击败了Claude Opus 4.8 [实时仪表盘 + 分析]
一个实时仪表盘和统计分析显示,开源编码模型正以1.5倍的速度缩小与闭源模型的差距,一个27B模型已经在去污染基准测试中超越了Claude Opus。工具调用可靠性仍然是主要瓶颈。