以前交给初级同事的活,现在 Opus 5.5 五分钟就干完了。我觉得大家还没意识到我们已经比 GDPval 前进了多远

Reddit r/singularity 新闻

摘要

作者认为,像 Opus 5.5 这样的前沿模型如今已经能完成大量以往交给初级同事的工作;在 GDPval 类任务上(GPT-5.2 → 5.5、Opus 4.7 → 5.5),基准测试成绩的飞速提升已经超出了公众讨论的节奏。他向社区提问:AI 委派正在如何重塑日常办公工作?

去年 12 月,GPT-5.2 在 71% 的任务上赢过或打平了行业专业人士。到 4 月,GPT-5.5 已经达到 85%,Opus 4.7 达到 80%。随后 OpenAI 悄悄停止发布自己由人类评分的成绩,然后大家就当没这回事,继续往前走了。(artificial analysis 发布的 GDPval-AA v2.1 是由 AI 评分的,所以我就不算在内) 我知道这些都是界定清晰的任务,而不是完整的工作岗位。但它们占据了我工作日的相当大一部分,而更新的模型自那之后又有了进一步的提升。有了 Opus 5.5,有些任务以前我会交给初级同事,现在几分钟就能完成,而且几乎不出错。我几乎不再从零开始构建东西了。我描述我想要什么,模型产出它,然后我来审核。根据我的审核结果,它 95% 以上的时候都做对了。 很期待 Fable 5.5 以及后续的模型。我预计会有越来越多、难度越来越大的领域达到类似的水平。在我看来,这就像正常性偏误(normality bias)——每一代模型相比上一代都只是迈出了一小步,所以没有人真正感受到我们已经走了多远。 大家在日常办公工作中是怎么感觉的?你们是不是发现自己越来越多地把工作委派给 AI、自己只负责审核,而不是大量亲自动手?很想听听大家的想法。
查看原文

相似文章