大扁平化(22分钟阅读)

TLDR AI 新闻

摘要

文章认为,随着AI编码模型达到超人水平,工程瓶颈从编写代码转向将判断编码到智能体框架中,这些框架负责规划、测试、审查和部署。预测软件组织将变得扁平化,基于云的多智能体系统取代传统工程工作流程,客户洞察和产品判断成为人类的主要优势。

前沿编码模型已将工程瓶颈从编写代码转向将判断编码到智能体框架中,这些框架负责规划、测试、审查和部署。预测软件组织将变得扁平化,因为基于云的多智能体系统取代了传统工程工作流程,使得客户洞察和产品判断成为人类的主要优势。
查看原文
查看缓存全文

缓存时间: 2026/07/15 22:57

前沿编码模型已将工程瓶颈从编写代码转移到将判断编码到智能体运维框架中,该框架负责编排规划、测试、审查和部署。预计软件组织将扁平化,因为基于云的多智能体系统取代了传统的工程工作流,使客户洞察和产品判断成为人类的主要优势。


大扁平化

献给那位一个人撑起整个工程组织的工程师。

模型觉醒了。

去年发生了一些大多数人尚未完全理解的事情。模型在编程方面变得超人,不是趋近,不是差不多,而是此刻真正超人。我曾是印度排名第一的程序员,在 Google Code Jam、Topcoder、ACM ICPC 中名列前茅。前沿模型远远超过了我。我每天都感到敬畏。

基准测试 | 测试内容 | 早期模型 | 今日前沿模型
SWE-bench Verified | 解决真实世界的 GitHub 问题 | 33% (GPT-4o, 2024) | 88.2% (Claude Opus 4.8, 2026),该基准现已饱和
Terminal-Bench 2.1 | 在真实终端任务上智能体编码 | 88.0% (GPT-5.5, 2026) | 91.9% (GPT-5.6 Sol Ultra, 2026)
Codeforces | 竞赛编程 | 11% 分位 (GPT-4o, 2024) | 99.8% 分位 (o3, 2025)
IOI | 国际信息学奥林匹克 | 49% 分位 (o1, 2024) | 金牌水平 (2025)

如此强大的模型已不再适合装在你的电脑里。每个新版本运行得更久、自主规划工作、生成自己的辅助程序。一台必须放在你手边打开的机器已不再是恰当的家。开发的未来在云端。本文的其余部分将解释原因以及需要什么。

你仍在循环中。

每个新版本都让模型运行更久、独立表现更好。然而,走进任何工程组织,人类仍在循环中:提示、审查、纠偏,被机器束缚。我经历过。我重度使用 Claude Code 并全程监督每一次会话,干预过多会抵消速度优势;而放手让它无监督运行又会失去方向。最新的模型几乎消除了这些问题。它们可以无人值守运行数小时,自主规划工作,压缩自身上下文,并在报告前检查自身输出。所以监督结束了?不。它提升了一个层级,就像瓶颈总会移动那样。你曾经监督会话。现在你监督系统:你是否信任一个你没有逐行审阅的合并?二十个自主会话能否同时操作一个代码库而不互相冲突?在到达你之前,它们是否在你真实的堆栈上运行过?

你想要大规模并行。你想合上笔记本,回来时看到工作已完成。你越是退出循环,工作就越需要在云端运行。

那么为什么现在还没有所有人都运行在云端?因为他们被提供的云是盲目的。智能体在某个虚拟机编写代码,但无法运行你的应用,也无法通过运行所有服务来端到端测试。因此每个分支都必须回到笔记本上进行检查,循环再次把你拉进来。云真的需要解决端到端运行和测试的问题,才能为你节省时间。

整个公司扁平化。

代码不再是难点。工程师过去从经理那里接受指令,从产品经理那里听取需求,然后执行,信息在每个环节衰减,迭代拉长时间线。那已经结束了。当你能在几分钟内从想法到生产代码时,稀缺的东西变成了有新想法、直接从客户那里获取需求、运行下一个实验。我曾是 Rippling(如今价值超过 100 亿美元)的联合创始人兼 CTO。如今我每周比自己的工程师提交更多代码,不是因为我是一个更好的程序员,而是因为客户在通话中给我想法,这些想法直接进入会话,并在通话结束前合并。不应该再存在积压任务。一个想法应该在几小时内变成生产影响力。

顺着这个转变向外看,超越你自己的办公桌,它重新绘制了整个公司。每个公司都有一个固定的人类细胞边界:面向外部世界的表面。销售、客户关系、人类必须代表公司接触另一个人类的时刻。这些暂时还是人类的… 现在。边界内部的一切——规划、设计、架构、审查、执行——都向运维框架(运行工作的系统)坍缩。组织架构图不是缩小,而是改变形状。内部一个人,或者零个人。这就是大扁平化。

所以工作变成了元级。你不再解决眼前的任务,而是解决为什么这个有机体自己无法解决它。每个人的真正工作变成自我剖析:你头脑中的决策框架是什么,在代码库中没有体现;你如何分类;你依赖什么数据;别人不会做出的逆向决策。那个判断是唯一剩下的稀缺物。那么它该去哪里?

运维框架。

如果现在的工作是将判断编码化而不是亲自做事,那么判断需要一个栖息地。它住在运维框架中。运维框架是你工程原则不再停留在你脑中,而是开始运行在每次会话中的唯一地方:你如何分类,只有你才会做的架构决策,不可妥协的发布标准。把它们写进文档,它们第二天就过时,无人阅读。把它们放进运维框架,它会在你不在场的情况下应用那些判断一千次,处理你永远不会看到的代码。那就是元级工作变得有形的过程。你的原则传达到新员工时有损耗,一半从未被明确说出;但传达到运维框架时无损耗,而且它们会累积,因为你编码的每一个判断都是你永不再需要再做的判断。这是竞争对手无法复制的东西,因为它就是你公司的形状,被明确写下来。

还有第二个原因说明为什么运维框架必须是你的。每个模型版本都会吞噬它下面的层级。手工构建的上下文管理、自定义子智能体设置、人们手工打造的聪明变通方法:实验室观察哪些方法有效,然后将其内置,因此你本季度依赖的技巧在下个季度就变成默认配置。赌在机制上就是赌实验室会输,而每次版本发布你都会输掉这个赌局。不过有两件事他们结构上无法发布。第一是你的判断,只有你才会做的决策,这就是上面整个重点。第二是中立性。实验室的运维框架现在会派出自己的子智能体并运行自己的审查者,真正的工程,确实不错,但总是来自同一个家族,针对中位数代码库调优,因为没有实验室会把你工作路由到竞争对手的模型。因为我们不训练任何模型,这一层保持中立:你的判断运行在每个实验室的最佳模型上,工作会移动到本周某个任务的最佳模型上。我们不训练任何模型。实验室发布他们的观点。没有人发布你的观点。

剖析瓶颈。用令牌淹没它。

那么如何构建那个运维框架?不是用更智能的模型,也不是用更快的自动补全。已经这样生活的人反而收敛到一种方法:根据你自己的代码库调整设置,然后将令牌倾泻到开发周期中持续绊倒你的那些部分。有一个流行的术语:tokenmaxxing。

那些已经悟透的人进入了一个新范式。人员保持低位,信息对称性和构思速度保持高位。你的团队因为队列满了而连续几个月拒绝的功能:第二天早上就完成了。我这里今天的一些客户:

  • 一位产品经理现在是完整的研发团队。他每天花 1000 美元购买令牌,合并代码的速度超过了他管理过的任何团队。
  • 一位获得风险投资的独立创始人决定完全不招聘。

高级工程师 | 令牌 | 成本
全面薪酬 30-50 万美元 | 每个任务几美元
启动时间 | 数月招聘,数周融入 | 数分钟
并行度 | 一次只做一件事 | 水平扩展,零协调开销

座位是错误的计算单位。令牌才是正确的单位。纪律是具体的:每次模型版本发布,剖析人类时间仍花在哪里,每个瓶颈,然后向它倾泻令牌直到它消失。终点是一个提示,它最终能一键合并,中间尽可能少的人为干预。人类时间是瓶颈。令牌不是。

执行这种纪律是一份全职工作。搭建基础设施,配置子智能体,为每个分配正确的模型,连接对抗性验证,然后每隔几周当新版本发布重置哪个模型最好时重新调整所有内容:大多数团队没有把这份工作纳入工资单,而他们手工构建的任何东西一个季度后就过时了。Opus 4.8 在 5 月底重置了答案;Fable 5 在两周后又重置了它们,然后几天内就消失了。无论你上周调优了什么,本周可能已经有更好的替代品。

从提示到合并的 PR 之间有六个瓶颈:机器、规划、将众多小规划编排成一个变更、测试、审查、合并本身。每个瓶颈都以同样的方式消亡:被剖析,然后被令牌淹没。

在你睡觉时。

在讨论各个部分之前先描绘目标,因为目标才是全部意义所在。今天,一堆任务之所以成为队列,原因只有一个:每个任务都需要你坐在它面前,一次一个。工作本身并不需要这样。队列之所以存在,是因为分发是手动的,执行是串行的。移除两者后,队列就不再是队列:定义好的工作在定义的那一刻就分散出去,在一百台隔离的机器上并行运行一百个会话,在请求者仍在睡觉时一夜完成。积压从来不是一堆太大而无法完成的工作。它是一堆等待轮到它、被一个人挡住的工作。下面的六个瓶颈是今天与那个夜晚之间的一切,以及每个瓶颈如何被打破。

瓶颈一:机器。

从工作运行的地方开始,因为其他一切都依赖它,也因为这才是所有人都停留在 localhost 的真正原因。一个生产应用是一套服务与微服务绑定在一起,全部同时运行:你的前端、后端、移动应用、数据库。一个云沙箱可以运行脚本。但它无法启动这一切。CI/CD 没有接线,环境变量无处可指,能让它们指向真实位置的密钥从未被询问过。任何试图在生产中使用云智能体的团队最终都会回到自己的机器上,因为智能体不断交出从未在其实际系统上运行过的代码。

所以我们按照开发者设置自己笔记本的方式设置一个原始的 EC2 实例:一群智能体克隆仓库、安装库、启动每个进程。多仓库、单次会话,前端、后端和移动应用一起编辑和运行。它会询问所需的密钥和环境变量。那些不光彩的部分也会跟上:认证、种子数据、跨浏览器会话携带的 cookie,当需要访问它没有的东西时,它会询问,有数百个原生集成可用。然后它将所有东西实时运行的机器快照保存下来,这样每个新会话醒来时就在一台已经准备好的计算机上:库已安装,进程已启动。从那里,一个高级提示就足够了。

从未在你的实际系统上运行过的代码是不完整的。它只是一个猜测。在机器构建并亲眼看到它工作之前,没有任何东西应该作为完成的 PR 到达你手中。这就是打破 localhost 循环的部分:一旦智能体有了运行你所运行一切的真实住所,离开循环就不再让你失去信心,并行也不再让你失去你的笔记本。

瓶颈二:规划。

工程师大部分时间都花在这里,而解决的世界花费的时间更多,因为这是修复错误最便宜的地方。今天的工具做相反的事:用几行简短的提示花几分钟,然后直接跳到代码,而问题本身值得花一个小时思考。这种偷工减料会向下游复合:计划中的每个缺口都会在构建过程中十倍偿还。所以最多的令牌应该花在这里,而不是最少。

理想情况说起来简单。你交出一个意图、两个链接和一个句子,返回的不是代码,而是一个值得辩论的计划。它首先探索了你的整个堆栈:仓库、数据库、互联网的相关角落,并询问一个好的工程师在承诺之前会问的那些问题。你一行回答:自动批准工具调用,在功能标志后门控变更。然后它起草,另一个实验室的审查者撕毁草稿,修复、批评、再修复,直到诞生一个计划的计划:子任务,每个都有各自的测试用例,每个都足够小以便干净地构建。然后你在代码之上一个层级进行审查,在那里真正的决策存在:依赖图、哪些并行运行、哪些等待、架构、数据模型。你在需要的地方评论,计划重新生成。

把计划做对,构建就不再与你对抗。我的规则是五分钟:如果引导一个功能花费我的时间超过五分钟,那它根本就不会被构建。

瓶颈三:编排。

计划中的计划仍然是一堆零件。每个部分必须运行,与其他部分排序,输出必须协调,接缝必须清理。今天,这些工作是你的,它是一位高级工程师一整天中杠杆效应最低的事情:协调,零判断。这里有一个迹象表明它从来就不应该是人类的工作。你学会做的每一个动作——在粗糙的传递之后运行 /simplify,重新读取模型重写了两次的文件,在脑中保持依赖顺序使两个变更不会冲突——都是一个规则。规则是系统比人运行得更好的东西:它永远不会忘记一条规则,也永远不会厌倦应用它。所以协调不再是人类的事。一个控制器将工作沿依赖图扇出,将每个部分保持在构建、判断、修复的循环中直到落地,并将结果呈现出来。

两件事使那个控制器不仅仅是一个循环。首先,它为每个部分指派最适合该部分的模型,而模型不可互换。

模型 | 组织基因 | 优势 | 劣势 | 最适合
GPT (OpenAI) | 大规模预训练计算 | 深层架构推理,读通全局图景 | 前端和工具调用能力较弱 | 规划、高赌注设计
Claude (Anthropic) | 推理时计算聚焦 | 长周期自主性、编排、强工具使用;无监督运行数小时 | 规模化部署时成本较高 | 构建、派发子智能体、长时间自主运行
Gemini (Google) | YouTube 和网络索引 | 多媒体、高上下文快速处理、低成本 | 工具调用和迭代思考能力弱 | 界面创建、高吞吐处理
中国开源模型 (Kimi, Qwen, GLM) | 开放权重、强化学习密集 | 以极低价格接近前沿能力 | 需要非常详细的规范 | 高吞吐、成本敏感的执行

这张表在写的时候是准确的,2026 年 6 月。其中部分内容到秋天就会过时,而这比看起来更重要:必须有人持续找出哪个模型(来自任何家族)在每个工作上最强,而它就在你脚下变化,任何供应商都不会为你做这件事。

第二,控制器将每个子智能体保持在各自的上下文窗口中,因为上下文窗口会老化。随着上下文窗口填满,模型会变得迟钝,就像漫长的一天让人疲惫:它会忘记二十分钟前做的一个决策,在代码库中留下两个半成品版本。一个大型会话就是一个衰老的大脑。一群新鲜的不一样,每个都有自己的上下文、自己的模型、自己的固定工作,保持敏锐,主智能体通过将混乱的工作下放给它们而保持干净。协调一直是开销,而开销是令牌应该首先吞噬的东西。

瓶颈四:测试。

这是让其他人的云变得毫无意义的瓶颈。如果分支仍然需要回落到你的笔记本电脑上进行检查,那云有什么用?运行代码不是标准;看到它运行才是。一个

相似文章

最终瓶颈

Armin Ronacher

一篇反思性博客文章,探讨了代码生成中AI加速如何压倒审查流程,在软件工程中创造了新的瓶颈。并与历史上的工业瓶颈进行了类比,建议将抑制输入作为必要回应。

AI是否导致前端迷失十年的重演?

Hacker News Top

文章将当下AI对编程的去技能化作用与过去JavaScript框架对前端开发的去技能化现象进行了类比,认为两者都代表了向更高抽象层次的转变,这种转变降低了入门门槛,却削弱了工作者的议价能力。

@saranormous: https://x.com/saranormous/status/2064510215056400652

X AI KOLs Following

尽管以Devin为代表的AI编程助手取得了快速进展,显著提升了代码编写和交付的速度,但本文认为,软件工程中最有价值的部分仍难以通过基准测试衡量,并且需要人类的判断和组织协调,这些是无法轻易自动化的。

AI之长,AGI之短(3分钟阅读)

TLDR AI

本文认为,AI智能正变得像计算和存储一样商品化,最有价值的公司将不是模型构建者,而是那些拥有客户关系、专有数据和工作流程的公司。