你必须在某方面击败模型(9分钟阅读)
摘要
文章主张,软件工程师应通过深入掌握代码库和提升技术沟通能力等方向与AI模型形成差异化,以维系其行业价值。
软件工程师需与AI模型实现差异化,侧重于需要深入代码库知识和技术沟通技能的任务。诸如GPT-5.6-Sol等模型能以低成本生成代码,却难以理解系统上下文,且倾向简单化而规避不必要的复杂性。有效的沟通——特别是将复杂的AI生成内容进行转译的能力——仍是AI尚未攻克的持久技能。
查看缓存全文
缓存时间: 2026/09/01 11:44
# 你必须在某些方面超越模型
来源:https://www.seangoedecke.com/you-have-to-beat-the-models-at-something/
2025年,我提出软件工程师应通过“替代性价值”来评估 (https://www.seangoedecke.com/value-over-replacement/):即他们相比同等职位普通工程师能创造多少额外价值,而非直接为公司赚了多少钱。我常觉得工程师在简历上写“开发了创造X收入的产品”有点可笑——如果他们只是处理分配到手的JIRA任务 (https://www.seangoedecke.com/party-tricks/)的话。
如今,“替代性价值”变得更加重要。2010年代的普通工程师尚可接受:虽不值得提拔,但仍值得支付薪酬 (https://www.seangoedecke.com/wicked-features/#why-build-wicked-features),因为编写代码的固定成本很高。而现在代码编写成本仅需每月一百美元 (https://chatgpt.com/codex/pricing/)。如果换作GPT-5.6-Sol或Claude Opus 5,它们能否完成你当前的工作?为何要多支付两三个数量级的薪酬?
这是个令人不安的思考。但若假装大语言模型不会真正编写代码 (https://garymarcus.substack.com/p/is-vibe-coding-dying)、认为这一切只是骗局,或坚信模型生成的代码质量如此低劣 (https://www.theregister.com/ai-ml/2026/05/16/ai-generated-code-is-pain-waiting-to-happen/5241574)会导致使用这些代码的公司在明年崩溃,那不过是自欺欺人。我们不会在2027年醒来时发现AI热潮已退,所有人又开始手写代码。你应该认真思考:在中长期内,哪些领域你能比模型做得更好。
保持领先于模型是个动态目标。2026年初,“对大型代码库进行有效修改”尚属此类领域 (https://www.seangoedecke.com/what-llms-cant-do/),但如今已非如此。因此,我不认为你可以退守某个需要更深专业知识的“硬核工程”领域。这可能短期内有效,但无法持久。如果大语言模型能在黎曼猜想中找到更优的下界 (https://www.anthropic.com/research/riemann-zeta),它们很快就能编写高性能的内核驱动或GPU着色器代码 (https://www.seangoedecke.com/you-have-to-beat-the-models-at-something/#fn-1)。
我认为更有用的做法是关注那些模型未曾随时间提升的任务,以及那些它们从根本上难以改进的任务。最佳例证有两个:
1. 对代码库的深度熟悉
2. 技术沟通能力
### 深度熟悉https://www.seangoedecke.com/you-have-to-beat-the-models-at-something/#deep-familiarity
前沿大语言模型常犯哪些错误?它们会产生什么类型的编程失误?我已很久没见到编码代理出现直接幻觉或简单逻辑错误(如差一错误)。它们犯的往往是“无知性错误”:
- 不知道代码库中存在可重用的模块,反而重新实现逻辑
- 因未掌握系统X是该功能的标准处理位置,而在错误系统中进行修改
- 采用与公司标准实践不符的编码风格
有时则是“偏执性错误”:
- 对理论上可能出错、实际上从配置读取后永不更改的值进行三重冗余检查
- 假设十毫秒的数据延迟不可接受,设计复杂且不必要的系统以保持实时更新
- 在某些应直接崩溃报错的代码中(如CLI工具或可重启的K8s服务)加入冗余回退和“优雅降级”
这些错误有何共性?这就像一位聪明工程师在缺乏系统上下文时会犯的错误:他们能力足以解决问题,但因经验不足无法自信地说“是的,为避免三千行冗余代码我们可以承担这个风险”。除非有人攻克持续学习 (https://www.seangoedecke.com/continuous-learning/) 或实现真正巨大的上下文窗口,否则这将是AI代理运作的固有特性。若你能发现这些错误,就能创造实质价值。
发现这些错误的唯一途径是熟悉代码库和整体系统。相关论述详见我的文章《你无法设计未参与的软件》 (https://www.seangoedecke.com/you-cant-design-software-you-dont-work-on/)。但心理层面同样重要——**你必须敢于自信地质疑AI代理**。
AI代理可能极具说服力。它们常在某些风险点上“卡住”,坚持规避特定风险,不断回溯插入防护代码(或给出看似合理的论证)。要创造价值,你需要敢于指出:“这方案太糟,我认为根本不需要X和Y,为什么不用更简单的Z方案?”这需要勇气 (https://www.seangoedecke.com/taking-a-position/)。
你无法依赖其他AI代理相互审核工作。若使用相同模型,它会稳定地做出相同假设和犯相同错误。即使使用不同模型,它们也因相同结构原因倾向于相似类型的错误——无知与偏执。AI驱动的审核循环实际上更可能出错,因为现代AI经强化学习 (https://en.wikipedia.org/wiki/Reinforcement_learning) 训练后总会鸡蛋里挑骨头。让评审AI与工作AI相互碰撞,最终很可能产出万行偏执冗余代码。
### 技术沟通https://www.seangoedecke.com/you-have-to-beat-the-models-at-something/#technical-communication
在AI之上创造价值的另一领域是**沟通能力**。较新的模型编程能力更强,但矛盾的是写作能力却在下降。GPT-3.5和GPT-4曾有时呈现类人文风。GPT-4o引入了现代“AI水文” (https://www.seangoedecke.com/on-slop/) 风格,而更新的Anthropic模型则使用“Claude腔” (https://news.ycombinator.com/item?id=49402907):一种诡异的半华丽半截断的表达方式,无人欣赏。虽有少数亮点——GPT-4.5尚可,我颇为喜欢o32 (https://www.seangoedecke.com/you-have-to-beat-the-models-at-something/#fn-2)——但总体上大语言模型并不擅长写作。原因有二:
首先,**优质写作并非可量化领域**。若要训练模型精通数学或编程,可以生成问题并自动评分。但优质写作无法自动评分。若尝试人类评分(如早期OpenAI的RLHF尝试),产出的往往是“每句话堆砌三百种修辞技巧”的风格,在普通人单段阅读时显得高深。理论上可挑选品味佳者进行评分,但存在明显障碍 (https://www.seangoedecke.com/you-have-to-beat-the-models-at-something/#fn-3)。
其次,**实验室始终偏重能力提升而忽视沟通培养**。当训练目标是攻克科学前沿或替代软件工程师时,沟通能力可能被牺牲。实际上我们甚至能追溯这种权衡的发生机制。若观察模型内部推理标记 (https://www.reddit.com/r/ClaudeAI/comments/1ul1396/fable_5_leaked_chainofthought_in_web_interface/),会发现其用词奇特且语法截断:
> 解析:急切加载当前腿节已存储的前缀占用状态:当腿节i保存e*1..e*t时,同时在腿节i提交占用状态
若译成规范英语,会呈现类似“Claude腔”的句式:
> 在清晰急切的路径上加载当前腿节的前缀占用状态:当腿节i保存e*1..e*t时,在腿节i提交占用状态
我怀疑某些大语言模型的诡异文风,实则是其内部思维链的半直译——这种思维链为追求更强解题能力已变得近乎晦涩。将“Claude腔”转化为优秀英语异常困难:你不仅需理解原文复杂压缩的语言,还需技术能力把握模型解决的问题。
因此,**技术沟通能力可能成为异常持久的技能**。在彼得·沃茨小说《盲视》 (https://en.wikipedia.org/wiki/Blindsight_(Watts_novel)) 中,世界充满认知增强人类。主角是“综合师”:负责在这些天才(他们用缩写和手势交流)与常人间搭建沟通桥梁。沃茨的观点是:沟通能力很可能独立于智力——甚至与之负相关。“天才国度” (https://darioamodei.com/essay/the-adolescence-of-technology) 仍需要一群普通聪明人向大众转译他们的洞见。
向人类传达信息时,由人类撰写内容具有巨大优势。我们许多人正变得“AI盲视” (https://cymerys.com/w/im-becoming-ai-blind):遇到AI生成内容时产生条件反射式抗拒。就像人们自动忽略闪烁广告牌或网页侧边栏广告一样。若以AI文档形式传播技术策略,多数同事必须强迫自己逐字阅读。
### 结论https://www.seangoedecke.com/you-have-to-beat-the-models-at-something/#conclusion
无论如何,别成为“人力代理” (https://gruhn.me/blog/2026-08-03/):即将请求简单转发给AI代理,将其输出作为自己工作成果的人。这本质上是在乞求被解雇,因为你未创造任何价值。即使构建了所谓“软件工厂”的多代理精巧系统,依然身处险境。当你的系统特性融入企业AI工具(这必将发生)时,你将变得可有可无。
**你需要找到利用专业能力完成模型无法之事的方法。**完全不用AI好过成为人力代理——因为你可能在某些方面比模型做得更好。但最佳策略是理解AI的能力范畴,并定位填补其空白。当前主要空白在于:对系统技术细节的熟悉度,以及清晰有力阐述这些细节的写作能力。
---
若喜欢本文,可考虑订阅邮件更新 (https://buttondown.com/seangoedecke),或在Hacker News分享 (https://news.ycombinator.com/submitlink?u=https%3A%2F%2Fwww.seangoedecke.com%2Fyou-have-to-beat-the-models-at-something%2F&t=You%20have%20to%20beat%20the%20models%20at%20something)。
以下是共享标签的相关文章预览:
> AI让弱工程师危害降低 与其他解谜活动类似,软件工程能力呈强幂律分布。顶尖工程师产出远高于平均水平,而最弱的工程师常带来净负面影响——他们阻碍项目进展,制造同事需要耗费时间解决的问题。这就是为何许多科技公司 (https://www.levels.fyi/companies/jane-street/salaries)选择组建规模小、薪资极高的团队,而非容纳普通工程师的大团队,且这一策略目前看来依然有效。继续阅读... (https://www.seangoedecke.com/ai-makes-weak-engineers-less-harmful/)
---
相似文章
Moats Need Models(6分钟阅读)
本文认为,AI的可防御性来自于拥有完整的反馈循环——基于专有数据进行后训练的自定义模型,针对特定工作流进行调整,并由用户定义的标准进行评估——而不是从可能随时更改条款的供应商那里租用前沿API。它强调模型定制是实现差异化和利润控制的关键。
模型在软件工程领域正遭遇收益递减
一位超大规模公司的杰出工程师认为,AI 模型在软件工程任务中正遭遇收益递减,他发现 Claude 的 Fable 5 与之前的 Opus 模型之间几乎没有差别,并预测本地模型很快将提供可媲美的价值。
大多数公司的人工智能问题不在于模型
一项分析指出,公司在人工智能方面失败的原因在于它们专注于模型,而非基础层——流程设计、治理、知识架构、人工判断和反馈循环——而这些才是真正的价值来源。文章引用了纳德拉的“令牌资本”概念、苹果可切换模型的Siri,以及显示战略与执行之间存在巨大差距的调查数据。
软件工程基础更为重要
本文强调,在人工智能和智能工具时代,软件工程基础仍然至关重要,突出了大型语言模型的推理局限性,以及对可维护、良好设计的软件的需求。
@dunik_7: 2026年AI工程师年薪超过25万美元,其中几乎不来自训练模型,而是来自一项技能:构…
讨论了顶级AI工程师如何通过构建围绕模型的系统(而非训练模型)赚取超过25万美元年薪,并解析了关键技能,包括记忆系统、封装(harness)、循环工程(loop engineering)和追踪(tracing)。