@LangChain: "A lot of the bottleneck in chip design, it's actually thermals." @cognition president @russelljkaplan on the Tesla deb…
Summary
Cognition 总裁 Russell Kaplan 在播客中回顾了编码智能体 Devon 的发展,介绍新评估 Frontier Code 衡量“可合并性”,并讨论模型选择、成本与速度取代能力成为关键关注点。
View Cached Full Text
Cached at: 08/07/26, 08:50 AM
“A lot of the bottleneck in chip design, it’s actually thermals.” @cognition president @russelljkaplan on the Tesla debate that shaped how he thinks about inference. YouTube: https://youtube.com/watch?si=Ff-wq0tBPTx-SC8V&v=bBUotstDLdk&feature=youtu.be… Apple: https://podcasts.apple.com/us/podcast/the-misaligned-incentives-behind-ai-coding-agents/id1891551672?i=1000779120914… Spotify: https://open.spotify.com/episode/7JNB5YXA6NVgUDAhy8eA3V…
TL;DR:Cognition 总裁 Russell Kaplan 回顾了 Devon 从 2024 年发布时的 13% SWE-bench 分数,到如今用“可合并性”新评估 Frontier Code 衡量下一代编码智能体的过程;他反复指出,瓶颈已从“训练更大的模型”转向“运行评估”,而且成本与速度正取代能力成为很多团队最关心的事。
从病毒式演示到生产环境智能体
Russell Kaplan 说,Devon 在 2024 年 3 月发布时,那个演示视频“超级病毒式传播”。当时编码智能体还只是“刚刚处在可能的边缘”,你得“眯着眼睛才能看到:好吧,这东西将来是能成的”。他们拼凑了一个第一版例子,展示它可能是什么样子。
主持人补充了一个关键数字:Devon 当时在 SWE-bench 上大约是 13%,“几乎是之前最好成绩的三倍”。Russell 确认了这个数字,并说那“真的非常令人兴奋”。但他强调,从一个原型到“内部真正有用的东西”,又花了好几个月。
“我记得大概是在 2024 年 6 月,Devon 成了 Devon 的头号提交者,那是我们的第一个重要里程碑。”
这个里程碑来自大量手动“吃自己的狗粮”式的打磨。之后又花了好几个月才真正部署到生产环境,并在客户那里产生价值。
早期 PMF:迁移和重构
在 2024 年那种“异步云端编码智能体”时代,智能体其实做不了软件工程里的大多数任务,但已经有一些利基场景。Russell 认为早期最好的场景之一就是迁移和重构:
“如果你基本上跑一个类似 ReAct++ 风格的工作流,跨越一个大代码库,再撒上一点智能,这其实在 2024 年底就已经能跑得不错了。”
为什么这个场景特别合适?有几个技术原因:
- 对于一个非常大的重构、迁移或 ETL 转换,本身就值得投入精力去精心做 prompt 工程,让云端智能体保持准确性。
- 你可以在 prompt、设置和喂进去的上下文上反复迭代,调整到刚好合适后,就可以把它应用到代码库里 10,000 个模块上。
- 这是非常高的 ROI,而且明显比单纯的查找替换、字符串改动要好得多。
- 它不需要那种“我们现在委派各种编码任务时所需的完整通用软件智能”。
所以即使在早期,这个场景也运行得不错,但它仍然有点小众。
自助服务版与 Slack 界面
到了 2024 年 12 月,Devon 发布了自助服务版,任何人都可以注册。Russell 说当时内部有一场大辩论,到底应该重点强调什么、聚焦在哪里:
“我记得我们当时把整个公司飞到了犹他州,就是为了在 12 月集中把所有事情搞完,把它推出去,赶在年底之前。”
最终他们确定把 Slack 作为主要界面。整个自助服务版的发布视频,内部叫它“Devon 里的 Devon”,内容就是“在 Devon @ Devon @ Devon”——目的是强调一种用户体验上的变化:和智能体的协作更像是和队友协作。
从那之后,Devon 获得了更多用户和增长。Russell 说,云端智能体从那以后一直在变得更好,无论是基础设施、成熟度、模型还是执行框架(harness)。“现在我认为大部分工作就是通过直接委派给异步智能体来完成的。”
智能体真正起飞靠什么?
主持人问:有哪些东西变好了,才让它们真正起飞?Russell 的回答是:人们总是谈模型变好了,这当然超级重要,但基础设施的成熟度也是一个关键因素。
模型能力的几次“阶跃变化”
Russell 提到几个阶段性的模型变化:
- 大约 2024 年 11 月的模型系列是一次巨大的阶跃提升,让他们觉得“这东西现在真的能好用很多了”。他们决定做自助发布,很大程度上也是基于那个(OpenAI 的模型)。
- Anthropic 的模型也开始变得非常好。
- 大约 2025 年 7 月,又迎来了一次巨大的阶跃变化。
- 现在有了 Fable 5 这样的东西,新一代模型仍在持续阶跃变化。
但 Russell 说,阶跃变化的幅度已经高到“不再只是能力提升”。在某种意义上,他看到的是相反的趋势:软件工程里越来越多的任务正在变得“智能饱和”。
“很多开发者的敏感点已经从‘等等,我必须用最好的模型’完全变成了‘我的天,我在编码智能体上花了这么多钱,怎么能更省一点’。”
对于某些工作负载,你总是想要最前沿的智能,尤其是多方之间的对抗性游戏,比如竞争性交易或类似场景。但对于很多想构建的软件来说,会存在一个饱和阈值:一旦它足够好了,你真正关心的就是速度和成本。
主持人还援引了一个观察:有些组织里,人均 token 支出已经开始超过人力薪资支出;而通过更聪明的路由,“我们可以获得大约 35% 更好的性价比,同时质量还略有提升”。Russell 说,这正是他们在大量需求中看到的趋势。
模型选择:没有“最好的模型”,而是组合使用
主持人问 Fable 类模型适合什么任务。Russell 说,最新这一代模型在几个领域有特别大的提升,首先就是网络安全漏洞的检测和修复。
他提到一个有趣的细节:Fable 类模型的公开版本现在有很多护栏,所以实际上要引导它们帮忙“可能会有点棘手”。但在实际使用中:
“如果你只是说‘清理一下我的安全积压’…… Fable 类模型在高精度方面确实很好。但我们实际上发现,GPT-5.5 和 5.5 Cyber 在召回率上更好。所以你必须两者都用。”
换句话说,目前“找到并修复安全漏洞”的最佳执行框架(harness),是用 GPT 系列找出更好的候选,再用 Fable 系列处理。这是一个很大的例子。
另一个例子是处理来自 Datadog 等系统的集成数据。Russell 说他们确实看到 Fable 在自己的评估上有一个阶跃式的提升。主持人问是因为那些数据特别庞大且杂乱,所以需要更多智能吗?Russell 认为很大程度上是的:
“是因为有数量上的考虑。也有多步推理上的考虑。而且我觉得你可以看出来,在这些非常真实、并且被大规模放大的数据源上,做了很多强化学习。”
第三个类别,也是最明显的类别,是他们在构建编码新评估时才学会检测和理解的一个类别。
Frontier Code:衡量“可合并性”的新评估
回到 SWE-bench:当 Devon 在 2024 年发布时,分数是十几分;现在 SWE-bench 已经完全饱和了。于是他们需要寻找下一个难度的评估层级。
Russell 说,他们把所有的 evals 都看了一遍,却找不到任何能匹配内部那种模糊直觉的评估——就是“这个模型感觉好得多”的直觉。深入挖掘后,他们发现评估里的核心缺口在于“可合并性”:
“这段代码技术上是对的,但你真的会把它合并进去吗?你会为此感到开心吗?它会不会提升你代码库的质量?”
“可合并性”可能意味着:在风格上符合你已有的预期;意味着它的实现方式未来容易修改;或者如果将来有其他修改发生,它能够优雅地处理这些修改。这些“小的风格上的东西”都没有被现有评估捕捉到。
所以他们做了一个新评估,叫做 Frontier Code,用来更好地衡量这一点,同时为前沿编码能力设立一个新的更高难度水位线。Russell 强调:“这是新的最难的编码评估。”
怎么创建 Frontier Code?
创建过程的第一步,是找到“品味极高的开发者”——既要有很强的风格质量,也要有很高的代码正确性标准——来回答那个核心问题:你真的会合并这段代码吗?而不仅仅是这段代码能不能通过测试、功能上正不正确。
他们和很多领先的开源作者做了深度合作和招募活动。Russell 说:“如果没有他们,这是不可能完成的。”具体做法是:
“我们要去找开源社区里那些最知名、编码标准非常高的库,然后和他们紧密合作,把他们对‘什么样的 PR 我会接受’的人类直觉,编码成精心设计的测试。”
这些测试既包含程序化断言,也包含正确性测试。风格元素也可以用程序化方式断言。Russell 举了个例子:
“如果你在这个 PR 里做了这个改动,你必须使用这个模块,即使现在用另一个模块是等价的;但长期来看,如果它们发生偏移,如果你没有用正确的模块,将来就会引入 bug。”
这种断言可以通过确定性方式执行,但需要人类作者来判断和敲定。
另一个关键原则是:Cognition 团队的每一位研究员都亲手贡献并审查了评估。Russell 认为很多做机器学习、和智能体协作的人仍然做得不够:
“这可不是你随随便便扔过墙、然后说‘好吧,数据质量这块是个苦差事,别人去做吧’的事情。你必须自己直接投入进去。”
主持人提到,很多团队会讨论如何用 Linksmith 之类的东西为自己的系统构建评估;Russell 说 Frontier Code 会跑在开源代码库上,他们可以在自己的基础设施里运行。为了避免污染,他们没有公布完整的问题集,只公布了一些示例问题,并希望能尽可能多地为社区保留这个评估,直到它被完全超过。
至于 Frontier Code 的成绩:Diamond 子集在 Fable 5 之前是十几分,现在 Fable 5 已经把它推到了三十几分。Russell 笑着说:“所以我们就有了……我不知道这个评估还能撑几个月。”
从特斯拉到软件工程:瓶颈的转移
Russell 回忆说,自己的机器学习职业生涯是在特斯拉的自动驾驶团队开始的,那是 2017 年左右。当时的瓶颈非常明确,就是 GPU 和算力:
“你会想:好吧,怎么搞到更多算力,我们就是需要更多算力。”
但他在节目录制当天和特斯拉的朋友聊了聊,发现情况已经变了:
“瓶颈已经不再只是训练越来越大的模型,而是运行评估。因为对于自动驾驶系统来说,人工干预太罕见了,你必须在海量的驾驶里程里才能发现堆栈里的任何一个问题。”
他把这个类比带到软件工程上。Russell 说,软件工程还没到那一步,仍然能发现 bug,但“我们可能比想象中更快触达那个阈值”。
这也是 Cognition 整体思路的一部分:用专门的评估智能体检查一个会话是否高效,从而对客户做出“1000 万美元生产力保证”之类的承诺。但 Russell 也承认,随着智能体能力持续变强,做出能区分“好”与“足够好”的评估会
Similar Articles
@LangChain: Brand new Max Agency with @cognition President @russelljkaplan + @hwchase17. YouTube: https://youtu.be/bBUotstDLdk?si=F…
In the interview, Cognition President Russell Kaplan reviews the development of coding agent Devon, discusses model intelligence saturation and cost optimization, and introduces how the new evaluation Frontier Code measures code mergeability.
@LangChain: On the latest Max Agency, @cognition president @russelljkaplan shared why devs stopped chasing the best model and start…
LangChain's Max Agency podcast features Cognition president Russell Kaplan discussing why developers now prioritize efficiency over the best model, and how agents like Devin are being deployed at scale.
@Russell3402: https://x.com/Russell3402/status/2056331558223786416
This article delves into the division of labor design in multi-agent systems, including trigger mechanisms, topology structures, and call chains, analyzing the engineering practices of systems such as Codex, Claude Code, OpenClaw, and Hermes Agent.
@seclink: https://x.com/seclink/status/2056711091129118741
In-depth interview with Jensen Huang, reviewing Nvidia's history from betting the company on CUDA to becoming the AI powerhouse, explaining the four scaling laws of AI and the development direction for the next decade, emphasizing compute bottlenecks and extreme co-design philosophy.
@LinQingV: When exploring LLM inference chip architectures previously, I reviewed the architectures of the four major AI inference ASIC companies: Groq, SambaNova, Tenstorrent, and Cerebras. While the first three have different emphases, their underlying logic falls within the same framework: large on-chip SRAM + dataflow architecture + deterministic scheduling...
The article analyzes the AI inference ASIC architectures of Groq, SambaNova, Tenstorrent, and Cerebras, highlighting Cerebras's unique wafer-scale engine design. It discusses the benefits of deterministic latency and high bandwidth for LLM inference, while noting challenges like yield, cost, and KV cache bottlenecks.