@LangChain: Brand new Max Agency with @cognition President @russelljkaplan + @hwchase17. YouTube: https://youtu.be/bBUotstDLdk?si=F…

X AI KOLs Timeline 新闻

摘要

Cognition 总裁 Russell Kaplan 在访谈中回顾编码代理 Devon 的发展,讨论模型智能饱和、成本优化,并介绍新评估 Frontier Code 如何衡量代码可合并性。

Brand new Max Agency with @cognition President @russelljkaplan + @hwchase17. YouTube: https://youtu.be/bBUotstDLdk?si=Ff-wq0tBPTx-SC8V… Apple: https://podcasts.apple.com/us/podcast/the-misaligned-incentives-behind-ai-coding-agents/id1891551672?i=1000779120914… Spotify: https://open.spotify.com/episode/7JNB5YXA6NVgUDAhy8eA3V…
查看原文
查看缓存全文

缓存时间: 2026/07/31 04:49

Brand new Max Agency with @cognition President @russelljkaplan + @hwchase17. YouTube: https://youtu.be/bBUotstDLdk?si=Ff-wq0tBPTx-SC8V… Apple: https://podcasts.apple.com/us/podcast/the-misaligned-incentives-behind-ai-coding-agents/id1891551672?i=1000779120914… Spotify: https://open.spotify.com/episode/7JNB5YXA6NVgUDAhy8eA3V…


TL;DR: Cognition 总裁 Russell Kaplan 讲述 Devon 从病毒式演示到企业级部署的进化,分享模型智能饱和、成本优化,以及新编码评估 Frontier Code 如何衡量“可合并性”。

从 Devon 发布谈起

Russell Kaplan 在特斯拉自动驾驶团队开启了自己的机器学习职业生涯。大约 2017 年时,瓶颈非常明显:GPU 和算力。而如今他和特斯拉的朋友们聊到,真正的瓶颈已经不再是训练更大的模型,而是运行评估——因为干预事件太罕见了,必须做海量的驾驶才能找到问题。

这种思路也贯穿了他对软件工程代理的看法。Cognition 推出的 Devon 最初于 2024 年 3 月发布,当时的演示视频超级病毒式传播。那时候编码代理刚好处于可能性的边缘——你稍微眯着眼看一下,就能看到“这东西总有一天能成”。Devon 在 SweetBench 上大约拿到 13%,比之前的最高纪录翻了三倍。

早期产品市场契合点:迁移与重构

从“原型”到“内部真正有用”花了几个月。2024 年 6 月,Devon 成为了 Devon 的头号提交者,这是第一个大里程碑。但那时做了很多手动自用测试,努力打磨内部工作流,又过了几个月才真正部署到生产环境、对客户产生价值。

在 2024 年那个时代,异步云端编码代理做不了软件工程里的大多数任务,但已经有一些利基场景。Russell 认为早期最好的应用之一是迁移和重构。如果基本上运行一个类似 ReAct++ 风格的工作流,跨越一个大代码库,再加上一些智能的点缀,这在 2024 年底其实已经能工作得相当不错。

为什么这个场景特别合适?

  • 对于非常大的重构、迁移或 ETL 转换,投入精力仔细做提示工程是值得的。
  • 你可以反复迭代提示词、设置和上下文,把它调得恰到好处,然后应用到代码库中的一万个模块上。
  • 这比简单的查找替换、字符串修改要好得多,但还不需要完全通用的软件智能。

因此早期产品市场契合更多来自较大型、偏企业类的公司,它们有大量代码需要做这些转换。

自助服务发布与 Slack 界面

2024 年 12 月,Cognition 发布了任何人可注册的 Devon。Russell 回忆,当时公司内部就“什么应该是重点、什么应该是核心”展开了大辩论。他们甚至把整个公司拉到犹他州,为了在 12 月全力冲刺,赶在年底前发布。

最终确定的方案是把 Slack 作为主要界面。整个 Devon 自助服务的发布视频,他们内部称为“Devon 里的 Devon”,就是在 Devon 里 @Devon——真正想要强调这种用户体验变化:与代理协作更像是和队友合作。

从那以后,用户和动力都增加了。云端代理持续变好,基础设施成熟了,模型变好,工具链也变好。现在大部分工作都是通过委派给异步代理完成的。

什么让代理真正起飞?

Russell 提到,人们总是说模型变好了,这确实非常重要,但基础设施的成熟度也是关键。

被问及“第一个真正足够好的模型是哪个”时,他说他们一直说“就是它了,就是它了”,但确实有几个阶段性的变化:

  • 2024 年 11 月左右的模型系列是一个大阶跃函数,来自 OpenAI。Devon 的自助服务发布部分就是基于那个。
  • Anthropic 的模型开始变得非常好,大概在 2025 年 7 月又有一个大阶跃。
  • 现在像 Fable 5 这样的新世代模型在持续阶跃进步。

但如今阶跃的意义已经变了。越来越多软件工程任务正在达到智能饱和。很多开发者的关注点从“等等,我需要用最好的模型”转变成了“天哪,我在编码代理上花了这么多钱,怎么能更高效一点”。

Russell 认为这是前沿智能持续进步中被低估的一个方面:对于某些工作负载,你总是想要最前沿的智能——特别是如果这是一个参与方之间的对抗性博弈,比如竞争性交易时。但对于很多要构建的软件,存在一个饱和阈值;一旦足够好了,你在乎的就是速度和成本。他从开发者和合作公司那里看到的需求正是:“好吧,这已经能用了。我现在怎么优化速度和成本?”有些组织的人均 token 支出已经开始超过人力薪资支出。

多模型策略:Fable 与 GP 5.5 的结合

在最新一代模型中,Russell 以 Fable 为例指出最大的提升首先在网络安全漏洞的检测和修复方面。不过这些模型的公开版本有很多安全护栏,实际上可能很难让它们帮忙。

他们看到的例子是“清理我的安全积压”——这对合作公司来说是一个巨大的工作量。Fable 类模型非常擅长高精确率,但实际发现 GP 5.5 和 5.5 Cyber 在召回率上表现得更好。所以现在最好的发现和修复安全漏洞的工具链必须两者都用:基本上用 Fable 系列筛选过滤掉那些可能由 GP 系列更好发现的漏洞。

另一个阶跃式提升的类别是处理来自集成的数据,比如 Datadog 或其他系统。Russell 认为这很大程度上是因为数据量太大、太混乱,需要更多容量方面的考量和多步推理。在这些非常真实的数据源上,强化学习的规模也已经大幅扩展。

Frontier Code:衡量“可合并性”

当初 Devon 发布时 SweetBench 只有十几分,现在 SweetBench 已经完全饱和了。为了找到评估模型的下一级难度,Cognition 找了所有现有评估,却发现没有一个能匹配那种模糊的内部直觉——“这个模型感觉好多了”。

深入挖掘后,他们发现评估的核心差距在于“可合并性”:这段代码技术上是对的,但你真的会合并它吗?你会感到满意吗?这会提高你代码库的质量吗?

“可合并性”可以有各种微妙的例子:

  • 在风格上遵循你已有的期望;
  • 以某种方式完成,未来容易修改;
  • 如果未来有其他修改发生,它能优雅地处理这些修改。

Cognition 着手制作了一个新评估来更好地衡量这一点,也为前沿编码能力设立了新的更高难度基准。这个评估最近发布,叫做 Frontier Code。其中 Diamond 子集在 Fable 5 之前是十几分,现在 Fable 5 推到了三十几分。Russell 笑说:“我不知道这个评估还能撑几个月。”他预计像去年那样——一年后大家会回想:“哦还记得它刚到这个评估上十几分的时候吗?”

做这些评估本身会越来越难。Russell 说,软件工程评估目前还没有达到特斯拉自动驾驶那样的程度,但他们可能会比想象中更早达到那个阈值。

怎么创建 Frontier Code

采访中提到,很多团队会用 linksmith 或其他工具为自己的系统创建评估。Cognition 的做法分几步:

首先,去找那些口味最高、标准最高的开发者,他们有很强的风格质量标准和代码正确性标准,来帮助回答“你真的会合并这段代码吗?”——不仅仅是“通过测试、功能上正确”。

第二步是实际和很多领先的开源作者做深度合作与招募。去找开源中那些最知名的、编码标准非常高的库,然后密切合作,把“什么样的 PR 是我会接受的”这种人类直觉编码进精心设计的测试中。

这些测试是什么样的?

  • 一部分是程序化断言。
  • 当然有正确性测试,程序化的。
  • 在风格元素上也可以有程序化断言:例如,如果你在这个拉取请求中做了这个更改,你必须使用这个模块,即使现在使用另一个模块是等价的。但随着时间的推移,如果它们发生偏离,没有使用正确的模块将来就会引入 bug。这可以确定性断言,但需要人类作者的判断力来做出决定。

另一个重要的事情是:Cognition 团队的每一个研究员都亲手贡献、审查过评估。就像 Russell 说的:“这不是你可以扔给别人的东西,说:好吧,数据质量这块,这是个脏活,别人去做吧。你必须亲自参与其中。”

为了防止数据污染,他们没有发布完整的问题集,只发布了一些示例问题,希望能为社区尽可能长时间地保留这个评估——直到被做穿为止。

Source: YouTube 采访视频

相似文章