@LangChain:在最新一期Max Agency中,@cognition总裁@russelljkaplan分享了开发者为何不再追求最佳模型,而开始……

X AI KOLs Timeline 新闻

摘要

LangChain的Max Agency播客邀请了Cognition总裁Russell Kaplan,讨论开发者为何现在将效率置于最佳模型之上,以及像Devin这样的智能体如何被大规模部署。

在最新一期的Max Agency中,@cognition总裁@russelljkaplan分享了开发者为何不再追求最佳模型,而是开始追求效率。YouTube:https://youtube.com/watch?si=Ff-wq0tBPTx-SC8V&v=bBUotstDLdk&feature=youtu.be… Apple:https://podcasts.apple.com/us/podcast/the-misaligned-incentives-behind-ai-coding-agents/id1891551672?i=1000779120914… Spotify:https://open.spotify.com/episode/7JNB5YXA6NVgUDAhy8eA3V…
查看原文
查看缓存全文

缓存时间: 2026/08/11 05:42

在最新的Max Agency节目上,@cognition总裁@russelljkaplan分享了为什么开发者不再追逐最佳模型,而是开始追逐效率。YouTube:https://youtube.com/watch?si=Ff-wq0tBPTx-SC8V&v=bBUotstDLdk&feature=youtu.be… Apple:https://podcasts.apple.com/us/podcast/the-misaligned-incentives-behind-ai-coding-agents/id1891551672?i=1000779120914… Spotify:https://open.spotify.com/episode/7JNB5YXA6NVgUDAhy8eA3V…


@LangChain:在最新的Max Agency节目中,@cognition总裁@russelljkaplan分享了为什么开发者不再追逐最佳模型,而是开…

频道: @LangChain 来源:https://www.youtube.com/watch?si=Ff-wq0tBPTx-SC8V&v=bBUotstDLdk&feature=youtu.be

文字记录

我的机器学习职业生涯始于 特斯拉的自动驾驶团队。我今天和 特斯拉的朋友聊了聊, 瓶颈已经不再是训练越来越大 的模型了。实际上是 运行评估。

今天我的嘉宾是Russell Kaplan, Cognition的总裁,也就是 Devon背后的公司——Devon是一个从 病毒式演示发展到在世界上一些 最复杂的组织中部署代码的智能体。 我们基本上有一个评估智能体 ,它可以接收一个会话并判断 它是否富有成效?这给了我们 信心去真正面对客户 说我们真的要做出 1000万美元的生产力 [音乐]保证。他解释了为什么以及 主动式智能体如何给人类 工程师带来超大杠杆。 你有所有这些很棒的 需要应用的修复建议。哦是的,看起来不错。我 想让你在这里改一下。个体 开发者基本上已经意识到我 可以成为一支10000个智能体大军的CTO。 我们深入探讨了大规模运行智能体 的实际成本,以及Cognition如何 将其降下来。 有些组织的人均 token支出已经开始 超过人力薪资支出。通过 [音乐]在路由方面变得更 聪明一些,我们可以获得大约35%更好的 [音乐]性价比,同时质量 还略有提升。他还主张 “最佳模型”这个概念已经不存在了。 Fable类模型非常适合 [音乐]高精确率,但 我们实际上发现GP 5.5和5.5 Cyber 在召回率上更好。你必须 两者都用。 欢迎收听Max Agency,[音乐] 这档播客深入探讨最好的 智能体是如何被像你一样的构建者 构建出来的。[音乐] 你们大约在两年半前、 现在来看是三年前有一次大规模发布, 我认为你们开创了很多 非常有趣的概念,特别是 在UX以及通过Slack与Devon 交互方面。我觉得那是我第一次 看到这种交互方式被如此 突出地展示。所以那次发布我记得很多。 我记得很多关于UX的细节。 我相信其他人也是。关于你们 在过去两年半里一直在做的事情, 人们应该了解些什么? 是的,我们在2024年3月发布了Devon。 是最初的演示视频, 当时火遍了全网,那时候 我会说编码智能体刚刚处在 可行性的边缘。你稍微眯着眼 看一看,好吧,这在某个时间点 会成功的。然后我们拼凑出了 一个第一版的示例,展示那可能是什么样子? 你知道, SweetBench当时大概是13%,我记得你们 达到了那个成绩,而且是之前 最佳成绩的三倍。 完全正确。是的,我们当时 大概是13%的Sweetbench。嗯,这确实 非常令人兴奋。而且顺便说一下,这个数字 让我想起了我们一些更近期的评估 以及我们在编码智能体方面的现状, 我们用了一个新的评估, 叫做Frontier Code,这个我们可以后面聊。 但是当我们 在24年3月发布的时候, 我们有一个观点,最终 你会拥有像队友一样的 智能体,你可以把完整的工作单元 委托给它们。我们学到的 是,从“好吧,这是一个原型, 我们从中能看到未来”到“这是 一个真正在内部有用的东西”, 我们花了好几个月。我记得 是24年6月,Devon成为了 向Devon提交代码最多的提交者, 那是我们的第一个重大里程碑。 那已经是很久以前的事了。确实是 很久以前,但那是在做大量的手动 dog fooding,并且真的在努力 打磨内部工作流程,然后 我们又花了好几个月才真正 把它部署到生产环境中, 并且对客户有用。在 2024年那会儿,异步云端 编码智能体真的无法完成 软件工程中的大多数任务,但 已经有一些利基场景了。 我认为早期最好的场景之一是 迁移和重构。如果你基本上运行一个 类似于reax++风格的工作流, 加上一些零散的智能 点缀,跨大型代码库操作, 这在2024年底其实已经 运行得相当不错了。所以这就是我们 早期产品市场契合度的来源。 是和更大的公司,更像 企业级的公司,他们 就是有大量的代码需要做 所有这些转换。 为什么那是一个这么好的场景? 有几个技术上的原因 让这说得通。一个是 对于非常大的重构或迁移, 或者你知道的ETL转换之类的, 值得投入精力去 仔细做提示工程,让你的 云端智能体变得准确,所以 如果你反复迭代你的提示、 你的设置、以及 你输入进去的上下文,然后把它 刚好调对,你就可以把它应用到 代码库中的10000个模块上。 这真的是高投资回报率的,而且 显然比简单的查找替换 字符串修改要好得多,但是 它不需要那种我们现在 委托各种编码任务所需的 完整通用软件智能,所以即使在 早期这也运行得很好,但它 仍然有点小众。然后在 24年12月,我们发布了Devon, 任何人都可以注册,我们 内部有场大辩论:应该 重点强调什么,或者说重点应该 是什么。我记得我们做了 一件事,我们包机把整个公司飞到犹他州, 就为了在12月锁定方向并发布 这个产品,赶在 年底之前。我们最终确定的 是Slack作为主要界面。 所以整个Devon的发布视频, 实现自助服务,我们在内部 就叫它“At Devon at Devon at Devon”, 真正想要强调的是这种 用户体验的转变——与智能体的协作 更像与队友协作。从那时起 我们获得了更多用户,获得了 更多的增长动力。你知道, 从那以后云端智能体变得 越来越好。无论是基础设施 变得更好,还是我们在那方面 更加成熟,还是模型变得更好, 还是封装框架变得更好。现在我认为 大部分工作都是通过 委托给异步智能体来完成的了。 是的,也许深入聊一下这点。 是什么样的改进 让它们真正腾飞了? 有几件事。首先我觉得 人们总是在说模型变得更好, 那确实非常重要, 但我认为基础设施的成熟度 也是关键。 你觉得第一个真正 够用的模型是什么? 哦是的,你知道我们一直在说 就是它了就是它了,这个新模型 就是它了。我觉得有几次 阶段性的变化。我认为 2024年11月的那一代 模型系列是一个大的 阶梯式跳跃,那时候觉得 好吧,这真的可以工作得 好很多了。我们做自助发布 部分就是基于那个模型 ,来自OpenAI的。然后 Anthropic的模型开始变得 非常好,我们大概在 25年7月看到了又一次大的 阶梯式变化。现在我觉得 像Fable 5这样的新一代模型 在持续带来阶梯式变化, 而且现在这些阶梯式跃升已经 高到不再只是关于 能力增长了。我觉得我们在 某种意义上看到了一种相反的趋势, 软件工程中越来越多的 任务正在变得智能饱和。 所以很多开发者的 敏感点已经完全从 “等等,我得用最好的 模型”变成了“天哪,我在 编码智能体上花了这么多钱, 我怎么能更高效 一点?”你知道, 我觉得这是前沿智能持续进步中 一个被低估的方面,那就是 对于某些工作负载,你 总是想要最前沿的智能。 特别是如果这是 各方之间的对抗性游戏, 你的智能必须比 对手的智能更高,比如 如果你在做竞争性交易 或者类似的事情。但对于很多 我们想构建的软件来说, 存在一个饱和阈值, 一旦它足够好了,你 真正关心的就是速度 和成本。我认为这实际上 是开发者和我们合作的公司 所展示的巨大需求所在: 好吧,这已经能用了。 我现在怎么优化速度和成本? 在模型方面,也许问一个问题。 你觉得Fable类模型在什么任务上, 你今天能看到那种跳跃? 比如你会推荐人们在 哪里使用它们?你看到人们 在哪里使用它们?我觉得我们看到的, 也许在这最近一代的 模型中,Fable是一个例子, 特别大的进步首先在于 网络安全漏洞的检测 和修复。现在这些模型的 公开版本中有很多护栏, 所以实际上 让它们提供帮助可能有点棘手。 我们看到,比如说, 如果你想清理 我的安全积压工作——顺便说一句,这 目前对我们合作的很多 公司来说是一个巨大的工作负载—— Fable类模型在 高精确率方面真的 非常好。但我们实际上发现, GP 5.5和5.5 Cyber 在召回率上更好。 所以目前最好的 发现和修复安全 漏洞的封装框架, 你必须两者都用, 你基本上是把GP系列 可能更好找到的那些 筛选出来,再交给Fable 系列处理。我觉得这是一个重要的例子。 另一个是从集成中 处理数据,比如来自Datadog 或其他系统的数据。 我们确实在Fable中 看到了评估方面的阶梯式进步。 这是因为那些数据如此庞大和杂乱, 需要更多的智能吗? 我觉得很大程度上是。是的,就是 有一个体量的考量。 有一个多步骤推理的 考量。而且我觉得你能 看出来在这些非常真实的 被大规模扩展的数据源上 进行了大量的强化学习。 可能第三个类别, 也许是最引人注目的,是 一个我们最近才通过 新的编码评估工作 得以更好地检测和理解的类别。 因为正如你所说,当我们发布Devon时, 它在Sweetbench上只有 十几分,现在Sweetbench已经完全 饱和了,所以我们怎么找到 下一个难度级别的 模型评估方法?我们 找了所有现有的评估基准, 找不到任何一个能真正 匹配我们那种模糊的内部 直觉——这个模型感觉好多了。 当我们深入挖掘, 真正问自己为什么会这样时, 我觉得我们发现的核心评估缺口 在于“可合入性”—— 这段代码技术上 是正确的,但你真的会 合并它吗?你会感到满意吗? 这会提高你代码库的质量吗? 有很多不同的微妙例子 说明这可能意味着什么: 可能是风格上遵循了 你已有的预期。可能是 以一种将来容易修改的 方式完成,或者如果 其他修改发生了,它能 优雅地处理那些修改。 所有这些小的风格问题, 我们觉得都没有被 现有的评估捕捉到。所以我们 基本上开始着手制作一个新的 评估来更好地衡量这一点, 同时也为前沿编码能力 设立一个新的更高难度 基准。然后我们最近 发布了它。叫做 Frontier Code。它又一次, 是新的最难编码 评估。Frontier Code Diamond子集 在Fable 5之前 只有十几分,现在我想Fable 5 已经推到了三十几分。 所以我想知道这个评估还有 多少个月就会被刷爆。 我正要说的,是的,一年后 我们会说:还记得它刚出的时候 只有十几分吗。 是的。我在想,我确实在想 这些评估会越来越难做。 我的意思是,我自己的机器学习 职业生涯始于特斯拉的 自动驾驶团队,那是 2017年左右,瓶颈非常明显 就是GPU和算力,就是 好吧我们怎么获得更多算力, 我们就是需要更多算力。你知道, 我今天和特斯拉的朋友 聊了聊,瓶颈实际上 已经不再只是训练越来越大的 模型了,实际上是运行 评估,因为对于自动驾驶系统来说, 干预是如此罕见,以至于你 必须进行海量的驾驶 才能发现堆栈中的 任何问题。而且你知道, 我觉得对于软件工程来说, 我们还没到那一步。我们仍然 能找到bug,但我们 可能比我们想象中更早 达到那个阈值。 我们会和很多团队讨论 使用LangSmith和其他类似工具 为他们的系统创建评估。 你们是怎么创建Frontier Code的? 那个过程是什么样的?它始于 “好吧,我们需要去找那些 顶尖高品位的开发者, 他们要有非常强的 风格质量以及 代码正确性标准,来帮我们回答 ‘你真的会合并这段代码吗’, 不仅仅是‘这段代码能通过测试吗’ ‘它在功能上正确吗’。 所以这算是第一部分。我们实际上 和很多领先的开源 作者进行了深度合作 和招募活动,他们真的 非常感谢在这件事上的合作, 没有他们这是不可能的——去找到 开源中那些最知名的、 拥有非常高编码标准的库, 然后与他们密切合作, 将他们的人类直觉—— 什么能让一个PR被 我接受——编码到这些 精心设计的测试中。那是第一部分。 那些测试长什么样? 是LM作为裁判吗?还是 程序化断言? 是的,多种方式。所以一部分是 程序化断言。当然, 有正确性测试,是程序化的。 在风格元素上也 可以有程序化断言,比如 好吧,如果你在这个合并请求中做了 这个修改,你必须 使用这个模块,即使 现在使用另一个模块是等价的。 随着时间推移如果它们发生偏差, 如果你没有使用正确的模块, 将来就会引入一个 bug。所以这可以 确定性断言,但它需要 人类作者的判断来 确定。然后另一个重要的方面, 我认为这在那些实践机器学习 和使用智能体的人中 仍然做得不够的,是 Cognition团队中的每一位 研究员都亲手 贡献并审查了 评估。所以这不是 你能随便丢给

相似文章