@LangChain: 了解 @unifygtm 如何在发布前两周将模型成本削减90-95%,详见上周的 Max Agency YouTube 剧集:https:…
摘要
Unify GTM 通过架构优化和提示缓存将AI模型成本降低了90-95%,强调了对抗性判断模型对于可扩展销售AI代理的重要性。
查看缓存全文
缓存时间: 2026/08/19 02:37
了解@unifygtm如何在发布前两周将模型成本削减90-95%——尽在上周Max Agency的YouTube节目:https://youtu.be/6898VdRtKDE
Apple播客:https://podcasts.apple.com/nz/podcast/how-unify-cut-its-ai-agent-costs-95-in-two-weeks/id1891551672?i=1000783151404…
Spotify:https://open.spotify.com/episode/6kWQouc2QmiHGk0vdiZEtd?si=ba6e241ca4a24faf…
摘要:Unify GTM通过将架构从多智能体优化为更高效的单智能体系统,并实现约95%的提示缓存命中率,在发布前两周将AI模型成本降低了90-95%。同时,该公司强调了对抗性评判模型和专为可扩展销售AI智能体设计的云原生框架的重要性。
Unify AI智能体系统的演进
Unify GTM是一个外呼型AI智能体平台,已为其客户创造了9亿美元的业务机会。联合创始人兼CTO Connor Hegy阐述了该系统近三年来的发展历程。初代版本基于LangChain构建,是一个旨在解决核心市场进入问题的研究型智能体:识别那些因特定问题而最需要客户产品的公司。
首个系统使用GPT-3.5,并采用基础的工具调用循环。一个重大改进是在执行前引入基于推理模型的规划步骤。该规划步骤会建议信息查找方法及潜在风险,显著提升了输出质量,并应用于客户的整体可寻址市场(TAM)。
该系统的规模使其能够处理长尾市场细分——这些细分通常占TAM的高两位数百分比。例如,为判断某公司是否需要KYC(了解你的客户)工具,智能体可能会分析其服务条款页面中关于社会保障号的描述,或扫描HTML中的“身份验证”等关键词。这实现了以往由销售开发代表(SDR)或客户经理(AE)完成的自动化工作,为单一增长营销人员提供了100至1000倍的可扩展性。
成本优化与提示缓存
一项关键成就是在发布前两周将成本降低了90-95%。初始架构运行“过多子智能体”,导致成本过高。解决方案是转向更智能、更高效的主智能体架构。
关键技巧是提示缓存,Unify实现了约95%的缓存命中率。Hegy强调优化这些命中率的重要性:“如果你不这样做,那就完了。”他指出模型提供商不会为你解决此问题,因为“他们不了解输入数据分布。他们不在乎。他们照样收费。”因此,优化缓存命中率的负担落在构建者身上。
评判模型的关键作用
当使用LLM作为评判者评估智能体性能时,Hegy警告称评判模型的数据分布永远不会与原始模型匹配。这可能导致“智能体间对话模式的崩溃”,类似于人类的“群体思维”。
为应对此问题,他提倡采用**“近对抗性评判”**。必须谨慎选择评判模型,因为其作用比最初设想的更为重要。这种方法有助于保持稳健的评估,防止系统收敛到薄弱或错误的输出。
构建面向销售的云原生智能体框架
Unify新的聊天产品将其平台功能直接扩展至个体销售代表。其理念不是取代销售人员,而是通过强大工具增强他们,移除繁琐重复的任务,使其专注于人际互动。正如Hegy所言:“我肯定不想从AI智能体那里购买产品。”
底层智能体框架与编码智能体框架共享许多原则,但输出不同。Unify的智能体不是修改代码库中的文件,而是修改数据库记录、生成电子邮件序列并处理其他业务数据操作。
该框架针对其云环境设定了具体且不可妥协的标准:
- 持久性与重连能力:智能体必须作为后台任务运行,能承受断开连接和服务器超时(例如60秒负载均衡器超时),并实现无缝重连。
- 语言与环境:采用TypeScript编写以匹配其代码库,且必须具有极低的环境开销以实现快速扩展和成本效率。
- 数据处理:框架必须原生且高效地处理结构化表格数据(如CSV)。由于模型不擅长直接处理此类数据,系统提供包装器允许模型通过代码生成使用Pandas等工具。他们使用OpenAI原生文件API等接口进行文件访问。
- 目标导向的代码执行:智能体的核心机制是在沙盒环境中编写和执行代码,以实现数据处理和输出生成目标,类似于编码智能体,但以业务数据为对象。
该系统使单个销售员能通过聊天指挥“工程师”,动态构建数据表和工作流,实现以往仅专属增长营销团队的可扩展性和效能。
来源:YouTube - LangChain:Unify如何削减90-95%的模型成本(https://www.youtube.com/watch?v=6898VdRtKDE)
相似文章
@LangChain:在最新一期Max Agency中,@cognition总裁@russelljkaplan分享了开发者为何不再追求最佳模型,而开始……
LangChain的Max Agency播客邀请了Cognition总裁Russell Kaplan,讨论开发者为何现在将效率置于最佳模型之上,以及像Devin这样的智能体如何被大规模部署。
@LangChain: https://x.com/LangChain/status/2061864647884464430
LangChain和Harvey的一项研究探索了通过分批标准评估和使用开源模型来降低验证法律代理输出成本的方法,实现了数量级的成本节约,同时保持了接近前沿的性能。
也许下一个模型的胜利在于降低智能体工作流的消耗
文章讨论了下一个重要的模型进步可能在于降低智能体工作流的成本,重点介绍了蚂蚁集团的 Ling-2.6-1T,这是一个万亿参数模型,旨在以低计算开销实现高效推理和任务执行。
@LangChain:在提升您的代理之路上
LangChain 宣布了一项用于改进 AI 代理的资源。
@LangChain:你所有的代理都需要前沿模型吗?我们通过Deep Agents评估运行了NVIDIA的开源路由器Switchyard…
LangChain使用Deep Agents测试了NVIDIA的开源路由器Switchyard,结果表明在模型之间进行路由可以将成本降低约70%,同时保持约90%的准确率,并推出了针对NVIDIA模型的新中间件集成。