@LangChain: .@mondaydotcom had one agent trying to handle 200+ tools. Context pollution everywhere. The LLM was confused, costs ris…
摘要
Monday.com 的 Sidekick AI 代理从多代理架构(200+ 工具)转向深度代理架构,通过三层工具发现、优先委托、代码编写和自我修复机制解决上下文污染和成本问题。
查看缓存全文
缓存时间: 2026/06/28 09:59
.@mondaydotcom had one agent trying to handle 200+ tools.
Context pollution everywhere.
The LLM was confused, costs rising, and it still wasn’t working.
@omribruchim on rebuilding Sidekick with Deep Agents: https://t.co/fS6u3D1X6V https://t.co/n5nL9PxVts
TL;DR
Monday.com 的 Sidekick AI 代理从传统多代理架构(200+ 工具、上下文污染)彻底转向深度代理(Deep Agent)架构,通过三层工具发现、优先委托、代码编写工具和自我修复机制,解决了规模扩展中的混乱与成本问题。
背景:从 V1 到 V2 的痛苦教训
Monday.com 是一个 AI 工作平台,他们构建了名为 Sidekick 的智能个人助手。V1 版基于简单的反应循环,功能有限但能工作。随着业务扩张(CRM、Service、Marketing 等多个产品线,每个领域有不同的工具和上下文),团队试图在 V2 中把所有工具塞进一个引擎——结果“在我们脸上炸开了”。
V2 采用多代理架构:每个领域有自己的 MCP(模型上下文协议)和工具集,但最终引擎里塞了超过 200 个工具,加上无限的上下文注入,导致:
- 上下文污染:LLM 被海量不相关工具搞糊涂。
- 成本飙升:模型需要处理大量无关信息。
- 不同领域需求冲突:一个工具集无法同时适应 CRM 看板、Service 文档等场景。
团队意识到需要全新的架构。他们调研后选择了深度代理(Deep Agent)。
为什么是深度代理?
深度代理满足了 Monday.com 的核心原则:
- 为真实工作而建,不只是对话界面。
- 支持多步骤工作流和迭代规划。
- 更好的关注点分离:通过子代理和记忆管理保持上下文不爆炸。
- 文件系统风格的深度上下文(深度上下文)。
哲学:一个高度有能力的单一大脑(智能编排者),而不是几百个互相聊天的混乱专业代理。同时信任现代 LLM 的能力:把规划、记忆管理、子代理生成等复杂任务交给模型自己完成。
四个核心原则
1. 三层工具发现
解决“200 个工具 + 上下文污染”的问题。
- 第一层:基础工具集 —— 总是暴露给模型。覆盖 50-60% 的常见用例,如网络搜索、图像生成、网页 URL 提取、 Monday 知识库搜索等。数量少,保持高效。
- 第二层:上下文相关工具 —— 根据用户当前查看的实体(文档、看板、CRM 记录等)动态注入。例如在笔记屏幕,只暴露“获取看板活动”“会议记录”等工具。大幅减少背景噪声。
- 第三层:延迟工具 —— 所有其他工具的目录,每个工具配 20 个词以内的简短描述。代理可以调用一个“延迟工具”来激活实际工具;调用后该工具才进入上下文。所有操作实时发生,减少幻觉。下一步计划:将所有工具描述推入语义数据库,支持语义搜索。
实际例子:当代理理解到需要“创建项目”时,它通过延迟工具搜索到对应的创建工具,激活并使用它。这样避免了预先加载所有工具。
2. 优先委托(子代理与中间件)
把任务交给专门的子代理处理,避免主代理被重复琐事拖累。
- 子代理:针对重复性任务(如演示文稿构建器、网络研究员)。有两种执行方式:一种是直接委托(类似“询问质量”),主代理可以继续并行工作,等子代理准备好再回来。演示中,用户让 Sidekick 介绍自己,Sidekick 立刻用子代理构建了一份演示文稿(利用沙盒)。
- 中间件管道:实现无缝委托和关注点分离。关键中间件包括:
- 背景管理器:注入用户身份、位置、时区、连接的 MCP 等信息。
- 重复名称修复中间件:纠正 LLM 幻觉生成的错误工具名称。
- 模型选择中间件:允许用户实时切换运行模型。
中间件让执行图保持干净、可测试、可组合。
3. 工具能写代码
避免为每个用例都构建专门工具。Sidekick 允许代理编写 Python 代码,并在安全的沙盒(LangChain 沙盒)中运行。一个安全的沙盒可以替代几百个工具。
真实案例:用户想为单位在伦敦找新办公室,要求距离大本钟开车不超过 20 分钟,特定时间出发。Sidekick 利用 Google API 和开放地图,编写算法计算地点周围的合适办公室。没有代码编写工具,这一切不可能实现。
4. 自我修复
LLM 经常自信地产生幻觉,但 Sidekick 能在生产中自我纠正。
- 变量顾问工具:当 Sidekick 不知道怎么做时,中间件检测到失败,自动切换到不同模型。
- 资源扩展:遇到内存不足错误时,自动尝试扩展资源(简单的重试策略,但解决了大量问题)。
- 恢复成功率:经过这些策略,Sidekick 达到了 94% 的恢复成功率。该机制被称为“修复反思”,覆盖所有资源。
企业工作流不允许频繁失败,自我修复是生产环境必备的。
实际效果与给开发者的建议
Sidekick 已从 V2 的混乱转向新一代深度代理架构,成功解决工具膨胀和上下文污染。在伦敦办公室搜索这类复杂任务中,代理能自主规划、编写代码、调用外部 API,真正“干活”。
最后,Omri 给出四个建议:
- 使用代码编写工具:这是终极无限规模工具,效果好。
- 优先委托:不要把一切放在一个代理上。
- 使用工具发现:工具列表很长时,不要全塞给编排代理,分开并使用中间件。
- 使用深度代理:它带来了清晰的关注点分离和稳健性。
Source: YouTube – @LangChain: .@mondaydotcom had one agent trying to handle 200+ tools…
相似文章
@LangChain: .@mondaydotcom构建了他们的AI副驾驶Sidekick,不仅仅是回答问题。它能处理复杂的、迭代式工作…
monday.com通过将AI副驾驶Sidekick从一个通用型智能体重建为具有专门子智能体和LangSmith Sandboxes的系统,增强了其在生产中处理复杂、迭代式工作的能力。
@LangChain 的推文: https://x.com/LangChain/status/2091932626961527086
LangChain 的托管服务允许通过一条命令将 AI 代理部署到 Slack,自动化应用配置,无需手动设置。
@LangChain: Deep Agents 现在支持动态子代理。主代理不再通过工具调用来调用子代理,而是编写协调…
LangChain 的 Deep Agents 现在支持动态子代理,主代理通过编写协调代码来大规模协调工作,实现处理数百份文档等具有确定性覆盖的工作流程。
@justloveabit: 用这个开源工具,我让一群AI替我上班了 事情是这样的,最近一直在折腾各种AI agent。Claude Code开一堆窗口,Codex也在跑,偶尔还要用Cursor。结果呢,乱成一锅粥——哪个agent在干啥,花了多少钱,完全搞不清楚。重…
本文介绍了一款名为Paperclip的开源工具,用于统一管理和调度多个AI Agent。它通过模拟公司组织架构、任务分配与预算控制等功能,解决了多Agent协作时上下文丢失、成本不可控和调度混乱的痛点。
@Xudong07452910: 开源框架推荐:《Agency Agents》—— 232 位专业 AI 智能体,按职能分工,覆盖 16 个业务部门 如果你用过 Claude Code 或 Codex,可能遇到过这个问题:AI 在代码任务上很能干,但让它做前端设计、写营销…
Agency Agents 是一个开源框架,提供232个专业AI智能体覆盖16个业务部门,每个智能体具有独特个性、沟通风格和交付标准,支持Claude Code、GitHub Copilot等多种开发工具,并有社区翻译版本。