Deep Agents v0.7(6分钟阅读)

TLDR AI 工具

摘要

LangChain发布了Deep Agents v0.7,这是一个更精简的智能体框架,通过移除默认系统提示、精简工具描述以及将TodoListMiddleware设为可选,将基础输入令牌减少了65%,并在多个模型上验证了性能相当。

Deep Agents v0.7将基础输入令牌减少了65%,同时保持性能,提升了令牌和成本效率。
查看原文
查看缓存全文

缓存时间: 2026/07/30 18:26

# Deep Agents v0.7 来源:https://www.langchain.com/blog/deep-agents-v0-7 今天我们发布了 deep agents v0.7。这个版本简化了基础框架,在性能相当的情况下,基础输入 token 减少了 65%。 构建有效的智能体归根结底是上下文工程:模型的能力取决于你给它的上下文,而上下文又取决于提示词中包含的内容。如何组织好提示词是框架的任务。但这方面的指南不断变化:OpenAI (https://developers.openai.com/api/docs/guides/prompt-engineering)、Anthropic (https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models) 和 Google (https://cloud.google.com/discover/what-is-prompt-engineering) 都发布了自己的提示词工程指南,并且随着模型能力的增强,这三家都重写了各自的指南。框架需要跟上节奏,否则就会背负模型已经过时的提示词。 Anthropic 刚刚发布了一份针对现代模型上下文工程的最新指南 (https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models),同时报告称,对于 Opus 5 和 Fable 5 等模型,他们削减了 Claude Code 系统提示中超过 80% 的内容,而编码评估结果没有明显下降。他们的部分发现与我们构建 v0.7 时的经验相吻合: - **接口胜于示例:** 良好的工具模式比曾经流行的少量示例能更好地教会模型使用方法,而后者可能会限制模型探索的方式。 - **避免重复:** 在系统提示和工具描述中重复同一条指令,并不能提供有意义的强化。 Deep Agents v0.7 提供了一个更精简、更可配置的基础框架,在 token 和成本方面效率更高。 ## 更精简的基础框架 我们的假设是:从基础输入提示中修剪不必要的 token,可以在保持性能稳定的同时提升 token 和成本效率。我们做了三项更改来验证这一点: - **移除了基础系统提示:** 我们剪掉了 Deep Agents 在底层使用的系统提示,其中包括通用指南和工具使用的说明文本 (#4859 (https://github.com/langchain-ai/deepagents/pull/4859))。 - **精简了工具描述:** 我们将内置工具描述精简了 43% (#5009 (https://github.com/langchain-ai/deepagents/pull/5009))。 - **待办事项改为可选加入:** `create_deep_agent` 默认不再包含 `TodoListMiddleware`。我们的评估显示,规划提示和 `write_todos` 工具并没有显著提升性能 (#4929 (https://github.com/langchain-ai/deepagents/pull/4929))。 这些更改共同使得默认智能体单次交互的*基础输入 token* 减少了 65%(约 6k → 约 2k)。 *基础输入 token:*与内置提示词、工具和中间件相关的 token。 ### 我们如何验证这些更改 我们使用一套新的评估套件 (https://www.langchain.com/blog/how-we-benchmark-deep-agents) 验证了性能没有下降,该套件围绕三类基准测试构建。每类针对不同的智能体工作: - **自主型:** 端到端任务,如编码和数据分析 - **对话型:** 与模拟用户的多轮对话 - **长上下文:** 需要检索和长上下文推理的任务 我们使用新 v0.7 框架与旧基线(v0.6.12)进行了对比,在三类评估和四个模型(`gpt-5.6-luna`、`gemini-3.6-flash`、`claude-sonnet-4-6` 和 `claude-opus-4-8`)上运行了完整的矩阵测试。 总体奖励保持稳定,token 和成本普遍下降*。最显著的是 `gpt-5.6-luna`,token 减少 34%,成本降低 15%,奖励提升 4%。`claude-sonnet-4-6` 是个例外;分析 LangSmith 轨迹显示,成本显著增加主要来自两个具有挑战性的自主任务。 *所有模型的奖励置信区间均包含零。Luna 和 Opus 显示 token 减少在统计上显著,Luna 的成本降低也在统计上显著。完整报告可在此处 (https://github.com/langchain-ai/deepagents/pull/5009) 查看。 更多信息,请参见我们最近的博客:如何为 Deep Agents 运行评估 (https://www.langchain.com/blog/how-we-benchmark-deep-agents)。 ### 关于待办事项列表的说明 `TodoListMiddleware` 现在改为可选加入。我们在三类评估和三个模型上的测试显示,禁用待办事项后奖励略好,成本更低,因此我们从基础框架中移除了 `write_todos` 工具。更改和完整实验结果可在此处 (https://github.com/langchain-ai/deepagents/pull/4929) 查看。 尽管如此,它在某些情况下仍然有用: 1. **长时间、多步骤的任务**,其中智能体受益于明确的计划以在多轮交互中保持进度。 2. **能力较弱的模型**,需要更多脚手架来避免遗漏步骤或丢失主线。 3. **面向 UI 的用例**,其中可见的计划和进度与底层执行同等重要。 如果你的用例属于上述三种情况之一,可以一行代码重新启用 (https://docs.langchain.com/oss/python/deepagents/overview#task-planning):`middleware=[TodoListMiddleware()]`。 ## 更强的可配置性 可配置性是过去六个月 Deep Agents 用户提出的最高需求 (https://github.com/langchain-ai/deepagents/issues/3783),包括覆盖 `FilesystemMiddleware`、自定义 `SummarizationMiddleware` 阈值以及全局覆盖基础提示词。它们都遇到了同一个障碍:没有支持的方式更改默认框架栈的行为。v0.7 通过两种方式解决了这个问题。 **完全控制你的提示词。** 移除隐藏提示词有一个副作用:你自己的自定义提示词会更有效,因为底层不再有提示词导致膨胀甚至冲突。 **完全控制中间件栈。** v0.7 将覆盖内置中间件 (https://app.notion.com/p/TodoListMiddleware-Analysis-39f808527b1781ce96e8e1755f0889ba?pvs=21) 提升为一等公民:传递一个其 `.name` 匹配默认中间件的 `middleware=` 实例,它将替换该默认中间件,而不会因重复而报错。 (#4251 (https://github.com/langchain-ai/deepagents/pull/4251)) 正如一位重度用户所说: “我们过去要搞一些 hacky 的东西来移除一些默认中间件。能够覆盖中间件是一个非常受欢迎的改进。” `SummarizationMiddleware` 是一个很好的例子。默认情况下,它在对话超过上下文窗口的 85% 时触发,使用通用的摘要提示。不同的应用需要不同的提示,开发者也希望在不同的阈值触发摘要,以提前应对上下文退化和“愚蠢区” (https://random.qmx.me/posts/2026/01/14/escaping-the-dumb-zone-with-rlms/)。现在你可以插入一个带有自己设置的摘要中间件: ```python from deepagents import create_deep_agent from deepagents.middleware import SummarizationMiddleware agent = create_deep_agent( model="anthropic:claude-sonnet-5", middleware=[ SummarizationMiddleware( model="fireworks:accounts/fireworks/models/kimi-k3", # 在上下文窗口的 50% 处触发,而不是默认的 85% trigger=("fraction", 0.5), summary_prompt="总结到目前为止的对话,逐字保留所有文件路径和决策...", ), ], ) ``` 同样的模式也适用于任何其他你想重新调整的内置默认值,比如提示缓存 TTL。 ## 文件系统性能 文件系统是 Deep Agents 的核心上下文管理层:智能体通过它读取、写入和导航状态。此版本基于相同的评估套件以及从实际 `dcode` 使用中识别出的轨迹优化(适用于开放和封闭模型)进行了一些优化。 `write_file` 现在会覆盖已存在的文件而不是报错 (#4109 (https://github.com/langchain-ai/deepagents/pull/4109)),分页的 `read_file` 报告总行数和剩余行数以及下一个 `offset` (#4540 (https://github.com/langchain-ai/deepagents/pull/4540)),`grep`/`glob` 返回带 `truncated` 标志的部分结果而不是在大目录树上挂起,`grep` 还获得了 1000 个匹配的上限、流式输出和可选上下文行 (#4063 (https://github.com/langchain-ai/deepagents/pull/4063)、#4570 (https://github.com/langchain-ai/deepagents/pull/4570)、#4706 (https://github.com/langchain-ai/deepagents/pull/4706))。 ## 破坏性更改 此版本移除了某些兼容性垫片并更改了一些默认行为: 1. `TodoListMiddleware` 默认不再启用 (#4929 (https://github.com/langchain-ai/deepagents/pull/4929)),但可以通过 `TodoListMiddleware()` 选择加入。 2. 对后端工厂的支持(在 v0.5 中已弃用)已被移除,改为使用具体的 `BackendProtocol` 实例 (#4541 (https://github.com/langchain-ai/deepagents/pull/4541))。v0.5 中的其他文件格式/后端协议弃用项也被移除。 3. `delete` 工具已添加到默认文件系统工具列表中。`FilesystemMiddleware` 接受一个工具允许列表 (https://docs.langchain.com/oss/python/deepagents/overview#virtual-filesystem-access),因此如果需要可以选择禁用 (#4325 (https://github.com/langchain-ai/deepagents/pull/4325)、#4698 (https://github.com/langchain-ai/deepagents/pull/4698))。 完整详情,包括迁移说明和针对编码智能体的“升级”提示,都在变更日志 (https://docs.langchain.com/oss/python/releases/changelog#jul-24-2026) 中。 ## 试试看 `deepagents` v0.7 现已发布到 PyPI: ``` uv pip install -U deepagents ``` 以及 `npm`: ``` npm install deepagents@latest ``` 试试最新的 `deepagents`,并通过 GitHub Issues (https://github.com/langchain-ai/deepagents/issues)、论坛 (https://forum.langchain.com/) 或 X / LinkedIn 告诉我们你的想法。 ## 参考资料 - 发布说明:`deepagents` v0.7.0 (https://docs.langchain.com/oss/python/releases/changelog#jul-24-2026) - 文档:自定义和覆盖内置中间件 (https://docs.langchain.com/oss/python/deepagents/customization) - 文档:文件系统工具和虚拟文件系统访问 (https://docs.langchain.com/oss/python/deepagents/overview#virtual-filesystem-access) - 文档:可选加入的待办事项 (https://docs.langchain.com/oss/python/deepagents/overview#task-planning) - 评估套件博客:我们如何对 Deep Agents 进行基准测试 (https://www.langchain.com/blog/how-we-benchmark-deep-agents)

相似文章

@sydneyrunkle: https://x.com/sydneyrunkle/status/2056419909941522687

X AI KOLs Following

Deep Agents v0.6 引入了代码解释器、用于按模型调优的测试配置文件、流式支持、用于检查点存储的 DeltaChannel 以及用于版本化代理记忆的 ContextHubBackend,实现了模型无关的编程式工具调用和递归工作流。

@LangChain: 关于Managed Deep Agents您需要了解的一切:

X AI KOLs Timeline

LangChain 宣布 Managed Deep Agents 进入私有测试版,这是一个托管的 API 优先运行时,用于构建、运行和生产中操作深度代理,利用开源 Deep Agents 工具集,并与 LangSmith 集成,实现持久执行、流式处理和人机协作工作流。