@LangChain:你所有的代理都需要前沿模型吗?我们通过Deep Agents评估运行了NVIDIA的开源路由器Switchyard…

X AI KOLs Timeline 工具

摘要

LangChain使用Deep Agents测试了NVIDIA的开源路由器Switchyard,结果表明在模型之间进行路由可以将成本降低约70%,同时保持约90%的准确率,并推出了针对NVIDIA模型的新中间件集成。

你所有的代理都需要前沿模型吗? 我们通过Deep Agents评估套件运行了NVIDIA的开源路由器Switchyard,该套件包含145个多步骤任务——工具使用、检索、文件系统操作、长上下文。 结果:93%的轮次由30B模型处理,只有7%需要Claude Opus 4.8。 在两者之间进行路由将总成本降低了约70%,同时在相同调用上保留了Opus约90%的准确率。 立即尝试deepagents与NVIDIA Switchyard的集成:https://buff.ly/1HtHoJ2
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:35

你们所有的 agent 都需要一个前沿模型吗?

我们运行了 NVIDIA 的开源路由器 Switchyard,并通过我们的 Deep Agents 评估套件进行了测试,该套件包含 145 个多步骤任务——工具使用、检索、文件系统操作、长上下文。

结果:93% 的轮次由 30B 模型处理。只有 7% 需要 Claude Opus 4.8。

在两者之间进行路由,总成本降低了约 70%,同时在相同调用上保留了 Opus 约 90% 的准确率。

立即试用 Deep Agents 与 NVIDIA Switchyard 的集成:https://buff.ly/1HtHoJ2


NVIDIA 中间件集成 - LangChain 文档

来源:https://docs.langchain.com/oss/python/integrations/middleware/nvidia 适用于 NVIDIA 服务和模型的中间件集成及模型特定的 harness 配置。使用它们可以在 LangChain 聊天模型之间路由调用,或针对 NVIDIA Nemotron 3 Ultra 优化 Deep Agents 的行为。了解更多关于中间件的信息。

概述

针对 Nemotron 3 Ultra 优化 Deep Agents

Deep Agents 包含一个针对 NVIDIA Nemotron 3 Ultra 的内置 harness 配置。该配置添加了模型特定的提示词指导、工具描述,以及用于工具调用、文件系统操作、重试、上下文管理和最终答案的中间件。它通过评估驱动的 harness 调优开发而来。

该配置更改了哪些内容

  • 修复常见的文件系统工具参数,并规范化空的工具结果。
  • read_file 返回整页结果时,添加继续操作的指导。
  • 对选定的文件系统故障和模型速率限制进行重试。
  • 规范化 ChatNVIDIA 消息、推理标签和文本格式的工具调用。
  • 添加上下文进度、后续跟进、实体解析和最终答案的保障措施。

设置

安装 Deep Agents 和 NVIDIA 聊天模型集成:

ChatNVIDIA 设置指南中的说明配置 NVIDIA_API_KEY

使用内置配置

创建一个使用 Nemotron 3 Ultra 模型的 deep agent。Deep Agents 会识别该模型并自动应用配置,因此您无需实例化或传递其中间件:

创建一个带配置的 deep agent

该配置是为通过 NVIDIA、Baseten、Fireworks、OpenRouter、Nebius 和 Together 提供的 Nemotron 3 Ultra 模型标识符注册的。注册是模型特定的,因此这些提供方提供的其他模型保持不变。

API 参考

使用 NeMo Switchyard 进行模型路由

实验性的 SwitchyardRoutingMiddleware 通过配置好的 NeMo Switchyard libsy 算法路由每次 deep agent 模型调用。您可以使用它组合具有不同成本和性能特征的 LangChain 聊天模型,同时 Deep Agents 继续管理 agent 循环、工具、状态和中间件组合。

功能

  • 使用 LangChainLlmClient 将任何 BaseChatModel 适配为 Switchyard 目标。
  • 使用已安装的 nemo-switchyard Python 绑定公开的任何算法。
  • 保留 Deep Agents 的工具绑定、回调、LangChain 追踪和结构化输出。
  • 在每个返回的 AIMessage 上检查选定的模型和完整路由追踪。
  • 通过相同的算法路由同步和异步 agent 调用。

设置

该集成需要 Python 3.12 或更高版本、NeMo Switchyard 的源代码签出,以及 langchain-nvidia 仓库的签出。为路由器可以选择的每个聊天模型配置凭据。中间件本身不需要提供方 API 密钥。

安装

从源代码构建 Switchyard 的 libsy Python 绑定,然后安装该集成及其 Deep Agents 和 OpenRouter 依赖项:

OpenRouter 示例需要 OPENROUTER_API_KEY。在运行之前,请确认您的账户可以访问两个配置的模型。

实例化

创建两个 LangChain 聊天模型,将它们适配为 Switchyard 目标,并构建路由中间件。传递给 stage_router 的目标顺序很重要:先传递功能强大的目标,再传递高效的目标。

阶段路由是信号驱动的。它可以将普通轮次路由到高效目标,并将带有严重工具失败信号的轮次升级到功能强大的目标,而无需进行单独的评判模型调用。

与 deep agent 一起使用

将中间件传递给 create_deep_agent。Deep Agents 需要一个基础模型,但中间件会替换每次路由调用中的模型。重复使用一个已配置的目标,以避免构造未使用的模型。

异步 ainvoke 路径是标准的。在普通的同步应用中使用 agent.invoke(...),但在笔记本、异步 Web 处理器和异步测试中使用 await agent.ainvoke(...)

选择路由算法

SwitchyardRoutingMiddleware 接受一个不透明的 switchyard.libsy.Algorithm,因此中间件不依赖具体的路由策略。您可以从已安装绑定公开的算法中选择:

  • 阶段路由:根据消息历史信号(包括助手工具调用和工具结果)进行路由,默认无需评判模型。
  • LLM 任务分类器:在选择高效或功能强大的目标之前调用评判模型。
  • 随机路由:在加权目标之间进行选择,可选种子用于可复现的进程本地选择序列。
  • 无操作:在不调用提供方的情况下检查中间件边界。

检查路由决策

每个路由后的 AIMessage 都在 response_metadata["switchyard"] 中包含完整的决策追踪记录:

某些算法会做出多个决策。使用 decisions 获取完整追踪;selected_model 仅包含最终选择。

API 参考

另请参阅

相似文章

@LangChain: 关于Managed Deep Agents您需要了解的一切:

X AI KOLs Timeline

LangChain 宣布 Managed Deep Agents 进入私有测试版,这是一个托管的 API 优先运行时,用于构建、运行和生产中操作深度代理,利用开源 Deep Agents 工具集,并与 LangSmith 集成,实现持久执行、流式处理和人机协作工作流。