@LangChain:你所有的代理都需要前沿模型吗?我们通过Deep Agents评估运行了NVIDIA的开源路由器Switchyard…
摘要
LangChain使用Deep Agents测试了NVIDIA的开源路由器Switchyard,结果表明在模型之间进行路由可以将成本降低约70%,同时保持约90%的准确率,并推出了针对NVIDIA模型的新中间件集成。
查看缓存全文
缓存时间: 2026/08/12 08:35
你们所有的 agent 都需要一个前沿模型吗?
我们运行了 NVIDIA 的开源路由器 Switchyard,并通过我们的 Deep Agents 评估套件进行了测试,该套件包含 145 个多步骤任务——工具使用、检索、文件系统操作、长上下文。
结果:93% 的轮次由 30B 模型处理。只有 7% 需要 Claude Opus 4.8。
在两者之间进行路由,总成本降低了约 70%,同时在相同调用上保留了 Opus 约 90% 的准确率。
立即试用 Deep Agents 与 NVIDIA Switchyard 的集成:https://buff.ly/1HtHoJ2
NVIDIA 中间件集成 - LangChain 文档
来源:https://docs.langchain.com/oss/python/integrations/middleware/nvidia 适用于 NVIDIA 服务和模型的中间件集成及模型特定的 harness 配置。使用它们可以在 LangChain 聊天模型之间路由调用,或针对 NVIDIA Nemotron 3 Ultra 优化 Deep Agents 的行为。了解更多关于中间件的信息。
概述
针对 Nemotron 3 Ultra 优化 Deep Agents
Deep Agents 包含一个针对 NVIDIA Nemotron 3 Ultra 的内置 harness 配置。该配置添加了模型特定的提示词指导、工具描述,以及用于工具调用、文件系统操作、重试、上下文管理和最终答案的中间件。它通过评估驱动的 harness 调优开发而来。
该配置更改了哪些内容
- 修复常见的文件系统工具参数,并规范化空的工具结果。
- 当
read_file返回整页结果时,添加继续操作的指导。 - 对选定的文件系统故障和模型速率限制进行重试。
- 规范化 ChatNVIDIA 消息、推理标签和文本格式的工具调用。
- 添加上下文进度、后续跟进、实体解析和最终答案的保障措施。
设置
安装 Deep Agents 和 NVIDIA 聊天模型集成:
按 ChatNVIDIA 设置指南中的说明配置 NVIDIA_API_KEY。
使用内置配置
创建一个使用 Nemotron 3 Ultra 模型的 deep agent。Deep Agents 会识别该模型并自动应用配置,因此您无需实例化或传递其中间件:
创建一个带配置的 deep agent
该配置是为通过 NVIDIA、Baseten、Fireworks、OpenRouter、Nebius 和 Together 提供的 Nemotron 3 Ultra 模型标识符注册的。注册是模型特定的,因此这些提供方提供的其他模型保持不变。
API 参考
使用 NeMo Switchyard 进行模型路由
实验性的 SwitchyardRoutingMiddleware 通过配置好的 NeMo Switchyard libsy 算法路由每次 deep agent 模型调用。您可以使用它组合具有不同成本和性能特征的 LangChain 聊天模型,同时 Deep Agents 继续管理 agent 循环、工具、状态和中间件组合。
功能
- 使用
LangChainLlmClient将任何BaseChatModel适配为 Switchyard 目标。 - 使用已安装的
nemo-switchyardPython 绑定公开的任何算法。 - 保留 Deep Agents 的工具绑定、回调、LangChain 追踪和结构化输出。
- 在每个返回的
AIMessage上检查选定的模型和完整路由追踪。 - 通过相同的算法路由同步和异步 agent 调用。
设置
该集成需要 Python 3.12 或更高版本、NeMo Switchyard 的源代码签出,以及 langchain-nvidia 仓库的签出。为路由器可以选择的每个聊天模型配置凭据。中间件本身不需要提供方 API 密钥。
安装
从源代码构建 Switchyard 的 libsy Python 绑定,然后安装该集成及其 Deep Agents 和 OpenRouter 依赖项:
OpenRouter 示例需要 OPENROUTER_API_KEY。在运行之前,请确认您的账户可以访问两个配置的模型。
实例化
创建两个 LangChain 聊天模型,将它们适配为 Switchyard 目标,并构建路由中间件。传递给 stage_router 的目标顺序很重要:先传递功能强大的目标,再传递高效的目标。
阶段路由是信号驱动的。它可以将普通轮次路由到高效目标,并将带有严重工具失败信号的轮次升级到功能强大的目标,而无需进行单独的评判模型调用。
与 deep agent 一起使用
将中间件传递给 create_deep_agent。Deep Agents 需要一个基础模型,但中间件会替换每次路由调用中的模型。重复使用一个已配置的目标,以避免构造未使用的模型。
异步 ainvoke 路径是标准的。在普通的同步应用中使用 agent.invoke(...),但在笔记本、异步 Web 处理器和异步测试中使用 await agent.ainvoke(...)。
选择路由算法
SwitchyardRoutingMiddleware 接受一个不透明的 switchyard.libsy.Algorithm,因此中间件不依赖具体的路由策略。您可以从已安装绑定公开的算法中选择:
- 阶段路由:根据消息历史信号(包括助手工具调用和工具结果)进行路由,默认无需评判模型。
- LLM 任务分类器:在选择高效或功能强大的目标之前调用评判模型。
- 随机路由:在加权目标之间进行选择,可选种子用于可复现的进程本地选择序列。
- 无操作:在不调用提供方的情况下检查中间件边界。
检查路由决策
每个路由后的 AIMessage 都在 response_metadata["switchyard"] 中包含完整的决策追踪记录:
某些算法会做出多个决策。使用 decisions 获取完整追踪;selected_model 仅包含最终选择。
API 参考
另请参阅
相似文章
NVIDIA Nemotron 借助 LangChain Deep Agents 框架实现基准测试领先性能
NVIDIA Nemotron 3 Ultra 借助 LangChain Deep Agents 框架实现了基准测试领先性能,无需重新训练即可比闭源模型更低的成本获得更高准确度。
Nvidia的Switchyard路由器在任务中途重新编排AI模型,自测任务成本降至三分之一(8分钟阅读)
Nvidia发布了Nemotron 3.5 Lightning,这是一个300亿参数的开源混合专家模型,以及NeMo Switchyard,一个开源路由库,可动态地将AI智能体工作流的每一步分配给最合适的模型。Nvidia声称,这种组合可以将智能体任务成本降低至约三分之一,同时保持前沿水平的性能。
@LangChain: Deep Agents 现在支持动态子代理。主代理不再通过工具调用来调用子代理,而是编写协调…
LangChain 的 Deep Agents 现在支持动态子代理,主代理通过编写协调代码来大规模协调工作,实现处理数百份文档等具有确定性覆盖的工作流程。
@LangChain:在提升您的代理之路上
LangChain 宣布了一项用于改进 AI 代理的资源。
@LangChain: 关于Managed Deep Agents您需要了解的一切:
LangChain 宣布 Managed Deep Agents 进入私有测试版,这是一个托管的 API 优先运行时,用于构建、运行和生产中操作深度代理,利用开源 Deep Agents 工具集,并与 LangSmith 集成,实现持久执行、流式处理和人机协作工作流。