@LangChain: .@SchneiderElec 在全球100多个国家运行60多个生产级AI代理,全部通过自托管的LangSmith进行追踪。他们的…
摘要
施耐德电气使用 LangChain 的 LangSmith 在100多个国家运行超过60个生产级AI代理,通过其AI助手为16万名员工提供服务,展示了企业级LLMOps能力。
查看缓存全文
缓存时间: 2026/07/07 20:22
.@SchneiderElec 在全球100多个国家/地区运行着60多个AI Agent,所有操作都通过自托管的LangSmith进行追踪。
仅其AI助手就服务于16万名员工。
他们如何构建LLMOps基础,以便在如此规模下信任这些Agent。 https://t.co/gIXU4aSVaO
施耐德电气如何利用LangSmith构建LLMOps基础
来源:https://www.langchain.com/blog/how-schneider-electric-built-their-llmops-foundations-at-enterprise-scale-with-langsmith 施耐德电气(https://www.se.com/)是一家全球能源技术领导者,通过为工业、商业和住宅电气化、自动化和数字化,推动可持续发展。公司拥有16万名员工,年收入约400亿欧元,并运营着一个雄心勃勃的AI计划:一个由350名专家组成的内部AI中心,已部署60多个Agent,用于优化能源消耗、延长资产生命周期以及提升开发者生产力。
为关键基础设施大规模交付AI
施耐德的广泛AI计划涵盖三大类别:
- 将智能直接嵌入产品以降低能耗(例如房间控制器中的热学习功能)。
- 利用AI预测需求和产量,使客户能够将电力使用转移到更便宜、更环保的时段。
- 部署有助于减少运营摩擦的Agent化Copilot,例如管理更复杂的电网、客户成功,或查询碳排放软件系统。
Agent被嵌入到这些目标中,运行在具有严格数据驻留要求和网络安全控制的关键基础设施中。施耐德需要一个通用的Agent平台,帮助团队快速构建,同时保留对数据、部署和质量的控制。
“准确性、答案质量以及护栏的挑战非常真实。当你大规模部署解决方案时,需要像LangSmith这样的工具。所有与可信度和理解内部运作相关的东西,对我们来说都极为宝贵。” – Philippe Rambach,施耐德电气首席人工智能官
施耐德的AI平台团队属于其AI中心,提供共享基础设施,使AI团队能够在其庞大的技术版图(多云环境,从云端到边缘,以及所有类型的AI)中可靠地交付。
以下客座博客分享了他们如何围绕LangSmith及更广泛的LangChain生态系统构建LLMOps能力的故事,旨在:
- 部署并持续改进服务于100多个国家/地区14万名员工的AI助手的准确性和质量。
- 共同构建LLMOps成熟度框架,以部署其客户成功经理Copilot。
- 利用LangSmith Deployment的任务队列模型加速报价工作流。
*作者: * Yoann Bersihand,AI平台副总裁 Nicolas Gauthier,Agentic AI工程产品负责人 Amaury Gelin,Agentic AI工程AI工程师
挑战:将传统MLOps应用到LLM系统
要自信地大规模运营,专门的LLMOps学科至关重要。没有它,我们的团队就会盲目操作。我们传统的MLOps方法无法直接应用于基于LLM的系统,可能导致:
- 除了原始应用日志之外,调试Agent行为的能力有限。
- 缺乏对提示或模型更改的精确衡量。
- 难以验证生成式AI和Agent系统是否准备好投入生产。
架构:三大支柱
我们围绕三大支柱组织AI平台的LLMOps能力,这些支柱反映了Agent产品的生命周期:1)可观测性,2)评估,3)部署。
1. 可观测性:自托管LangSmith,每个产品一个工作区
可观测性能让你达到“我们可以看到正在发生什么”。
我们在AWS EKS上以自托管配置部署LangSmith,并将其集成到公司安全边界内。这种方法确保了严格的数据隐私,并符合我们关于第三方数据外发的内部政策。
在可观测性方面,关键的设计决策是我们如何构建工作区实例化模型:每个AI产品一个工作区,涵盖所有环境(开发、QA、预发布、生产)。另一种方法——每个环境一个工作区——会打破我们希望实现的目标循环:将生产追踪提升回开发数据集进行离线评估。
通过将开发和产品置于同一工作区,我们的主题专家可以标注生产追踪并直接推送到数据集。然后可以针对新版本的Agent重放这些示例,以验证改进效果。
在实践中,这意味着数据集、注释和实验与它们来源的生产追踪保持紧密联系——从而更容易从实际使用中学习并持续改进系统性能。
生产示例:“One Jo”
我们的内部AI助手One Jo服务于16万名施耐德电气员工,部署在107个国家/地区。每次对话都通过LangSmith进行追踪,同时保持严格的数据隐私标准。团队系统性地重用生产追踪来构建回归数据集,使他们能够针对实际使用情况验证每个新的模型或提示迭代。这些相同的追踪还能即时洞察漂移情况,使团队能够快速检测并处理随时间推移的性能变化。
图1 - 生产示例:“One Jo”注释队列
2. 评估:离线、在线和成熟度框架
可观测性让我们达到“我们可以看到正在发生什么”。而评估则让我们达到“我们可以决定是否发布”。我们在这方面投入了大量精力,主要针对三个方面。
首先,离线评估加速器。 我们在Azure和AWS上发布了Agentic RAG GitHub模板,以及一个基于LangSmith SDK构建的轻量级评估CLI。
目标:标准化每个AI团队运行实验的方式——相同的数据集约定,相同的评估器接口(基于openevals模式构建)。
结果:新团队能够快速从初始设置过渡到有意义的离线评估套件。
其次,LLMOps成熟度框架。 拥有60多个AI产品,推广追踪和评估需要努力。我们制定了一个内部LLMOps成熟度模型来跟踪关键能力:这个产品是否已接入?它是否有离线评估套件?生产中是否运行了在线评估器?用户反馈是否被回流并重用?
通过这种方式,我们基于LangSmith API构建了自动报告功能。一个预定的GitHub工作流会生成所有AI产品在LangSmith能力方面的综合视图,并提供对采用情况和进展的持续可见性。
LLMOps成熟度级别已集成到我们的AI产品生命周期中,并用于将用例从“探索 → 孵化 → 工业化 → 运营”的关卡审查中。
第三,主题专家参与。 即使有了正确的工具,评估中最困难的部分仍然是将领域专业知识引入循环中。我们将内部的SME角色映射到自定义的LangSmith角色,该角色授予注释队列和数据集的访问权限,但不暴露开发者级别的表面。如今,大约20%的AI产品至少拥有一个活跃的、有SME参与的注释队列。这使得领域专家能够直接审查和注释真实示例,为评估做出贡献,而无需工程技能。
LLMOps循环:
图2 简单的LLMOPs循环
生产示例:客户成功管理Copilot
施耐德电气的服务业务部门通过AI驱动的状态维护、24/7远程监控和专家支持,为数据中心和建筑提供主动的资产性能管理。
CSM Copilot是支持状态维护的多个Agent化AI解决方案之一。它赋能250多名客户成功经理为任何账户或合同生成更快的洞察。
CSM Copilot从第一天起就由SME利用LangSmith设计。这让SME有机会直接影响共同构建产品的质量——从持续审查输出、提供注释,到在开发期间塑造系统行为。结果,该产品在首次部署时就达到了高质量水平和CSM的高采用率。
图3 - 生产示例:客户成功经理聊天机器人
3. 部署:LangSmith Deployment,每个产品一个运行时
对于需要流式传输、长期记忆、人机交互或后台处理的Agent,我们采用了LangSmith Deployment参考架构:包含Postgres和Redis的Agent Server,部署在我们的AWS和Azure落地区域内。
从一开始,我们就选择不运行集中式Agent运行时。相反,每个AI产品都运行在自己专用的堆栈上。
这个决定基于两个关键原则:
- “你构建它,你运行它。” 我们的AI平台理念是为AI团队提供强大的基础和铺平的道路,而不是交钥匙的运行时。通过拥有自己的运行时,AI团队保留了延迟、成本和事件响应的完全控制权。
- 没有单点故障。 集中式Agent运行时将引入系统性风险。一个有问题的部署或资源问题可能同时影响所有Agent。通过按产品分配运行时,任何问题都局限于单个用例,从而保持整体平台的弹性。
然而,这种方法也带来了一些权衡——需要管理更多的基础设施,需要协调更多的升级——这也是我们下一步投资的方向(参见下文下一步计划)。
图4 - LangSmith Agent Server基础设施(按用例和自托管)
每个产品都从相同的langgraph.json模板开始,该模板设计为跨AWS和Azure的云无关。以下版本包含大型企业环境的典型要求:一个已列入白名单的基础镜像、与公司CA证书包的集成,以及一个暴露在Agent图之外的自定义反馈HTTP路由。
图5 – 默认LangSmith Agent配置
生产示例:数字能源 - 规格文档智能
在我们的数字能源部门,我们正在改变商业、工业和公共基础设施的楼宇运营。作为这项工作的一部分,我们开发了一个文档处理Agent,它可以分析客户报价请求(包括规格、建筑图纸和其他PDF文档),并自动添加上下文注释。报价工作流现在只需几分钟,而以前需要几小时甚至几天。
Agent的平均完成时间仅超过15分钟。这种长时间运行的后台处理正是LangSmith Deployment的任务队列模型所设计的,能够在不影响实时系统性能的情况下实现可靠执行。
成果
通过与LangChain的合作,我们持续推进能源技术:
- 基于LangChain生态系统,拥有60多个正在积极开发或已投入生产的AI产品,
- 约200名活跃的LangSmith用户,横跨工程和SME社区,将我们在能源管理和工业自动化领域的领域知识和专业知识置于AI产品的核心。
大规模构建LLMOps给我们的启示
我们最初在LLMOps上的投入得到了回报。 如果没有追踪级别的可观测性和真正的离线评估规范,我们的任何Agent产品都无法达到生产就绪状态。那些早期抵制接入的团队,后来都在苦苦调试非确定性回归问题。
在构建自定义功能之前,先充分利用开箱即用的功能。 构建复杂的内部框架(尤其是评估框架)很诱人。事后看来,一个关键教训是,最好在构建自定义功能之前充分利用开箱即用的功能:一个基于LangSmith SDK的薄CLI层、一个映射到现有权限模型的自定义角色、以及基于公共API的定期报告。
自托管效果很好,但可能会增加成本。 LangSmith在自托管模式下非常稳健。但代价是需要投入基础设施和运维工作,例如Helm Chart升级、EKS生命周期管理、版本固定,以及偶尔的“这个在SaaS文档中有效,但我们的网络策略不同意”之类的调试会话。如果你的环境允许SaaS,就选择SaaS吧。
采用取决于组织,而非技术。 虽然技术可以快速集成,但真正的差异化在于,在快速变化的AI领域,让多个团队在共享实践、标准和工作流上保持一致。
LangChain生态系统在集成和灵活性之间提供了良好的平衡。 这个产品组合内部是一致的(开源库、用于可观测性和评估的LangSmith、LangSmith Deployment与LangSmith Studio),但开源库可以独立使用,并且LangSmith能够干净地集成第三方框架。这为我们提供了混合搭配的空间,而不会将自己逼入死角。
施耐德电气与LangChain:下一步计划?
平台的原生AI工程
我们正在试点Agent技能和编码Agent,以简化LangSmith上的LLMOps采用。与此同时,鉴于我们的“每个产品一个运行时”策略(详见第3节:部署),我们正在投资Agent技能,以促进和自动化我们在LangSmith Deployment运行时上Agent产品的维护。
边缘AI和混合Agent系统
我们越来越多的AI产品在边缘运行(例如,在工业环境中的硬件设备或网关上)。目前,LangSmith支持这些系统的云端生命周期,包括离线评估和数据集管理,而运行时执行和在线评估则在LangSmith之外本地处理,这是由于连接限制。我们正与LangChain团队一起,积极扩展生态系统以支持边缘AI和物理AI场景。这对我们来说是最新的前沿。
“利用现有技术,我们就能节省20%到25%的能源。但我们希望为客户带来与能源系统交互的新层次。真正帮助他们更好地理解、更好地交互、模拟不同的场景,并基于这些智能采取行动,希望在能源消耗和碳排放方面朝着全球层面做出改变。” – Philippe Rambach,施耐德电气首席人工智能官
相似文章
@LangChain: "LangSmith 让我们能够监控所有代理,了解哪些有效,哪些无效,哪些工具调用失败…"
丰田的企业AI团队使用LangSmith和Deep Agents来扩展AI代理开发,将生产时间从6个月缩短至4天,并部署了超过50个代理。
@LangChain:了解如何 @SchneiderElec、@Vodafone 和 @mondaydotcom 通过更强大的系统来应对生产级 AI,用于可观测性……
LangChain 分享了一份指南,介绍 Schneider Electric、Vodafone 和 monday.com 如何通过改进的可观测性、评估和治理来在生产中扩展 AI 代理。
@LangChain 的推文: https://x.com/LangChain/status/2091932626961527086
LangChain 的托管服务允许通过一条命令将 AI 代理部署到 Slack,自动化应用配置,无需手动设置。
@LangChain: 最佳组织已经找到了如何重复、安全、系统地部署代理的方法。他们已经建立了一个持续的…
LangChain提供免费的LangSmith Essentials课程,教授代理开发生命周期,使团队能够系统地构建、测试、部署和监控AI代理。
@LangChain: 推出 LangSmith LLM Gateway:为你的智能体打造的运行时治理层。强制执行成本限制、检测 PII、违规处理……
LangChain 宣布推出 LangSmith LLM Gateway,这是一个面向 AI 智能体的运行时治理层,可强制执行成本限制、检测 PII,并直接在 LangSmith 内实施策略监控,现处于内测阶段。