@LangChain: 管理AI代理需要团队从整个系统角度思考,包括认证、审计日志、速率限制、回退…
摘要
LangChain 发布了一份概念指南,阐述了构建可控AI代理的框架,涵盖了认证、审计日志、速率限制、回退和集中化支出控制等系统级治理要素,并介绍了LLM网关作为运行时控制平面的作用。
查看缓存全文
缓存时间: 2026/07/21 01:35
治理智能代理需要团队从整个系统角度思考,涵盖认证、审计日志、速率限制、回退机制和集中式支出控制。
我们最新的概念指南解析了团队所需的基础。
https://t.co/MZdo20flwQ
构建可治理的智能代理:成本、控制与合规框架
来源:https://www.langchain.com/blog/building-governed-agents-a-framework-for-cost-control-and-compliance 网关是企业AI的运行时控制平面,将策略转化为每次模型调用、工具调用和代理跳转中的可执行决策。
为何治理至关重要
智能代理正成为生产基础设施的一部分。它们回答客户问题、编写和部署代码、检索公司知识,并在业务系统中采取行动。随着其自主性增强,核心治理问题在于:如何在不减缓采用速度的前提下,对跨模型、数据、工具和提供商的每一次交互执行策略。
三个关键驱动因素使得这一问题愈发重要。首先,智能代理工作负载消耗更多令牌,使AI支出更难预测。其次,关键业务型智能代理引入了原型阶段所没有的可用性和连续性要求。第三,隐私、安全及AI特定法规要求组织不仅证明策略存在,还要证明这些策略被一致应用。
监管机构也在应对智能代理AI的快速增长。各国政府正在制定AI使用规则。例如,欧盟AI法案(https://www.langchain.com/blog/langsmith-langchain-oss-eu-ai-act)规定了AI系统的开发和部署方式,将应用和用例划分为不同的风险类别。对于企业而言,这些法规既构成合规义务,也带来重大业务风险,违规将面临严厉处罚。
与此同时,模型市场正变得更加多元化。前沿模型提供商继续以更高价格推出能力更强的模型,而开源模型正在缩小质量差距——尤其是与调优后的智能代理框架(https://www.langchain.com/blog/langchain-and-nvidia-launch-the-nemoclaw-deep-agents-blueprint)配合使用时——且运行成本仅为前者的一小部分。因此,企业需要管理一个模型组合,决定哪些模型允许使用、它们能处理哪些任务,以及如何平衡质量、成本、延迟和风险。
**LLM网关是这些决策的运行时控制平面。**它为企业提供了一个统一场所,用于:
- 认证使用
- 选择已批准的模型
- 最小化暴露的上下文
- 执行数据和支出策略
- 管理故障
- 保留所做决策的证据
当与追踪、评估和监控系统连接时,网关还能随着时间的推移改进这些决策。
**最大的战略优势之一是可选性。**团队可以采用更好的模型,构建能力更强的智能代理,而无需在每个应用中重新实现安全、策略和遥测。
治理的起点
首先,什么是治理?**治理制定规则,而网关执行规则。**一个强大的治理项目仍然需要问责制和风险管理,但网关是将这些策略应用于每个LLM请求的地方。
一个有用的运营模型包含五个部分:
- **治理:**建立身份、所有权、风险层级和策略
- **决策:**选择模型、升级请求,并在必要时进行故障转移
- **保护:**在每个调用边界强制执行控制
- **观察:**衡量行为结果
- **保证:**保留决策谱系并随时间管理变更
组织从不同的起点开始。其即时优先级取决于他们面临的最大压力。以下是三个常见切入点:
- **以可见性为主导:**AI原生组织,智能代理使用量快速增长,需要控制令牌支出并了解令牌消耗在哪里、这些支出产生了什么结果,以及哪些行为是异常的。
- **以控制为主导:**处理敏感数据的组织首先需要针对提供商访问、数据驻留、保留、编辑以及用户和工作负载权限制定可执行的规则。
- **以保证为主导:**高度受监管的组织首先需要证据证明其控制措施有效。策略版本控制、评估结果和审计日志都有助于提供这种保证。
然而,随着采用率的增长,企业最终都需要这三者:对行为的可见性、对运行时决策的控制,以及对系统按预期运行的保证。
治理的基础
网关只有在稳固的基础上使用时才能执行策略。如果底层平台不安全,上层的任何路由或策略逻辑都无法弥补。在管理智能代理流量之前,组织必须首先管理这些代理运行的环境。
安全
智能代理治理继承了企业对基础设施的一切期望:静态和传输中的加密、客户与平台提供商之间明确的责任共担模式,以及独立的安全验证。这部分是基本要求。
认证与身份
智能代理及其操作者需要以与企业其他系统相同的方式进行认证。
这可能包括通过SAML或OIDC实现SSO,以及即时配置,使新员工能够自动获得访问权限,而无需手动提交工单和跟踪。
当身份与组织的身份提供商(而非独立的登录系统)相连时,停用用户只需一个操作,而不是跨越五个工具的检查清单。
审计日志
每一次重要的AI交互都应该是可证明的。审计日志不仅应捕获谁运行了工作负载或更改了策略,还应捕获应用了哪个策略版本、产生了什么结果,以及使用了哪些工具或提供商。
保留和访问策略必须安全地保存这些证据。
用户管理
访问控制需要支持多种粒度级别。基于角色的访问控制允许组织分配具有继承权限的角色,例如设置组织范围策略或查看财务和监管数据的权限。
SCIM及类似标准可以自动化用户配置和去配置,因此当员工入职、调岗或离职时,角色会自动分配、更新和撤销。
提供商密钥
管理API密钥最危险的方式是将它们编码到每个需要它们的智能代理中。
提供商密钥应集中存储在单一位置,存储一次,并且理想情况下仅限于需要它们的特定团队。当需要轮换密钥时,只需更改一次,而不是在密钥出现的每个智能代理或应用中逐一追踪。
数据隔离
在大型组织中,并非每个团队都应能查看所有追踪、数据集或智能代理运行。
团队和工作空间应相互隔离,以便每个用户只能访问与其职责相关的信息,而不是组织记录的所有内容。
数据驻留
对于受监管行业和地区,数据驻留是关键的合规要求。组织可能需要在特定的地理或基础设施足迹内存储和处理追踪及其他运营数据,这可能与供应商平台的默认足迹不同。
这些能力共同使网关变得可信,并构成了在安全企业平台内运营网关的基础。
需要治理什么
组织应首先明确他们实际想要治理什么。
LLM调用、工具调用、MCP调用和智能代理间(A2A)交互各自携带不同的风险和治理要求。
LLM调用可能将PII泄露到提供商日志中。工具调用可能对敏感记录系统执行操作。MCP调用可能将数据发送到组织基础设施边界之外。智能代理间交互可能通过代理链传递未经授权的上下文。
在选择LLM网关之前,组织应确定他们需要控制和观察哪些交互:
| 交互类型 | 风险所在 | 典型治理要求 |
|---|---|---|
| LLM调用 | 成本、模型可用性、私有数据 | 支出限制、编辑、提供商路由 |
| 工具调用 | 生产系统中意外操作 | 权限设置、审计追踪 |
| MCP调用 | 数据离开基础设施边界 | 访问控制、日志记录 |
| A2A交互 | 跨代理链的复合错误或未授权访问 | 追踪、每次跳转的策略执行 |
对于智能代理,最大的风险往往不在于模型说了什么,而在于代理能做什么。
因此,治理必须超越内容过滤,扩展到行动:代理可以调用哪些工具、它接收哪些凭证,以及何时需要人工批准决策。
如何执行治理
评估构建网关的真实成本
构建一个基本转发层相对简单。但构建、调优和维护围绕它的控制才是耗时的工作。
护栏必须仔细调优,以免对关键信息产生误报。将网关作为关键基础设施运营需要持续的提供商集成工作、对缓存、批处理和推理令牌的准确核算、模型弃用管理以及可靠的审计证据。
组织真正需要考虑的是,他们是否愿意承担运行生产控制平面的长期成本和风险。
将治理构建到智能代理栈中
独立的网关可以执行策略,但往往无法解释为什么发生调用、代理接下来做了什么,或者沿途是否通过或未通过明确的策略。
与追踪、评估和监控相连接的网关可以做到这些。
当支出策略阻止请求时,违规会出现在可检查的追踪中。团队可以理解策略触发的原因,并确定是否需要更改应用或策略,而无需在工具之间切换。
与智能代理栈的集成还使网关能够支持智能代理性能的持续改进。评估可以确定较小的模型、较短的提示或不同的策略是否能保持质量。一个连接到其余智能代理开发生命周期(https://www.langchain.com/blog/the-agent-development-lifecycle)的网关,将每次调用转化为可操作的信息。
简化采用并集中管理
对于标准模型流量,采用应从更改base_url开始:将现有客户端指向网关而非直接指向提供商,然后无需其他代码更改即可运行。
此更改可以集中管理,因此单个员工无需手动进行更改。集中配置可以加速采用,并防止每个团队都必须独立实现治理。
保持网关在生产负载下可靠
弹性和故障行为
由于网关位于关键路径中,它不能成为单点故障。可靠性不仅需要提供商回退,还需要超时、负载均衡以及基于工作负载风险的显式开/关故障行为。网关治理的有效性取决于其可靠地传输流量的能力。
回退
提供商可能遭遇停运,模型可能被弃用,速率限制可能在最糟糕的时刻触发。网关需要为接下来发生的事情提供明确的答案——是直接请求失败,还是自动故障转移到第二个模型。仅当备用模型在策略上等效时,它才被视为有效,即满足相同的数据处理、驻留和安全要求。这使公司能够持续提供服务而不出问题。
速率限制和告警
提供商的速率限制可能导致下游故障和用户体验下降。通过在网关内强制执行速率限制,组织可以避免达到限制,并在需要时将请求路由到替代模型。这些限制也是智能代理健康状态的有用指标。如果某个智能代理开始频繁触发速率限制,这可能表明它存在问题。
当使用或策略阈值接近或已达到时,网关应通知团队。这使团队能够主动管理支出并保持在预算内。
价格准确性
提供商经常更改费率,添加新的层级,如缓存读取、推理令牌或批量定价。除了在某个时间点保持价格准确之外,团队还应能够看到工作负载的有效价格何时发生变化。及早发现这一点可以使整个系统经济高效地运行。
模型访问
对常见模型端点(包括前沿提供商和主机提供商——Anthropic、OpenAI、Google、AWS Bedrock等)以及开放权重模型(通过兼容OpenAI的端点)的内置支持,为组织提供了跨智能代理工作负载的灵活性。这使得将工作负载路由到更便宜的开放权重模型成为可能,而无需重新配置应用。
治理AI成本和模型选择
公司可能在短短几个月内烧掉全年的AI预算,同样的问题也存在于单个开发者层面。一个工程师运行一个无人值守的编码代理、一个陷入重试循环的代理,或一个范围不当的批处理任务,可能在一次会话中就耗费数千美元,而无人察觉。
支出控制
支出策略应反映组织的结构。限制可以应用于组织、业务单元、团队、API密钥或个人用户级别。
API密钥还可以提供一种实用方式,用于追踪较不明显的使用维度。由于密钥通常映射到特定服务或代理,为每个客户端或工作负载分配一个密钥,可以在不构建单独追踪系统的情况下监控和限制使用。
策略可以按日、周和月限制分层设置,而默认策略则减少了单独配置每个团队或工作负载所需的工作量。
模型路由
模型路由是一种组合管理。大多数人认为模型路由是将简单提示发送到更便宜的模型,但它也同时将每个任务与批准用于该用例且满足质量、延迟、成本和风险要求的模型相匹配。
较小或更专门的模型可以处理路由、分类或其他狭窄任务,而能力更强的模型则可保留给需要更深层推理的工作。
上下文效率
令牌使用量主要由代理每次交互发送的上下文量决定。上下文效率意味着最小化不必要的信息以降低成本和延迟,同时限制敏感数据的暴露。拥有一个集成系统在这种情况下很有价值,因为追踪可以帮助团队识别上下文增长,评估可以确定可以安全移除多少上下文,而监控可以在更改后检测质量回归。
支出策略不仅仅是财务工具。策略违规的突然激增通常是智能代理出现问题的第一个迹象,工程师可以据此进行调查。在设置了适当告警的情况下,这一点尤其有效。
运行时保护敏感数据
本部分适用于受合规框架约束和/或处理敏感数据的组织。在这些情况下,数据保护不是可选项,而是在监管检查或泄露披露时保护公司的关键基础设施。
以下法规
相似文章
@LangChain:代理治理不仅限于安全,还整合了身份认证、审计日志、用户管理、提供商密钥…
LangChain将于8月12日分享一个实用框架,用于评估代理治理需求,包括身份认证、审计日志、用户管理、提供商密钥、数据隔离、数据驻留、速率限制、降级策略以及集中式支出控制,以帮助基础设施团队在代理从实验阶段进入生产阶段时应对挑战。
@LangChain: 推出 LangSmith LLM Gateway:为你的智能体打造的运行时治理层。强制执行成本限制、检测 PII、违规处理……
LangChain 宣布推出 LangSmith LLM Gateway,这是一个面向 AI 智能体的运行时治理层,可强制执行成本限制、检测 PII,并直接在 LangSmith 内实施策略监控,现处于内测阶段。
@LangChain: 智能体正在编写代码、处理文件、分析数据、安装包并运行多步骤工作流。要做到这一点……
LangChain 将于7月15日举办一场关于为AI智能体构建安全执行环境的技术网络研讨会,内容涵盖安全性、隔离性和可观测性。
@LangChain:在提升您的代理之路上
LangChain 宣布了一项用于改进 AI 代理的资源。
@Huahuazo: 想搞明白Agent到底怎么从零搭起来,不是光会调API那种——我翻过不少资料,要么讲得太抽象,要么直接甩给你一个成品让你改改参数就完事,中间“为什么这样设计”的部分基本是空白。 LangChain官方的这个Agents From Scra…
LangChain官方发布的Agents From Scratch教程详细介绍了如何从零构建一个具有人机协作和记忆功能的AI代理,涵盖基础搭建、评估体系、人机协作和长期记忆四个部分。