@changgaowei: 大多数人发布智能体。可靠性工程师发布可以安全失败的层次。如果你想从事AgentOps工作,构建……
摘要
本文概述了构建14个必要系统以确保AI智能体的可靠性和安全性,包括身份管理、访问控制和事件响应协议。
查看缓存全文
缓存时间: 2026/09/18 00:26
大多数人关注的是智能体本身。 可靠性工程师关注的是那个可以故障关闭的中间层。
如果你想要运维智能体(AgentOps)的工作,请构建以下内容:
1)智能体身份注册表 构建:为每个智能体分配唯一ID、所有者、有效期和允许的工具。不使用共享服务账户。 原因:无法命名的事物,就无法撤销。
2)工具调用白名单网关 构建:仅允许声明过的工具和参数格式的中间件。未知工具 = 直接失败。 原因:目标劫持往往始于“只是多调用一次”。
3)会话生存时间强制执行器 构建:对会话长度和跳转次数进行硬性限制。在第六小时终止循环。 原因:长时间运行本是特性,直到它变成无人监管的进程。
4)开支熔断器 构建:为每个智能体设置每日Token和工具预算。耗尽时切换到只读模式。 原因:失控的智能体群组会导致账单灾难。
5)即时终止开关 构建:一个经过认证的端点,可在一分钟内停止智能体及其所有子智能体。每周进行演练。 原因:76%的人认为自己拥有此功能。但真正能证明的却少之又少。
6)不可变轨迹日志 构建:仅追加记录提示词、工具参数、输出和成本。可在30天内回放任何事件。 原因:如果无法重现过去一个月的记录,那就不是运维,只是感觉。
7)人工审批队列 构建:不可逆操作(支付、邮件、删除、部署)停留在收件箱中,等待指定人员批准。 原因:聊天对话不是授权。队列才是。
8)生产影子金丝雀测试 构建:将5%的在线任务路由到新架构。对比成功率、成本和工具使用情况。不改变用户体验。 原因:智能体不能像按钮那样进行A/B测试。要么用影子测试,要么就是在猜测。
9)评估感知检查 构建:相同任务分别标注为“这是测试”和“这是生产”。对比作弊率和拒绝率。 原因:模型会在记录工具前表现更好。需要同时测量两种场景。
10)凭证过期轮转机制 构建:构建时的密钥在工单关闭时失效。如果授权持续时间超过任务,扫描器会使CI流水线失败。 原因:大多数生产环境的删除操作,使用的都是未被撤销的有效凭证。
11)多智能体爆炸半径图 构建:绘制智能体间调用关系图。限制扇出规模。阻止意外的子智能体。 原因:一个请求可能演变为集群。在集群失控前先绘制其蓝图。
12)任务外地理围栏测试 构建:为智能体设置国家或供应商排除列表。评估其在时间压力下是否遵守。 原因:PaperCut智能体跨越了操作员自己的屏蔽列表。策略不等于控制。
13)经过实际测试的回退机制 构建:前沿模型故障 → 中级模型 → 缓存结果 → 人工处理。每月进行混沌测试。 原因:你的故障应对产品就是回退机制,而不是旗舰模型。
14)公开事件说明卡 构建:一页事故后分析模板:智能体做了什么、被允许做什么、响应时间、成本。公开发布它。 原因:信任是可靠性指标。隐藏这张卡,市场会为你写一张。
教程造就助手。 这些系统让你成为那个在循环无法停止时会被求助的人。
收藏这篇。然后构建其中一个。如果需要帮助,可以私信我。我们可以合作。
相似文章
@hwchase17: https://x.com/hwchase17/status/2053157547985834227
文章概述了一个系统的“智能体开发生命周期”(构建、测试、部署、监控),以有效创建和管理 AI 智能体,重点介绍了 LangChain、LangGraph 和 CrewAI 等关键框架。
有人在AI智能体交付的“第二天”阶段碰壁了吗?
一位从业者分享了将AI智能体部署到生产环境中的真实挑战,指出治理、审计和部署防护措施现在已成为瓶颈,而非智能体构建本身,并提到了Lyzr Control Plane和微软参考架构等新兴解决方案。
@_avichawla: https://x.com/_avichawla/status/2071897559287955680
文章讨论了AI代理的真正挑战不在于构建它们,而在于在生产环境中运行它们,并提出了需要一个操作系统层来管理代理集群,类似于操作系统管理软件进程的方式。
我们不断看到AI代理意外地修改或部署真实基础设施——你希望在实际故障发生前捕捉到哪种具体失败?
本文强调了AI代理无意中修改或部署真实基础设施这一反复出现的问题,并引发了一场关于应在故障发生前捕捉哪些类型失败的讨论。
@arcane_bloom: 从软件工程到智能体工程的转变:五部分解析 1/6 大多数开发者在构建AI时失败…
一条推文解释了从传统软件工程过渡到智能体工程所需的5个核心思维转变,强调了为什么硬编码路由和二元测试等常规模式在AI智能体中会失效。