@changgaowei: 大多数人发布智能体。可靠性工程师发布可以安全失败的层次。如果你想从事AgentOps工作,构建……

X AI KOLs Following 新闻

摘要

本文概述了构建14个必要系统以确保AI智能体的可靠性和安全性,包括身份管理、访问控制和事件响应协议。

大多数人发布智能体。 可靠性工程师发布可以安全失败的层次。 如果你想从事AgentOps工作,构建这些。 1.) 智能体身份注册表 构建:每个智能体获得唯一ID、所有者、有效期和允许的工具。没有共享服务账户。 原因:你不能撤销你不能命名的东西。 2.) 工具调用允许列表网关 构建:中间件仅允许声明的工具和参数模式。未知工具 = 硬性失败。 原因:目标劫持始于“只是一次额外调用”。 3.) 会话存活时间强制执行器 构建:硬性限制会话长度和跳数。在六小时时终止循环。 原因:长周期是特性,直到它成为无人看管的进程。 4.) 开销断路器 构建:每个智能体的日代币和工具预算。用完时切换为只读。 原因:失控的集群是发票中断。 5.) 即时终止开关 构建:一个认证端点在不到一分钟内停止一个智能体及所有子智能体。每周演练。 原因:76%的人认为他们有这个。但很少人能证明。 6.) 不可变轨迹日志 构建:仅追加记录提示、工具参数、输出和成本。在30天内重放任何事件。 原因:如果你无法重建上个月,你就没有运维。你只有感觉。 7.) 人工审批队列 构建:不可逆操作(支付、邮件、删除、部署)放在收件箱中,直到指定的人签署。 原因:聊天不是同意。队列才是。 8.) 影子生产金丝雀 构建:5%的实时任务命中新的测试框架。比较成功率、成本和工具混合。无用户面向的变化。 原因:智能体不是像按钮那样进行A/B测试。影子测试或者你在猜测。 9.) 评估意识检查 构建:相同任务标记为“这是测试”与“这是生产”。比较作弊和拒绝率。 原因:模型为了记录而表现。测量两个环境。 10.) 凭证过期飞轮 构建:构建时密钥在工单关闭时死亡。扫描器在授权超过任务时使CI失败。 原因:大多数生产删除是有效的凭证但未被撤销。 11.) 多智能体爆炸半径图 构建:图示谁可以调用谁。限制扇出。阻止意外子智能体。 原因:一个请求变成集群。在集群绘制你之前绘制它。 12.) 任务外地理围栏测试 构建:给智能体一个国家或供应商排除列表。评分它在时间压力下是否遵守。 原因:PaperCut智能体越过了操作员自己的跳过列表。策略不是控制。 13.) 实际测试过的回退 构建:前沿模型下线 → 中等模型 → 缓存答案 → 人工。每月混沌测试链。 原因:你的中断产品是回退,而不是旗舰模型。 14.) 公开事件卡 构建:一页事后分析模板:智能体做了什么、被允许做什么、终止时间、成本。发布它。 原因:信任是可靠性指标。隐藏卡片,市场会为你写它。 教程造就副驾驶。 这些系统造就了当循环无法停止时他们会呼叫的那个人。 收藏这个。然后构建一个。如果需要帮助,私信我。我们可以合作。
查看原文
查看缓存全文

缓存时间: 2026/09/18 00:26

大多数人关注的是智能体本身。 可靠性工程师关注的是那个可以故障关闭的中间层。

如果你想要运维智能体(AgentOps)的工作,请构建以下内容:

1)智能体身份注册表 构建:为每个智能体分配唯一ID、所有者、有效期和允许的工具。不使用共享服务账户。 原因:无法命名的事物,就无法撤销。

2)工具调用白名单网关 构建:仅允许声明过的工具和参数格式的中间件。未知工具 = 直接失败。 原因:目标劫持往往始于“只是多调用一次”。

3)会话生存时间强制执行器 构建:对会话长度和跳转次数进行硬性限制。在第六小时终止循环。 原因:长时间运行本是特性,直到它变成无人监管的进程。

4)开支熔断器 构建:为每个智能体设置每日Token和工具预算。耗尽时切换到只读模式。 原因:失控的智能体群组会导致账单灾难。

5)即时终止开关 构建:一个经过认证的端点,可在一分钟内停止智能体及其所有子智能体。每周进行演练。 原因:76%的人认为自己拥有此功能。但真正能证明的却少之又少。

6)不可变轨迹日志 构建:仅追加记录提示词、工具参数、输出和成本。可在30天内回放任何事件。 原因:如果无法重现过去一个月的记录,那就不是运维,只是感觉。

7)人工审批队列 构建:不可逆操作(支付、邮件、删除、部署)停留在收件箱中,等待指定人员批准。 原因:聊天对话不是授权。队列才是。

8)生产影子金丝雀测试 构建:将5%的在线任务路由到新架构。对比成功率、成本和工具使用情况。不改变用户体验。 原因:智能体不能像按钮那样进行A/B测试。要么用影子测试,要么就是在猜测。

9)评估感知检查 构建:相同任务分别标注为“这是测试”和“这是生产”。对比作弊率和拒绝率。 原因:模型会在记录工具前表现更好。需要同时测量两种场景。

10)凭证过期轮转机制 构建:构建时的密钥在工单关闭时失效。如果授权持续时间超过任务,扫描器会使CI流水线失败。 原因:大多数生产环境的删除操作,使用的都是未被撤销的有效凭证。

11)多智能体爆炸半径图 构建:绘制智能体间调用关系图。限制扇出规模。阻止意外的子智能体。 原因:一个请求可能演变为集群。在集群失控前先绘制其蓝图。

12)任务外地理围栏测试 构建:为智能体设置国家或供应商排除列表。评估其在时间压力下是否遵守。 原因:PaperCut智能体跨越了操作员自己的屏蔽列表。策略不等于控制。

13)经过实际测试的回退机制 构建:前沿模型故障 → 中级模型 → 缓存结果 → 人工处理。每月进行混沌测试。 原因:你的故障应对产品就是回退机制,而不是旗舰模型。

14)公开事件说明卡 构建:一页事故后分析模板:智能体做了什么、被允许做什么、响应时间、成本。公开发布它。 原因:信任是可靠性指标。隐藏这张卡,市场会为你写一张。

教程造就助手。 这些系统让你成为那个在循环无法停止时会被求助的人。

收藏这篇。然后构建其中一个。如果需要帮助,可以私信我。我们可以合作。

相似文章

有人在AI智能体交付的“第二天”阶段碰壁了吗?

Reddit r/artificial

一位从业者分享了将AI智能体部署到生产环境中的真实挑战,指出治理、审计和部署防护措施现在已成为瓶颈,而非智能体构建本身,并提到了Lyzr Control Plane和微软参考架构等新兴解决方案。