我设置了一个AI网站管理员,我的非技术客户可以直接发邮件给他。以下是它的构建过程和遇到的问题。

Reddit r/AI_Agents 新闻

摘要

作者描述了使用Grok Bot为非营利组织的非技术客户设置AI网站管理员的过程,详细介绍了架构、安全措施以及从实施中学到的教训。

我负责建设和维护一个小型非营利组织的网站。她的请求以带有截图的文本形式发送。我会将这些请求粘贴到我的编码代理中,检查其工作,然后报告回去。代理在做工作,而我则是路由器。你不能把一个AI编码工具交给非技术背景的所有者,并让它指向她的实际网站。因此,以下是它的设置方式。 1. 文档就是网站管理员。在接触任何AI之前,我将知识写成一个纯文档文件夹,存放在网站自己的代码仓库中:安全护栏:一个永不做清单。永不要直接编辑生产环境。未经我的许可,永不要处理支付。此外,还包括我之前遇到的所有特定网站陷阱。服务说明:每个服务的功能,以及哪个账户拥有它。决策日志,这样代理就不会'修复'那些本意如此的东西。角色设定:用简单语言,最多问三个问题再向她展示内容,并且永不保持沉默。重建指南,这样如果机器人平台消失,整个系统可以从代码仓库重新搭建。机器人是可替换的。 2. 代理的运行环境。Grok Bot,xAI的代理产品。每个机器人都有自己的云端持久化计算机,配有终端、浏览器和文件,因此它可以像开发者一样克隆代码仓库、运行测试和推送分支。我将这位网站管理员称为Ivan。 3. 客户从不直接接触代理。Ivan有自己的电子邮箱,她只需向该邮箱发送邮件。他白天每小时检查几次。 4. 每个网站变更都通过一个流水线处理。首先确认并给出时间估算。在分支上构建。部署到私有预览链接。等待对该特定链接的批准,记录谁批准、哪个链接以及何时批准。然后合并并检查实际网站。 5. 三条通道。通道A,内容(文字、图片、日期):Ivan自己处理,采用预览和批准模式。通道B,小规模代码更改:回归测试、代码仓库自身的检查,以及由第二个机器人的签字确认,其唯一职责是审查Ivan的工作。它冷读差异。通道C,资金或个人数据(支付、退款、数据库):Ivan从不处理这些。他向我提交工单。 6. 安全网。对网站关键页面进行定期健康检查,以及我已演练过的回滚脚本。如果Ivan三次未能修复某个问题,他将恢复到最后一个可用版本并向我提交工单。这一点尚未测试。 发生了什么 我先进行了消防演练,故意破坏了一个预览分支。这发现了两个实际问题,我在她看到之前修复了它们。第一天:她在不到四小时内要求对一张传单进行七次更改,Ivan每次都完成了。她仍然给我发了一次短信转发请求,因为她以为Ivan在等我的同意。Ivan误将我手机上一张模糊的人行道照片当作她发送的内容,并礼貌地要求她重新发送。他报告说新文本'尺寸匹配,干净贴合'。放大后,它明显比周围的文本小,还残留着旧行的一点片段。它从未送达给她。现在的固定规则是:当代理说它完成时,打开文件检查。到目前为止,只有一项实际网站变更经过了完整流水线,而我亲自批准了这一项。 我学到了什么 将指令写下来,而不是在聊天中。我通过向Ivan发送修正消息来塑造他的行为,而每一次修正在重建时都会丢失。现在它们都存放在代码仓库中的一个版本化提示文件中,他在每次任务前都会拉取最新副本。第一个版本不必是最终版本。一旦它工作,我就将设置提取为可重用模板,并为另一个网站搭建了第二个网站管理员。给共享机器上的每个代理分配自己的密钥。我在同一台计算机上为另一个网站运行第二个网站管理员。当我设置它时,它的设置覆盖了第一个的SSH密钥,而且没有任何警告;第一个网站管理员就这样失去了代码仓库访问权限。现在每个代理都有自己的密钥文件,并且有一条规则永不覆盖它未创建的文件。困难的部分不是AI。而是上下文、权限和安全护栏。模型是容易的部分。留给我的是工单队列和保持Ivan运行。你如何处理审查步骤:第二个代理、仅测试,还是人类?
查看原文

相似文章

我让一个AI代理做我的无聊行政工作,它居然还行

Reddit r/AI_Agents

一位小企业主分享了使用名为'autoclaw'的AI代理来自动化电子邮件、客户报告以及将支持工单转移到GitHub等行政任务的经验。在最初的设置挫折和过度连接之后,他们最终采用了有限的集成,尽管偶尔输出垃圾内容,但节省了时间。