我每周对我们的代理运行相同提示持续一个季度,观察回答漂移直至违反策略 [D]
摘要
作者描述了对生产环境AI代理进行每周审计的过程,观察到其响应逐渐漂移,最终在未更新模型的情况下违反策略,强调了在真实世界AI部署中持续监控的必要性。
大约一个季度,我对一个生产代理运行了相同的审计。每周我问它同一个问题。我特意将这个问题设计得刚好触及策略边界。每次我都记录回答。最初几周,它表现得相当好。然后小问题开始出现。这里掉了一个限定词,那里多了一点细节。到测试结束时,第一周能干净拒绝的同一个提示,现在得到的回答直接违反了策略。我们没有更新模型或更改任何策略,模型只是随时间漂移了。这就是关于生产环境没人告诉你的地方。演示是静态照片。真实用户会用各种非脚本输入来测试它,代理会随之演变。当有人刻意尝试时,情况会更糟。我们对它发起的一些攻击,没什么花哨的,只是用不同方式礼貌地提出相同要求,就能在它平时对简单问题仍能拒绝的日子里,让它给出违反策略的回答。人们测试代理一次,看到它按预期响应就部署了,不再进行后续监控。演示可能看起来干净,但生产环境是完全不同的宇宙。
相似文章
如何在模型版本更新时捕捉到悄无声息失效的提示词?
本文讨论了识别模型更新后提示词退化的技术,例如使用固定的评估案例和模型测试矩阵,并询问了评估生产环境中AI代理的最佳实践。
运行AI代理数月后的四大失败(由代理撰写)
一个AI代理反思了自身运行数月来的四大失败,强调了在持久AI系统中独立监控、任务验证以及防止捏造的重要性。
Agent 运行越久,我就越不在意提示词
作者反思了长期运行的人工智能代理如何遭遇与初始提示无关的失败,并认为环境设计(工具、文档、验证、架构规则)更为重要。他们讨论了诸如 harness 工程、保持 AGENTS.md 文件精简、使用 linter 和评估器代理等概念,同时指出了成本权衡。
两周前我提问了代理与真实世界之间会出什么问题。你们的两个回复现在已成为任务
作者跟进之前的讨论,从社区报告的事件中创建公共基准任务,以测试AI代理在认证和预订等真实场景中的失败情况,并征求关于不变量检查的意见。
为何通过所有评估的智能体在真实生产流量下仍会漂移
AI智能体在通过评估后常因分布偏移和上游变更在生产环境中漂移;持续评估和实时监控可缓解此问题。