我每周对我们的代理运行相同提示持续一个季度,观察回答漂移直至违反策略 [D]

Reddit r/MachineLearning 新闻

摘要

作者描述了对生产环境AI代理进行每周审计的过程,观察到其响应逐渐漂移,最终在未更新模型的情况下违反策略,强调了在真实世界AI部署中持续监控的必要性。

大约一个季度,我对一个生产代理运行了相同的审计。每周我问它同一个问题。我特意将这个问题设计得刚好触及策略边界。每次我都记录回答。最初几周,它表现得相当好。然后小问题开始出现。这里掉了一个限定词,那里多了一点细节。到测试结束时,第一周能干净拒绝的同一个提示,现在得到的回答直接违反了策略。我们没有更新模型或更改任何策略,模型只是随时间漂移了。这就是关于生产环境没人告诉你的地方。演示是静态照片。真实用户会用各种非脚本输入来测试它,代理会随之演变。当有人刻意尝试时,情况会更糟。我们对它发起的一些攻击,没什么花哨的,只是用不同方式礼貌地提出相同要求,就能在它平时对简单问题仍能拒绝的日子里,让它给出违反策略的回答。人们测试代理一次,看到它按预期响应就部署了,不再进行后续监控。演示可能看起来干净,但生产环境是完全不同的宇宙。
查看原文

相似文章

Agent 运行越久,我就越不在意提示词

Reddit r/AI_Agents

作者反思了长期运行的人工智能代理如何遭遇与初始提示无关的失败,并认为环境设计(工具、文档、验证、架构规则)更为重要。他们讨论了诸如 harness 工程、保持 AGENTS.md 文件精简、使用 linter 和评估器代理等概念,同时指出了成本权衡。