当AI代理说“完成”时,你怎么知道它真的发生了?[P]

Reddit r/MachineLearning 新闻

摘要

文章探讨了一个名为agentuptime的早期概念,它通过独立检查结果来验证AI代理的操作,以确保代理的完成声明与外部系统的实际状态相符。

我正在测试一个名为agentuptime的早期概念。目前还没有产品或SDK。这个想法源于我一直困扰的一个问题:代理说“完成”并不一定意味着事情真的发生了。工具可能返回成功,追踪日志看起来正常,但外部系统最终可能仍处于错误状态。因此,我正在尝试一个小的“收据”概念,其中代理的声明与独立检查的结果分开。类似于:数据库写入 → 记录是否真的可以读取回来?API操作 → 提供商现在是否显示预期状态?代理交接 → 另一个代理是否真的收到了?我试图弄清楚这是否值得一个独立的层,或者追踪加自定义检查是否已经足够解决这个问题。如果你运行具有实际副作用的代理,哪种操作最难验证? https://agentuptime.dev
查看原文

相似文章

如何判断AI编码代理真正完成了?

Reddit r/AI_Agents

作者创建了OpenPitStop,一个独立检查和验证AI编码代理工作的开源工具,并在一个损坏的应用程序上进行了演示,同时邀请讨论如何信任AI的更改。