厌倦了只展示理想情况的AI智能体演示,所以我们搭建了一个让它们失败的地方

Reddit r/AI_Agents 工具

摘要

一位开发者构建了 Battle Agents,一个用于在可控失败场景中测试 AI 智能体的平台,以检查其决策、工具调用和恢复能力,并正在寻求社区反馈。

一直在开发智能体,有件事一直困扰着我们:通常我们只看最终答案,然后判定这个智能体好或不好。但一个智能体完全可能在跳过证据、调用错误工具,或以极其愚蠢的方式恢复之后,才得出一个完全合理的答案 😭 所以我们构建了 Battle Agents。基本上就是在可控场景下,让智能体使用相同的工具和约束条件,然后你可以真正检查发生了什么——决策、工具调用、交接、恢复、评分等等。第一个对战场景特意设计得很简单:一个退款请求,其中证据不完整。智能体会先核实,还是自信地做出蠢事?目前还处于非常早期阶段。是的,我就是构建者之一。真心希望所有开发智能体的同行来打破这个想法,并告诉我们,你们希望把你们的智能体投入哪些场景进行对战。更多信息请访问 battleagents.space
查看原文

相似文章