什么会让你在实际的代理工作流中信任它?

Reddit r/AI_Agents 模型

摘要

文章讨论了评估匿名AI模型Space Bunny在代理工作流中的方法,重点是状态测试、错误恢复和一致性以确保可靠性。

Space Bunny 是 OpenRouter 上的一个新匿名模型。比起猜测是谁制造的,我更感兴趣的是人们如何评估它在代理工作中的表现。对于聊天模型,一两个好的回答可以形成第一印象。对于代理来说,这告诉我较少的信息。模型必须在各个步骤中保持约束,一致地使用工具,从错误中恢复,并避免偏离目标。我的第一个通过/失败测试将是小型且有状态的。我会设置一个有几个明确规则的任务,让它多次调用工具,中途引入一个失败,然后看它是否能在不重新完成已完成工作或忽略早期约束的情况下恢复。一个巨大的基准测试不会告诉我这么多。我还会多次运行同一个任务。一个模型在一次运行中表现出色但在接下来的两次运行中崩溃,比一个不那么令人印象深刻但可预测的模型更难信任。我会寻找一些迹象,比如在缺少信息时暂停询问,避免重复的工具调用,在命令失败或中间结果不佳后恢复,在上下文增长时保持约束,并在“修复”不相关的事情时不制造额外工作。我还会评估它需要多少监督,然后才让它在无人值守的情况下运行20到30分钟。如果你在构建代理,在决定一个新模型足够可靠以用于更长工作流之前,你的第一个测试是什么?
查看原文

相似文章

构建确定性工作流的AI Agent

Reddit r/AI_Agents

一位开发者分享了一个基于AI Agent的自动化平台实验,该平台用于构建和管理确定性工作流,并寻求社区反馈。