或许可靠性问题其实是范围问题,而非模型问题

Reddit r/AI_Agents 新闻

摘要

一项调查显示,大多数团队对agent严格控制,数据表明,窄范围agent的成功率为65%,而宽范围仅为16%,这暗示可靠性问题可能更多与范围有关,而非模型能力。

我看到最近一项关于在生产中运行agent的团队调查,注意到超过90%的团队将agent的输出交由人工处理,而非直接作用于其他系统。基本上所有人都严格限制agent的权限。此外,部署数据显示,窄范围、单工作流的agent按时完成任务的概率约为65%,而宽范围的agent仅为16%。相同的模型,成功率却天差地别。感觉大多数关于“可靠性问题”的讨论都集中在如何让agent本身更可靠、设置更好的护栏、更好的评估上,而实际上大多数团队找到的解决方案仅仅是限制其犯错的空间。缩小范围是真正的关键,还是只是在可靠性工程成熟之前的权宜之计?
查看原文

相似文章

你最强的模型可能不是最佳的工具调用者

Reddit r/AI_Agents

本文认为,工具调用的可靠性往往不与模型能力成正比;较小的模型在遵循模式和格式规范方面可能超越较大的模型,这表明原始能力并非选择工具调用模型的唯一因素。