或许可靠性问题其实是范围问题,而非模型问题
摘要
一项调查显示,大多数团队对agent严格控制,数据表明,窄范围agent的成功率为65%,而宽范围仅为16%,这暗示可靠性问题可能更多与范围有关,而非模型能力。
我看到最近一项关于在生产中运行agent的团队调查,注意到超过90%的团队将agent的输出交由人工处理,而非直接作用于其他系统。基本上所有人都严格限制agent的权限。此外,部署数据显示,窄范围、单工作流的agent按时完成任务的概率约为65%,而宽范围的agent仅为16%。相同的模型,成功率却天差地别。感觉大多数关于“可靠性问题”的讨论都集中在如何让agent本身更可靠、设置更好的护栏、更好的评估上,而实际上大多数团队找到的解决方案仅仅是限制其犯错的空间。缩小范围是真正的关键,还是只是在可靠性工程成熟之前的权宜之计?
相似文章
我见到的大多数智能体RAG问题都是检索问题,而非模型问题
作者认为大多数智能体RAG失败源于检索问题——具体包括分块错误、缺乏新鲜度信号以及依赖纯向量搜索——而非大语言模型本身,并建议采用结构化分块、基于衰减的排序以及BM25+向量的混合搜索。
你最强的模型可能不是最佳的工具调用者
本文认为,工具调用的可靠性往往不与模型能力成正比;较小的模型在遵循模式和格式规范方面可能超越较大的模型,这表明原始能力并非选择工具调用模型的唯一因素。
在实践中,我们的多智能体失败几乎从来不是模型的问题——而是交接环节的问题。MAST数据是否符合您的观察?
对多智能体LLM流水线失败的分析,引用伯克利MAST论文,该论文将大多数失败归因于协调问题(规范、智能体间不一致)而非模型能力,并建议使用专用验证智能体作为解决方案。
智能体过度信任工具:衡量对不可靠工具的依赖
本文评估大型语言模型智能体如何过度信任不可靠的工具返回信息,测量被篡改信息的采纳率,并测试缓解此问题的干预措施。
为什么代理一旦离开聊天框,可靠性就会急剧下降?
文章讨论了AI代理从沙盒测试迁移到生产环境时可靠性下降的问题,指出编排层包含的错误往往比模型本身更多。