长时运行的Agent:瓶颈究竟是模型还是其周围的脚手架?

Reddit r/artificial 新闻

摘要

一场从业者讨论,探讨长时运行的AI Agent故障究竟源于模型能力还是其周围的脚手架,重点分析了错误累积、上下文污染和自我修正薄弱这几种关键故障模式。

我在搭Agent时经常注意到一点:每个单独的步骤对模型来说都很简单,但整条链在长任务上还是会崩溃。我认为关键有三方面: **错误累积。** 即使每一步的准确率有95%,一个20步的链条也只有大约三分之一的概率成功(0.95^20 大约是0.36)。小错误会很快堆叠起来。 **上下文污染。** 经过足够多的工具调用之后,上下文里塞满了旧的输出、走不通的死路和失败的尝试,模型会慢慢丢失最初的目标。 **自我修正薄弱。** 当某一步出错时,模型通常会继续在错误的基础上往下做,而不是回退并修正它。 我不确定的是,真正的修复到底来自哪里。一派认为主要靠更好的模型。另一派认为,一个精心设计的循环(检查点、校验步骤、把状态存储在上下文窗口之外)比模型本身更重要。 很好奇大家在实践中看到过什么: - 你会把完整历史都留在上下文中,还是边走边做总结和裁剪? - 单独的批评者(critic)或校验模型真的有帮助吗,还是只是增加了延迟和成本? - 你的Agent通常在任务的哪个阶段开始崩溃?实际解决问题的办法是什么? 很想听听哪些做法有效,哪些没用。
查看原文

相似文章