我认为长上下文代理的失败方式非常无聊
摘要
一篇观点文章,认为长上下文窗口并不等同于记忆,代理失败通常很普通,比如忘记约束或重新读取文件,强调可靠性取决于上下文架构决策。
我认为人们高估了大上下文窗口实际带来的好处。例如,20万token并不意味着记忆。它只是意味着代理有更多空间来埋没重要的东西。失败通常也很无聊:它重新读取同一个文件,忘记之前的约束,选择一个技术上有效但错误的工具,然后输出一些看起来不错的东西,直到你将其与原始任务进行比较。很多“代理可靠性”工作实际上是上下文架构工作:加载什么、丢弃什么、压缩什么、以及在下一步之前重复什么。
相似文章
更大的上下文窗口对智能体来说其实是错误的方向吗?
作者质疑将注意力集中在扩大AI智能体的上下文窗口上是否适得其反,认为积累的垃圾信息会拖慢长时间会话,并建议保持工作上下文小巧、使用外部记忆。
上下文至关重要,但上下文腐烂才是AI智能体的真正上限,更大的上下文窗口只会让情况更糟而非更好
文章认为,上下文腐烂(即随着上下文填充导致推理质量下降)是AI智能体的真正上限,而非上下文窗口大小。它提倡采用架构方法分解任务并使用独立验证来超越限制。
连续运行六小时后,你的上下文窗口究竟会发生什么
一位实践者分享了AI代理连续运行6小时以上时,上下文窗口管理策略(摘要、RAG、截断)的真实失败模式,指出每种方法都会以仅在长时间运行时才会显现的方式降低决策质量。
上下文腐烂是智能体在长任务中途崩溃的原因。
文章解释了“上下文腐烂”:随着上下文增长,AI 智能体在长任务上表现下降,甚至在窗口未满时就开始退化,并提供了压缩、状态卸载、按需检索等技术来保持可靠性。
长时间运行的AI智能体不会耗尽上下文——它们的记忆变得陈旧且自相矛盾。你们如何处理这个问题?
文章探讨了长时间运行的AI智能体所面临的记忆陈旧问题,即上下文变得过时和矛盾,并寻求随着时间的推移保持记忆可靠性的实际解决方案。