我认为长上下文代理的失败方式非常无聊
摘要
一篇观点文章,认为长上下文窗口并不等同于记忆,代理失败通常很普通,比如忘记约束或重新读取文件,强调可靠性取决于上下文架构决策。
我认为人们高估了大上下文窗口实际带来的好处。例如,20万token并不意味着记忆。它只是意味着代理有更多空间来埋没重要的东西。失败通常也很无聊:它重新读取同一个文件,忘记之前的约束,选择一个技术上有效但错误的工具,然后输出一些看起来不错的东西,直到你将其与原始任务进行比较。很多“代理可靠性”工作实际上是上下文架构工作:加载什么、丢弃什么、压缩什么、以及在下一步之前重复什么。
相似文章
更大的上下文窗口对智能体来说其实是错误的方向吗?
作者质疑将注意力集中在扩大AI智能体的上下文窗口上是否适得其反,认为积累的垃圾信息会拖慢长时间会话,并建议保持工作上下文小巧、使用外部记忆。
上下文至关重要,但上下文腐烂才是AI智能体的真正上限,更大的上下文窗口只会让情况更糟而非更好
文章认为,上下文腐烂(即随着上下文填充导致推理质量下降)是AI智能体的真正上限,而非上下文窗口大小。它提倡采用架构方法分解任务并使用独立验证来超越限制。
连续运行六小时后,你的上下文窗口究竟会发生什么
一位实践者分享了AI代理连续运行6小时以上时,上下文窗口管理策略(摘要、RAG、截断)的真实失败模式,指出每种方法都会以仅在长时间运行时才会显现的方式降低决策质量。
将对话记录重放作为默认的智能体记忆是许多长期失败的根源——有界状态与更大窗口
讨论了将对话记录重放作为默认智能体记忆的缺陷,引用了关于上下文退化的研究,并倡导使用具有显式写入策略的有界状态记忆。
Agent 运行越久,我就越不在意提示词
作者反思了长期运行的人工智能代理如何遭遇与初始提示无关的失败,并认为环境设计(工具、文档、验证、架构规则)更为重要。他们讨论了诸如 harness 工程、保持 AGENTS.md 文件精简、使用 linter 和评估器代理等概念,同时指出了成本权衡。