标签
文章解释了“上下文腐烂”:随着上下文增长,AI 智能体在长任务上表现下降,甚至在窗口未满时就开始退化,并提供了压缩、状态卸载、按需检索等技术来保持可靠性。
This position paper argues that long-horizon benchmark failures must be compared against baselines built from matched short stages, introducing the 'horizon residual' metric to distinguish task size from task difficulty in LLM agent evaluation.
LoopTroop 是一个本地开源GUI应用程序,通过使用LLM委员会进行规划、将任务分解为独立的beads、以及带有失败记录的可控执行,来防止长编码任务中的上下文腐烂,并让开发人员始终参与其中。
Prime Intellect工程师指出,大语言模型如GPT-5.5在百万token上下文时检索准确率从256k时的80%降至36%,表明存在“context rot”问题,即模型能容纳但无法有效推理长上下文,对Agent应用构成挑战。
一位开发者构建了一个开源代理(KU-Gateway),能够在LLM合成前丢弃向量数据库检索中的过时上下文,从而减少约50%的Token消耗,并防止过时数据导致的幻觉。该工具现已开放为期14天的压力测试/黑客马拉松。
Contextrot 是一个开源工具,用于分析 Claude Code 会话记录,以衡量随着上下文窗口填满,失败率是否增加。作者发现自己的会话中没有可测量的上下文衰减。
Gergely Orosz 强调了理解 AI 模型中的上下文大小、退化和压缩的重要性,以解释为什么模型会忘记大型输入中的部分内容。
文章认为,上下文腐烂(即随着上下文填充导致推理质量下降)是AI智能体的真正上限,而非上下文窗口大小。它提倡采用架构方法分解任务并使用独立验证来超越限制。
分析表明,LLM 声称的大上下文窗口具有误导性,因为有效注意力在约 10 万 token 时会下降。为开发者提供实用建议:通过使用工件(artifacts)和切换(handoffs)将会话保持在“智能区”。