@IntuitMachine: PEEK: 这个1K Token地图刚刚终结了长上下文税 你的LLM代理正在读取同一个50K Token的代码库……
摘要
微软推出了PEEK,一个1,024 Token的'上下文地图',为LLM代理缓存定位知识,减少冗余推理,实现了高达34%的准确率提升,减少93-145次重试,成本降低5.8倍。
查看缓存全文
缓存时间: 2026/05/23 16:13
PEEK:仅用1k Token的「上下文地图」终结长上下文税
你的LLM代理正在第20次阅读同一个5万token的代码库。
它依然不知道任何东西在哪里。
微软的PEEK刚刚用1k token的「上下文地图」改变了这一切,它能:
• 准确率提升34% • 减少93–145次重试 • 成本比提示调优低5.8倍
原理如下:
每次你针对同一个仓库向GPT-5提出新问题时,它都会重新探索:
→ 文件结构 → 关键类 → 模块如何连接
你一次次为同样的「定向工作」买单。
行业称之为「长上下文税」。
PEEK的突破:
将「上下文理解」与「任务执行」分离。
不再把所有内容塞进提示词或盲目检索,而是让代理维护一个微小的持久化地图——就像一张「作弊小抄」,写一次就能永久复用。
上下文地图包含5个部分: 上下文路线图 — 高层结构 上下文理解 — 关键实体/关系 领域常量(按需) 解析模式 可复用结果(缓存答案)
预算:严格控制在1,024 token。
三个模块让地图保持新鲜且不膨胀:
提炼器 → 仅提取可迁移的定向知识 制图师 → 执行干净、去重的编辑(添加/删除/替换) 驱逐器 → 预算满时丢弃低优先级项目
分离很重要:角色混合 = 噪声 + 重复。
在OOLONG + CL-bench(编码基准)上测试:
指标相对于ACE(最先进水平)的提升准确率+6–34%节省迭代次数93–145次成本降低1.4–5.8倍
相同的基础模型,相同的代理。仅1k token的定向缓存。
这是效率秘诀:
在1–4次查询后冻结地图。
你将获得80%以上的收益,之后维护成本几乎为零。 大多数「学习」系统从未停止更新 → 浪费计算资源。 PEEK快速学习,然后锁定。
PEEK如何超越其他方案:
RAG:检索片段,缺乏整体结构 摘要:压缩内容,而非定向知识 ACE/提示调优:优化任务,而非上下文理解 PEEK:缓存代理第一天就应该建立的心智模型
冷静思考:
当上下文结构化和查询重复出现时,PEEK表现出色。
如果你在写一次性创意小说或闲聊随机PDF,地图可缓存的内容较少。 但对于代码仓库、企业文档、分析场景?这将成为新基线。
传统技术栈: → 更大的上下文窗口 → 更优的检索 → 更聪明的提示词 新技术栈: → 更大的上下文窗口 → 更优的检索 → 持久化的定向缓存
上下文理解正式成为一等公民的版本化资产。
今天就可以叠加使用的两个倍增器:
PEEK式地图(减少冗余推理) KV缓存优化(减少冗余Token处理) 二者结合 = 推理成本倍增式下降。
下一代代理基础设施将默认内嵌这两者。
如果你正在构建需要反复与相同长上下文交互的代理:
→ 停止每次查询都重新设计提示词 → 开始缓存定向知识
这1k token的地图就是缺失的缓存层。使用它。
/结束
相似文章
@bojie_li:如果你在生产环境中运行LLM智能体,你就会明白其中的代价。每一轮都要重新读取相同的长上下文——系统策略、工具……
研究人员提出了可编程KV缓存(Programmable KV Cache),这是一种用于编辑和组合KV缓存的方法,旨在避免LLM智能体推理过程中重新预填充长上下文,在保持决策一致性的同时,将p90首令牌时间减少了53至398倍。
PEEK:长上下文LLM代理的上下文图方向缓存
本文介绍了PEEK系统,该系统将关于重复出现的外部上下文的定向知识缓存为上下文图,使得LLM代理能够跨调用复用上下文知识,并在长上下文推理和信息聚合任务上显著提高效率和准确性。
TokenPilot:面向LLM代理的缓存高效上下文管理
TokenPilot是一个双粒度上下文管理框架,通过稳定提示前缀和保守管理上下文片段,降低长时程LLM会话中的推理成本。在基准测试中实现了61-87%的成本降低,同时保持竞争性性能。
@ickma2311: 高效AI讲座15:长上下文LLM 长上下文不仅仅是更大的提示窗口。关键问题是:哪些过…
本文总结了关于长上下文LLM的高效AI讲座15,涵盖用于上下文扩展的RoPE位置插值、大海捞针评估,以及StreamingLLM的注意力汇聚现象和KV缓存驱逐策略。
更少上下文,更智能代理:面向长周期工具使用的LLM代理的高效上下文工程
本文评估了企业工具使用工作流中LLM代理的上下文工程配置,表明选择性修剪的摘要化相比全上下文基线实现了91.6%的准确率,同时将令牌使用量减少了60%以上。