@IntuitMachine: PEEK: 这个1K Token地图刚刚终结了长上下文税 你的LLM代理正在读取同一个50K Token的代码库……

X AI KOLs Timeline 论文

摘要

微软推出了PEEK,一个1,024 Token的'上下文地图',为LLM代理缓存定位知识,减少冗余推理,实现了高达34%的准确率提升,减少93-145次重试,成本降低5.8倍。

# PEEK: 这个1K Token地图刚刚终结了长上下文税 你的LLM代理正在第20次读取同一个50K Token的代码库。 它仍然不知道任何东西在哪里。 来自@Microsoft的PEEK刚刚用一个1K Token的"上下文地图"改变了这一切: • ↑ 34% 准确率 • ↓ 93–145 次更少重试 • 比提示微调便宜5.8倍 实现方法: 每次你对同一个代码库向GPT-5提出新问题时,它都会重新发现: → 文件结构 → 关键类 → 模块如何连接 你为同样的定位工作付费。一次又一次。 业界称之为"长上下文税"。 PEEK的突破: 将"上下文理解"与"任务执行"分开。 并非将所有内容塞入提示或盲目检索,代理现在维护一个微小但持久的地图——就像一份他们写一次并永远重复使用的速查表。 上下文地图有5个部分: 上下文路线图——高层结构 上下文理解——关键实体/关系 领域常量(如果需要) 解析模式 可重用结果(缓存答案) 预算:正好1,024个Token。 三个模块保持其新鲜而不臃肿: 提炼器(Distiller)→ 只提取可转移的定位知识 制图师(Cartographer)→ 进行干净的去重编辑(添加/删除/替换) 驱逐器(Evictor)→ 当预算满时丢弃低优先级项目 分离很重要:混合角色=噪声+重复。 在OOLONG + CL-bench(编码基准)上测试: | 指标 | 与ACE(SOTA)的增益 | |------|---------------------| | 准确率 | +6–34% | | 节省的迭代次数 | 93–145 更少 | | 成本降低 | 1.4–5.8× 更便宜 | 相同的基础模型。相同的代理。只需1K Token的定位缓存。 以下是效率秘诀: 在1-4次查询后冻结地图。 你将获得80%以上的收益,之后维护成本几乎为零。 大多数"学习"系统从不停止更新→浪费计算资源。 PEEK快速学习,然后锁定。 PEEK如何击败其他方案: RAG:检索片段,没有整体结构 摘要:压缩内容,而不是定位 ACE/提示微调:优化任务,而不是上下文理解 PEEK:缓存你的代理本应在第一天就构建的心理模型 反面观点: 当上下文结构化且查询重复时,PEEK胜出。 如果你在编写一次性创意小说或闲聊随机PDF,地图可缓存的内容较少。 但对于代码库、企业文档、分析?这是新的基线。 传统栈: → 更大的上下文窗口 → 更好的检索 → 更智能的提示 新栈: → 更大的上下文窗口 → 更好的检索 → 持久化的定位缓存 上下文理解现在成为一级版本化工件。 你现在可以叠加的两个乘数: PEEK风格的地图(↓ 冗余推理) KV缓存优化(↓ 冗余Token处理) 组合它们=倍增的推理节省。 下一波代理基础设施将默认同时包含这两者。 如果你正在构建与相同长上下文反复交互的代理: → 停止每次查询重新设计提示 → 开始缓存定位知识 1K Token地图是缺失的缓存层。使用它。 /end
查看原文
查看缓存全文

缓存时间: 2026/05/23 16:13

PEEK:仅用1k Token的「上下文地图」终结长上下文税

你的LLM代理正在第20次阅读同一个5万token的代码库。

它依然不知道任何东西在哪里。

微软的PEEK刚刚用1k token的「上下文地图」改变了这一切,它能:

• 准确率提升34% • 减少93–145次重试 • 成本比提示调优低5.8倍

原理如下:

每次你针对同一个仓库向GPT-5提出新问题时,它都会重新探索:

→ 文件结构 → 关键类 → 模块如何连接

你一次次为同样的「定向工作」买单。

行业称之为「长上下文税」。

PEEK的突破:

将「上下文理解」与「任务执行」分离。

不再把所有内容塞进提示词或盲目检索,而是让代理维护一个微小的持久化地图——就像一张「作弊小抄」,写一次就能永久复用。

上下文地图包含5个部分: 上下文路线图 — 高层结构 上下文理解 — 关键实体/关系 领域常量(按需) 解析模式 可复用结果(缓存答案)

预算:严格控制在1,024 token。

三个模块让地图保持新鲜且不膨胀:

提炼器 → 仅提取可迁移的定向知识 制图师 → 执行干净、去重的编辑(添加/删除/替换) 驱逐器 → 预算满时丢弃低优先级项目

分离很重要:角色混合 = 噪声 + 重复。

在OOLONG + CL-bench(编码基准)上测试:

指标相对于ACE(最先进水平)的提升准确率+6–34%节省迭代次数93–145次成本降低1.4–5.8倍

相同的基础模型,相同的代理。仅1k token的定向缓存。

这是效率秘诀:

在1–4次查询后冻结地图。

你将获得80%以上的收益,之后维护成本几乎为零。 大多数「学习」系统从未停止更新 → 浪费计算资源。 PEEK快速学习,然后锁定。

PEEK如何超越其他方案:

RAG:检索片段,缺乏整体结构 摘要:压缩内容,而非定向知识 ACE/提示调优:优化任务,而非上下文理解 PEEK:缓存代理第一天就应该建立的心智模型

冷静思考:

当上下文结构化和查询重复出现时,PEEK表现出色。

如果你在写一次性创意小说或闲聊随机PDF,地图可缓存的内容较少。 但对于代码仓库、企业文档、分析场景?这将成为新基线。

传统技术栈: → 更大的上下文窗口 → 更优的检索 → 更聪明的提示词 新技术栈: → 更大的上下文窗口 → 更优的检索 → 持久化的定向缓存

上下文理解正式成为一等公民的版本化资产。

今天就可以叠加使用的两个倍增器:

PEEK式地图(减少冗余推理) KV缓存优化(减少冗余Token处理) 二者结合 = 推理成本倍增式下降。

下一代代理基础设施将默认内嵌这两者。

如果你正在构建需要反复与相同长上下文交互的代理:

→ 停止每次查询都重新设计提示词 → 开始缓存定向知识

这1k token的地图就是缺失的缓存层。使用它。

/结束

相似文章

PEEK:长上下文LLM代理的上下文图方向缓存

Hugging Face Daily Papers

本文介绍了PEEK系统,该系统将关于重复出现的外部上下文的定向知识缓存为上下文图,使得LLM代理能够跨调用复用上下文知识,并在长上下文推理和信息聚合任务上显著提高效率和准确性。

TokenPilot:面向LLM代理的缓存高效上下文管理

Hugging Face Daily Papers

TokenPilot是一个双粒度上下文管理框架,通过稳定提示前缀和保守管理上下文片段,降低长时程LLM会话中的推理成本。在基准测试中实现了61-87%的成本降低,同时保持竞争性性能。