PorTAL(1分钟阅读)
摘要
介绍Latent Briefing,一种通过KV缓存压缩实现多智能体系统通信的方法,在保持相同准确率的情况下减少31%的令牌使用,并实现高达20倍的加速。
Ramp Labs已开源PorTAL,这是一个用于共享任务表示和跨模型LoRA适配的框架。PorTAL学习一个与基础模型无关的任务潜在表示和一个轻量级的逐基础对齐,生成普通的逐层LoRA权重。一个任务可以训练一次,然后适配到支持的冻结基础模型,并导出为标准Hugging Face PEFT适配器。
查看缓存全文
缓存时间: 2026/07/28 18:22
# @RampLabs 在 Thread Reader App 上的推文
来源:https://threadreaderapp.com/thread/2081819550329327689.html
介绍 Latent Briefing,一种让智能体直接快速共享相关记忆的方式。结果:使用减少 31% 的 token,精度保持不变。
多智能体系统功能强大,但可能极其低效。它们以 token 形式传递上下文,导致成本飙升、信号丢失。我们构建了一种算法,允许智能体在 KV cache 之间直接通信。视频海报
智能体需要共享上下文,但在 token 空间进行操作存在实际权衡:
• LLM 摘要:缓慢(20-60秒),有损,且常常遗漏下一个智能体真正需要的内容 • RAG:将上下文分割成块,导致文档间的关系丢失 • 传递完整上下文:昂贵、嘈杂,且经常降低准确性
我们的方法完全跳过 token。我们在 KV cache 上操作,利用工作智能体自身的注意力模式,从编排智能体的记忆中提取相关部分,丢弃其余部分。视频海报
我们基于注意力匹配(Attention Matching, AM)KV cache 压缩框架进行了适配。AM 算法通过修正项压缩 KV cache(C1, β, C2),保留注意力输出。
我们对算法进行了修改,使其可用于推理:1. 使用工作智能体的任务查询(而非自注意力)对 token 评分 2. 跨所有头的全局掩码 → 支持大规模批处理 3. MAD 归一化阈值实现自适应压缩
结果:320 次序列求解 → 2-3 次批处理操作。速度提升 20 倍,中位数耗时 1.7 秒。图片(https://pbs.twimg.com/media/HFkIHUvbQAAdO-l.jpg)
相似文章
见我所见,知我所想:异构智能体间的密集潜在通信
本文提出一种利用对齐的KV缓存变换在异构多智能体系统间进行密集潜在通信的方法,相比基于文本的方法,性能更优且计算成本更低。
代理中的提示缓存
本文解释了提示缓存在大语言模型代理中的工作原理,涵盖 KV 缓存机制、预填充和解码阶段,以及其对延迟、成本和代理设计的影响。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2074502882812952666
一份关于KV缓存管理的实践指南,介绍开源LMCache架构,该架构通过消除代理工作流中的冗余上下文处理,将输入令牌成本降低90%,并将LLM推理速度提升高达14倍。
@bojie_li:如果你在生产环境中运行LLM智能体,你就会明白其中的代价。每一轮都要重新读取相同的长上下文——系统策略、工具……
研究人员提出了可编程KV缓存(Programmable KV Cache),这是一种用于编辑和组合KV缓存的方法,旨在避免LLM智能体推理过程中重新预填充长上下文,在保持决策一致性的同时,将p90首令牌时间减少了53至398倍。
面向LLM-Agent工作流中并行分支的直接潜在空间合成
介绍Parallel-Synthesis框架,该框架能够直接消费来自并行工作代理的KV缓存,将首令牌时间减少2.5倍至11倍,同时在代理任务上保持或提升性能。