PorTAL(1分钟阅读)

TLDR AI 论文

摘要

介绍Latent Briefing,一种通过KV缓存压缩实现多智能体系统通信的方法,在保持相同准确率的情况下减少31%的令牌使用,并实现高达20倍的加速。

Ramp Labs已开源PorTAL,这是一个用于共享任务表示和跨模型LoRA适配的框架。PorTAL学习一个与基础模型无关的任务潜在表示和一个轻量级的逐基础对齐,生成普通的逐层LoRA权重。一个任务可以训练一次,然后适配到支持的冻结基础模型,并导出为标准Hugging Face PEFT适配器。
查看原文
查看缓存全文

缓存时间: 2026/07/28 18:22

# @RampLabs 在 Thread Reader App 上的推文 来源:https://threadreaderapp.com/thread/2081819550329327689.html 介绍 Latent Briefing,一种让智能体直接快速共享相关记忆的方式。结果:使用减少 31% 的 token,精度保持不变。 多智能体系统功能强大,但可能极其低效。它们以 token 形式传递上下文,导致成本飙升、信号丢失。我们构建了一种算法,允许智能体在 KV cache 之间直接通信。视频海报 智能体需要共享上下文,但在 token 空间进行操作存在实际权衡: • LLM 摘要:缓慢(20-60秒),有损,且常常遗漏下一个智能体真正需要的内容 • RAG:将上下文分割成块,导致文档间的关系丢失 • 传递完整上下文:昂贵、嘈杂,且经常降低准确性 我们的方法完全跳过 token。我们在 KV cache 上操作,利用工作智能体自身的注意力模式,从编排智能体的记忆中提取相关部分,丢弃其余部分。视频海报 我们基于注意力匹配(Attention Matching, AM)KV cache 压缩框架进行了适配。AM 算法通过修正项压缩 KV cache(C1, β, C2),保留注意力输出。 我们对算法进行了修改,使其可用于推理:1. 使用工作智能体的任务查询(而非自注意力)对 token 评分 2. 跨所有头的全局掩码 → 支持大规模批处理 3. MAD 归一化阈值实现自适应压缩 结果:320 次序列求解 → 2-3 次批处理操作。速度提升 20 倍,中位数耗时 1.7 秒。图片(https://pbs.twimg.com/media/HFkIHUvbQAAdO-l.jpg)

相似文章

代理中的提示缓存

Lobsters Hottest

本文解释了提示缓存在大语言模型代理中的工作原理,涵盖 KV 缓存机制、预填充和解码阶段,以及其对延迟、成本和代理设计的影响。