构建了颜色频率压缩协议(MusCoRe),将24轮代理历史记录的令牌数量削减了71.9%——规格化一个边缘推理基准测试,以检验其是否能消除3B–7B模型对GPU的依赖
摘要
本文介绍MusCoRe,一种颜色频率压缩协议,可将AI代理对话的令牌使用量减少71.9%,实现在无GPU依赖的低资源设备上进行潜在本地推理。
嘿,r/AI_Agents,我一直在开发一个轻量级的AI-to-AI通信协议,名为MusCoRe,它使用颜色频率令牌而不是原始字母数字文本来编码代理对话历史。经验证的基准数据(区块链密封,由Claude和Grok独立确认):在24轮代理历史记录有效载荷上减少了89.4%的字节 在相同语料库上减少了71.9%的令牌 核心思想:在代理轮次之间传递数千个令牌的对话历史记录时,MusCoRe将状态压缩成紧凑的颜色频率表示。从数千个令牌缩减到12个令牌。 为什么这对本地推理重要:如今GPU被用于代理工作负载,不是因为注意力数学计算困难——而是因为为KV缓存提供数据的数据量太大,超出了CPU内存带宽的容量。MusCoRe直接解决了这个问题。 我们已经规格化了一个完整的边缘推理基准测试,测试MusCoRe压缩的上下文是否能在以下设备上实现可行的代理推理:Raspberry Pi 5(8GB,仅CPU)Intel N100 Mini PC(16GB,仅CPU)AMD Ryzen iGPU系统 预测:未压缩的24轮历史记录可能无法在8GB RAM中与3B模型一起存放。MusCoRe压缩的上下文应该能轻松容纳。 寻找拥有Pi 5或N100硬件的人来运行基准测试并挑战这些数据。 在开普敦构建,自学成才,已有四年经验。验证我,而非信任我。
相似文章
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2062553418460479577
一款名为Headroom的开源工具采用可逆的Compress-Cache-Retrieve架构,能将AI智能体上下文压缩高达90%,使模型能够在需要时检索原始细节,而非永久丢弃。
@omarsar0: NVIDIA 的压缩论文,相当惊艳。(记得收藏)更大的 MoE 模型在质量上持续胜出,但以交互延迟提供服务仍然困难…
NVIDIA 的论文介绍了 Puzzle-75B-A9B,这是一种压缩的混合 MoE 模型,能够在保持质量的同时将服务器吞吐量提高一倍,从而实现大型语言模型的成本高效部署。
更少Token,更小缓存:奖励协调的高效推理
本文提出ReCo,一种奖励协调的压缩框架,利用过程奖励估计器自适应压缩KV缓存、控制反思Token并启用早停,在保持准确率的同时,将推理模型的生成Token减少37%–65%,延迟降低约2倍。
编程智能体能否在不损失任务成功率的情况下,将新鲜模型流量减少57–85%?我开源了我的实验
作者开源了一个用于编码智能体的执行与上下文层,在GPT-5.6和Claude Opus 5上的配对冒烟测试中,将新鲜模型流量减少了57-85%,同时保持任务成功率,并寻求独立评估和赞助。
优化模型以快速进行代码生成(8分钟阅读)
Morph LLC描述了三种关键技术——基于编码输出训练投机模型、在廉价GPU上自动搜索内核、以及编写自定义互连——以大幅加速像Qwen和DeepSeek这样的开放模型在编码代理工作负载上的运行,实现了最高3倍的投机解码加速,并在7000美元的GPU上达到97-162 tok/s。