Mixture-of-Translators: 跨异构大语言模型的KV缓存翻译
摘要
本文介绍了Mixture-of-Translators(MoT),一个跨异构大语言模型翻译KV缓存的框架,使得不同架构之间能够复用缓存。实验表明,在Qwen2.5、GPT-2和OPT模型上,问答性能和长上下文质量得以保持。
arXiv:2607.28979v1 公告类型:新
摘要:异构大语言模型(LLM)系统越来越依赖于共享上下文、检索到的证据和多智能体对话历史,然而它们内部的键值(KV)缓存仍是模型特有的,无法跨架构复用。因此,每个模型都必须为相同上下文重复进行预填充或存储缓存,这限制了多模型推理和长上下文生成的可扩展性。我们提出了Mixture-of-Translators(MoT),一个缓存翻译框架,将源LLM的上下文KV缓存映射到目标LLM的缓存空间中。与依赖单一投影路径或全局共享潜在空间的先前方法不同,MoT使用多个翻译器模块来捕获多样的源-目标映射。为了进一步减少残余翻译误差,我们引入了上下文校正损失(Context Correction Loss),将重放的目标轨迹与原生目标轨迹对齐。我们揭示了缓存翻译中两种相互竞争的失败模式:早期注入引起的传播翻译偏移,以及晚期注入引起的最后状态偏移。MoT通过翻译器混合和目标侧校正来解决这些问题。在Qwen2.5、GPT-2和OPT模型之间的同质和异构翻译中,MoT保持了下游问答性能,包括Qwen2.5-7B规模翻译,平均闭集问答准确率为51.0%,平均抽取式问答F1为0.43。在实际案例研究中,MoT为多智能体推理实现了保质量的记忆复用,并在长上下文缓存增强生成中保留了直接上下文质量的96.3%,展示了跨异构LLM的可扩展KV缓存复用。
查看缓存全文
缓存时间: 2026/08/03 07:34
# Mixture-of-Translators:跨异构大语言模型的KV缓存翻译 来源:https://arxiv.org/abs/2607.28979 查看 PDF (https://arxiv.org/pdf/2607.28979) > 摘要:异构大语言模型(LLM)系统越来越依赖共享上下文、检索到的证据和多智能体对话历史,然而其内部键值(KV)缓存仍然是模型特定的,无法跨架构复用。因此,每个模型都必须针对相同上下文反复预填充或存储缓存,这限制了多模型推理和长上下文生成的可扩展性。我们提出了 Mixture-of-Translators(MoT),一个缓存翻译框架,可将源 LLM 的上下文 KV 缓存映射到目标 LLM 的缓存空间。与先前依赖单一投影路径或全局共享潜在空间的方法不同,MoT 使用多个翻译器模块来捕捉多样化的源-目标映射。为了进一步减少残余翻译误差,我们引入了上下文校正损失(Context Correction Loss),将重放的目标轨迹与原生目标轨迹对齐。我们揭示了缓存翻译中两种相互竞争的失败模式:早期注入导致的传播性翻译偏移,以及晚期注入导致的最后状态偏移。MoT 通过翻译器混合和目标侧校正来应对这些问题。在 Qwen2.5、GPT-2 和 OPT 模型之间的同构和异构翻译实验中,MoT 保持了下游问答性能,包括 Qwen2.5-7B 规模的翻译,平均闭集问答准确率为 51.0%,平均抽取式问答 F1 为 0.43。在实际案例研究中,MoT 实现了多智能体推理的保质量记忆复用,并在长上下文缓存增强生成中保留了直接上下文质量的 96.3%,展示了跨异构大语言模型的可扩展 KV 缓存复用能力。 ## 提交历史 来自:Jin-Woo Lee [查看电子邮件 (https://arxiv.org/show-email/8761da67/2607.28979)] **[v1]** 2026年7月31日 星期五 03:07:31 UTC (2,053 KB)
相似文章
异构语言模型间的双缓存潜空间通信
本文介绍了XKV,一种用于多智能体系统中异构语言模型间高效潜空间通信的方法,在准确性和速度上优于现有的基于文本和缓存的协议。
Cache-to-Cache:大型语言模型之间的直接语义通信 (2025)
本文提出Cache-to-Cache(C2C)这一新范式,利用KV-Cache实现大型语言模型之间的直接语义通信,相比基于文本的方法,能提升响应质量并减少延迟。
面向高效大语言模型服务:系统感知KV缓存优化综述
一篇系统综述,回顾系统感知的KV缓存优化技术,用于高效的大语言模型服务,将现有工作组织为执行/调度、放置/迁移和表示/保留三个维度。
为扩散语言模型启用共享前缀的KV缓存
本文提出BiCache,一种面向扩散语言模型共享前缀的新型KV缓存技术,通过动态重用浅层中缓存的键和值来避免精度崩溃,并实现36.3%–98.3%的吞吐量提升。
Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译
Mix-MoE提出了一种混合专家混合框架,通过专门的专家组和傅里叶变换增强的路由机制来缓解多语言机器翻译中的参数干扰,相比基线方法取得了显著改进。