更少Token,更小缓存:奖励协调的高效推理
摘要
本文提出ReCo,一种奖励协调的压缩框架,利用过程奖励估计器自适应压缩KV缓存、控制反思Token并启用早停,在保持准确率的同时,将推理模型的生成Token减少37%–65%,延迟降低约2倍。
arXiv:2608.04771v1 公告类型:新
摘要:大型推理模型(LRMs)通过长链式思维(CoT)推理在复杂任务上表现出色,但其冗长的中间步骤会导致严重的过度思考,从而增加推理成本。KV缓存压缩是一种常见解决方案,然而现有的面向推理的方法在整个轨迹上应用统一策略,并且仅根据从缓存中移除的内容来判断压缩效果。两个观察结果指向了另一个方向。首先,推理状态对上下文丢失的容忍度随轨迹而变化,过程奖励能够追踪这一点:在高奖励步骤删除Token比随机删除相同预算的Token能更好地保持准确率。其次,压缩在生成端并非没有代价,因为更小的缓存会导致模型生成更多Token,部分抵消了节省。这些共同促使我们基于单一过程奖励来协调两端。我们提出ReCo(奖励协调压缩),一种逐步框架,其中轻量级过程奖励估计器对每个完成的步骤进行评分,并驱动三个组件:(1)奖励自适应KV缓存压缩,在高奖励步骤更积极地缩小保留的缓存,在低奖励步骤则较不积极;(2)对反思Token的奖励带惩罚,以抑制冗余生成;(3)基于置信度的早停,在推理可靠时触发。在三个推理模型和六个基准测试中,与完整CoT相比,ReCo将生成Token减少37%-65%,端到端延迟降低2.08倍-2.35倍,同时基本保持准确率。
查看缓存全文
缓存时间: 2026/08/06 07:43
# 更少的Token,更小的缓存:奖励协调的高效推理
Source: https://arxiv.org/html/2608.04771
Qiyuan Zhu\(^{1*}\), Dezhi Li\(^{1*}\), Pengyu Cheng\(^{2*}\), Tianle Chen\(^{2}\), Jiacheng Wang\(^{2}\), Ruijie Shen\(^{3}\), Hao Gu\(^{1}\), Sida Lin\(^{1}\), Zirui Liu\(^{4}\), Jiacheng Liu\(^{1\dagger}\), Sirui Han\(^{1\dagger}\)
###### 摘要
大型推理模型(Large Reasoning Models, LRMs)通过长思维链(chain-of-thought, CoT)推理在复杂任务上表现出色,但其冗长的中间步骤会导致严重的过度思考,从而推高推理成本。KV缓存压缩是一种常见解决方案,但现有的面向推理的方法在整个轨迹上应用统一策略,并且仅根据压缩从缓存中移除了什么来判断压缩的效果。两个观察指向相反方向。首先,推理状态对上下文丢失的容忍度随轨迹变化,而过程奖励能够跟踪这种变化:删除高奖励步骤的Token比随机删除相同预算的Token能更好地保持准确率。其次,压缩在生成侧并非免费,因为更小的缓存会使模型生成更多Token,部分抵消节省。这两点共同促使我们在单一过程奖励下协调两侧。我们提出ReCo(Reward-Coordinated相似文章
ReCache:面向工具增强LLM代理的高效KV缓存重用与压缩
ReCache是一个用于工具增强LLM代理中高效KV缓存重用与压缩的框架,在保持性能的同时实现显著的加速和内存减少。
让每个 Token 都物尽其用:通过 KV 缓存淘汰提升长上下文性能
本文提出了一种基于学习的全局保留率 KV 缓存淘汰方法,通过选择性保留有用 Token 并减少注意力稀释来改善长上下文推理能力,同时显著降低内存占用。
KV-PRM: 通过KV缓存传输实现多智能体测试时间扩展的高效过程奖励建模
KV-PRM提出了一种过程奖励模型,利用KV缓存传输避免重新编码,在保持或提升推理基准性能的同时,实现了高达5000倍的FLOP减少。
面向长推理的信息感知KV缓存压缩
本文提出InfoKV,一种熵感知的KV缓存压缩框架,结合了token级别的预测不确定性和注意力分数,以提高长上下文推理效率。实验表明,它在Llama-3.1、Llama-3.2和DeepSeek-R1上优于现有的基于注意力的方法。
BeaconKV:基于信标查询的键值缓存压缩技术,用于高效大型推理模型推理
BeaconKV 是一种无需训练的方法,它使用信标查询来压缩键值缓存,以实现大型推理模型的高效推理,从而减少内存使用并提高吞吐量,且不牺牲准确性。