每次我聘请一位语言学家,推理成本就会降低:论语言规则作为有效的提示压缩器
摘要
本文提出仅使用语言规则作为提示压缩器,无需LM前向传递,在轻度到中度压缩下达到与先进策略相似的性能。
arXiv:2607.25335v1 公告类型:新
摘要:提示压缩通过缩短大语言模型输入来降低推理成本,但现有方法通过LM前向传递来评分token重要性。这种细致且昂贵的token选择是否必要仍存疑问。压缩需要识别信息丰富的内容,而语言学研究长期以来通过可操作化为确定性规则的线索来处理这一问题。因此,我们提出疑问:能否\textbf{仅使用语言规则}作为有效的提示压缩器,而无需在压缩时进行基于LM的评分?
为了解决这个问题,我们进行离线进化搜索,基于词汇、句法、语义和语篇种子寻找有竞争力的规则组合。由此产生的语言压缩器在部署时无需LM前向传递,仅使用CPU端处理进行压缩。我们采用双路径协议来平衡压缩质量和重建保真度进行评估。
在短段落、多文档推理和对话记忆问答数据集上,进化压缩器的性能与近期先进的提示压缩策略相当。在轻度到中度压缩下性能最强,随着压缩变得更加激进而下降,而直接路径和重建路径表现出不同的模式。进化分析表明,有效压缩融合了跨语言层次的信号,并且随着压缩比增加,规则从token剪枝转变为句子提取。
查看缓存全文
缓存时间: 2026/07/29 09:55
# 每次雇佣语言学家,推理成本就下降:论语言规则作为有效的提示压缩器 来源:https://arxiv.org/abs/2607.25335 查看 PDF (https://arxiv.org/pdf/2607.25335) > 摘要:提示压缩通过缩短大语言模型的输入来降低推理成本,但现有方法需要通过语言模型前向传播来评估 token 的重要性。这种细微且昂贵的 token 选择是否必要,仍然值得探讨。压缩需要识别信息含量高的内容,而语言学研究早已通过可操作化为确定性规则的线索来应对这一问题。因此我们提问:**仅凭语言规则**(不依赖基于语言模型的压缩时评分)能否成为有效的提示压缩器?为此,我们通过离线进化搜索,对词汇、句法、语义和语篇层面的种子进行探索,以找到有竞争力的规则组合。最终得到的语言压缩器在部署时无需语言模型前向传播,仅使用 CPU 端处理即可完成压缩。我们采用双路径实验协议来平衡压缩质量与重建保真度。在短文本、多文档推理和对话记忆问答数据集上,进化得到的压缩器达到了与近期先进提示压缩策略相当的性能。在轻到中度的压缩下表现最强,随着压缩率增大性能下降,同时直接路径和重建路径表现出不同的模式。进化分析表明,有效的压缩融合了多个语言层面的信号,并且随着压缩比增加,规则从 token 剪枝转向句子提取。 ## 提交历史 来自:赵心峰 [查看邮箱 (https://arxiv.org/show-email/7be03a68/2607.25335)] **[v1]** 2026年7月28日星期二 06:33:27 UTC (735 KB)
相似文章
压缩中的迷失:抽取式提示压缩器的跨语言可控审计
本文对十种语言的抽取式提示压缩器进行了审计,揭示了经过英语训练的模型在高压缩率下对非英语文本存在显著性能差距,并提出了一种更有效的“先翻译再压缩”流程作为替代方案。
AGORA: 基于适配器的观测-动作保留——用于LLM代理的无推理提示压缩
AGORA 引入了一种用于LLM代理的无推理步骤级提示压缩器,避免了令牌级压缩器的'动作语法破坏'失效模式。它通过结构解析器、始终保留底限以及学习的相关性评分器,在9个环境中的8个(跨骨干网络)保留了≥75%的未压缩性能。
词汇提示压缩用于大型语言模型:一个无需训练、确定性的管道,包含十一个任务类别的实证帕累托分析
本文介绍了一种用于大型语言模型词汇提示压缩的无需训练、确定性处理流程,包含十一个任务类别的实证帕累托分析。
扩散以压缩:利用扩散语言模型实现无损压缩
本文介绍了扩散语言模型(DLMs)作为一种新的无损文本压缩推理范式,旨在克服基于自回归LLM的压缩器的吞吐量瓶颈,同时实现最先进的压缩率。
CAVEWOMAN: 大型语言模型在语言输入和输出压缩下的行为研究
本文介绍了CAVEWOMAN,一种双通道评估协议,用于评估语言输入和输出压缩对LLM的影响。研究发现,输出压缩可降低成本,而输入压缩则会增加成本并降低准确性,挑战了常见的“穴居人风格”建议。