词汇提示压缩用于大型语言模型:一个无需训练、确定性的管道,包含十一个任务类别的实证帕累托分析
摘要
本文介绍了一种用于大型语言模型词汇提示压缩的无需训练、确定性处理流程,包含十一个任务类别的实证帕累托分析。
arXiv:2609.13154v1 Announce Type: new
摘要:大型语言模型(LLMs)的最新进展使得提示越来越庞大和复杂。诸如思维链推理(Wei等人,2022)和上下文学习(Brown等人,2020)等技术常常将实际提示推至数千个令牌,增加了推理成本和延迟。学习型压缩方法如LLMLingua(Jiang等人,2023)和Selective Context(Li等人,2023)实现了高压缩率,但需要辅助语言模型且具有非确定性。我们提出一个互补问题:基于经典词汇自然语言处理的无需训练、完全确定、仅CPU的管道,在输出质量显著下降之前能推进到何种程度?十一个可切换的词汇转换——停用词移除、填充短语删除、缩略语和缩写替换、基于词性的剪枝、词形还原、基于WordNet的同义词缩短以及命名实体保留——被组合成一个可配置的管道。在1,242个仅英语提示上评估了十五种配置,这些提示来自六个来源(Dolly-15k、LMSYS-Chat-1M、WildChat-1M、MMLU、GSM8K、HellaSwag),跨越十一个自动派生的任务类别,产生18,630对GPT-4o-mini完成结果。使用BLEU、ROUGE-1/2/L、BERTScore-F1和SentenceBERT余弦相似度来衡量输出保留度。最激进的配置实现了平均令牌减少40.3%(sigma = 9.2),BERTScore-F1为0.876,与原始提示输出相比;仅停用词配置实现了29.6%的减少,BERTScore-F1为0.913。压缩与保真度的帕累托前沿在每个任务类别中进行了表征,常识推理在激进压缩下是一个系统性的失败模式。所有代码、提示和每个单元格的结果均已发布以供重现。
查看缓存全文
缓存时间: 2026/09/15 08:31
# 面向大语言模型的词汇提示压缩:无需训练的确定性流程与十一类任务的实证帕累托分析 来源:https://arxiv.org/abs/2609.13154 文献工具 ## 文献与引用工具 文献资源浏览器切换 代码、数据、媒体 ## 与本文关联的代码、数据与媒体 演示项目 ## 演示项目 相关论文 ## 推荐器与搜索工具 关于arXivLabs ## arXivLabs:与社区协作者共同开展的实验性项目 arXivLabs是一个框架,允许协作者直接在我们的网站上开发和分享新的arXiv功能。 所有与arXivLabs合作的个人和组织均已认同并接受我们关于开放、社区、卓越与用户数据隐私的价值观。arXiv致力于这些价值观,并仅与遵守这些价值观的合作伙伴共事。 有一个能为arXiv社区增添价值的项目创意?**了解更多关于arXivLabs的信息**(https://info.arxiv.org/labs/index.html)。
相似文章
压缩中的迷失:抽取式提示压缩器的跨语言可控审计
本文对十种语言的抽取式提示压缩器进行了审计,揭示了经过英语训练的模型在高压缩率下对非英语文本存在显著性能差距,并提出了一种更有效的“先翻译再压缩”流程作为替代方案。
超越提示工程:提示词法敏感性的系统性分析及其对质量的影响
本文对大型语言模型中的提示词法敏感性进行了大规模分析,揭示了提示性能稳定性的缩放定律,并引入了一个自动化的Prompt-Refining Agent,以减少代码生成等任务中的性能方差。
从词元到词元对:临床预测中大语言模型的提示高效压缩
本文介绍了 MedTPE,一种针对大语言模型电子健康记录的高效无损提示压缩方法,可显著降低临床预测任务中的词元长度和推理延迟。
OmniPack:面向高效全模态大语言模型的统一令牌压缩
OmniPack提出了一种无需训练的全模态大语言模型令牌压缩框架,将LLM前结构化压缩与LLM内任务相关语义精炼相结合,在多个基准上实现了优异的性能-效率权衡。
每次我聘请一位语言学家,推理成本就会降低:论语言规则作为有效的提示压缩器
本文提出仅使用语言规则作为提示压缩器,无需LM前向传递,在轻度到中度压缩下达到与先进策略相似的性能。