标签
Hard-KV 引入了级联缓存层次结构和 Logits 校准机制,以解决头部自适应 KV 缓存压缩中的静态-动态不匹配问题,在长上下文 LLM 推理中实现了高达 2 倍的吞吐量提升。
本文提出了一种用于脑MRI压缩驱动异常检测的量子自编码器,实现了高ROC-AUC分数,优于经典基线方法,并提供了可解释的异常热力图。
Whisper large-v3-turbo 已压缩至 368 MB,采用 Q3_K 匹配的量化感知训练,并报告了多语言词错误率结果。
解释了为什么在vLLM上部署推理模型时,驱逐90%的KV缓存token无法释放GPU内存,原因是分页注意力碎片化。同时介绍了NVIDIA的TriAttention解决方案,可实现2.5倍加速和10.7倍内存缩减。
本文提出InfoKV,一种熵感知的KV缓存压缩框架,结合了token级别的预测不确定性和注意力分数,以提高长上下文推理效率。实验表明,它在Llama-3.1、Llama-3.2和DeepSeek-R1上优于现有的基于注意力的方法。
ReFreeKV引入了一种无阈值的KV缓存压缩方法,自适应分配预算,消除了对输入特定阈值的需求,同时在各种数据集和模型大小上保持全缓存性能。
本文介绍了BabelTele,一种压缩写作风格,通过使用缩写、符号和多语言片段将文本长度减少72.1%,同时为LLM保留了99.5%的语义保真度,论证了人类可读性与机器可恢复性是可分离的。
本文提出了一种面向联邦分裂学习的自适应联合压缩与同步机制,用于减少物联网降雨预测中的通信开销,在不显著损失预测质量的前提下实现了显著的流量减少。
本文对图宾根因果对数据集上的双变量因果方向方法进行了同手重新评估,引入了一种无参数压缩基线,其表现与SLOPE持平。文章记录了已发表准确率因协议差异而虚高的情况,并公开了所有代码和数据。
一位开发者使用一个小型900KB的Transformer模型进行过拟合,将100MB的CSV文件压缩到7MB,展示了一种使用过拟合神经网络进行数据压缩的新颖方法。
博客文章探讨了通过对LZW编码进行穷举搜索来实现GIF图像的无损重新压缩,类似于PNG的Zopfli方法,以达到更小的文件大小。
文章描述了 libdeflate 新的级别13,这是一种故意减慢的 DEFLATE 压缩级别,在 Silesia 数据集上仅能实现微不足道的压缩提升(0.134%),但代价是比级别12慢56倍,专为数据压缩一次、解压多次的场景设计。
一条推文批评了token缩减的潮流,同时重点介绍了Headroom,这是Netflix工程师开发的开源工具,可在本地压缩LLM载荷,降低成本高达95%。
一个开源项目将6000万个文本块从201GB压缩至6GB,同时保持检索质量,实现97%的存储缩减,且无需GPU即可在普通笔记本上运行。
本文揭示了“基准幻觉”现象:经过剪枝的大语言模型在多项选择基准测试中表现良好,但在开放生成中却无法回答相同的问题,这表明压缩模型应针对生成任务进行测试,而不仅仅是识别任务。
本文表明,降低参数初始化规模能持续改善大型语言模型的预训练,且在推理密集型任务上收益最大。它发现了一种平衡推理与训练的关键初始化,并提出一个简单的γ-初始化规则。
本文探讨了将gzip压缩算法用作语言模型的可行性,展示了压缩算法可以通过基于压缩长度对候选续文进行评分并利用束搜索来生成文本。