标签
本文对KV缓存压缩方案(TurboQuant和SpectralQuant)进行了系统的比较研究,介绍了一种统计验证方法,并针对高效Transformer推理提供了特定场景下的建议。
uv 的锁文件大小通过压缩环境标记减少了 40-50%。
一篇技术博客文章,探讨在ComputerCraft程序环境下,通过选择最优表示方式(引号字符串与原始字符串)来减小Lua字符串字面量大小的方法,实现了400字节的节省。
Kevin Kelly 认为,AI模型中的潜空间代表所有人类知识的压缩形式,这种潜空间将成为一种新的创造性媒介,使得新颖的艺术和科学探索成为可能。
一种无需量化或重新训练即可从 GLM-5.2(753B 权重)中移除 423 GB 的技术,通过在 VRAM 中保持权重压缩状态实现逐比特精确压缩。
Nigel Tao介绍了Handsum,一种基于DCT的新型固定大小LQIP图像文件格式,与JPEG相比,提供可预测的文件大小和简单性。
KQ-SVD是一种新的KV缓存压缩方法,它通过最优低秩分解直接近似注意力矩阵,在LLaMA和Mistral模型上实现了比仅键SVD低5-10倍的误差。
本文介绍了Maestro,一种针对混合专家语言模型的结构化剪枝框架。该框架利用马尔可夫链对专家激活轨迹进行建模,实现全局感知剪枝,在50%压缩率下,性能优于基线模型最高达10.61%。
一篇直观、可视化的信息论入门介绍,涵盖熵、互信息和信道容量,仅需基础概率知识。该论文阐述了压缩和传输的基本极限。
本文提出了一种基于可控性-可观测性的框架,通过减少隐藏状态冗余来压缩深度神经网络,在MNIST和CIFAR-10数据集上实现了显著压缩,且精度损失极小。
本文提出了一种新的结构序列分析方法,采用Ladderpath方法提取嵌套和层次重复结构,定义了三种距离度量,在分布外和少样本文本分类任务中优于基于gzip的NCD和BERT,提供了一种轻量级、可解释的替代方案。
本文提出了一个负载感知的基准测试,在长上下文LLM服务任务上比较了KV-cache压缩技术(量化、剪枝、合并),发现仅压缩比不足以预测性能,并倡导负载感知的选择。
一种名为.splat4d的新型4D高斯splat格式,具有可调误差边界,对原始splat的压缩比为16-58倍,并支持动态场景的原生HTTP Range流式传输,代码和演示已提供。
这条推文质疑一项新发现是否能够解决关于压缩KV缓存是否损害LLM推理性能的争论。
本文从理论上刻画了变压器中KV缓存压缩的极小极大风险,为因果掩码下的精确压缩提供了设计原则,并将其实例化到实用算法中,在LongBench上取得了有前景的结果。
探讨了是否可以通过刻意对训练数据进行过拟合来使用小型语言模型(SLMs)实现无损数据压缩,反思机器学习中通常对过拟合的厌恶。
MosaicKV引入了用于长上下文LLM服务的动态二维KV缓存压缩,实现了高达16倍的注意力加速和3倍的内存减少,且精度损失极小。
本文讲述了WinRAR背后的俄罗斯程序员尤金·罗沙尔的故事,包括他在苏联时期的编程背景、1993年自研压缩算法、1995年推出WinRAR,以及40天试用设计的精妙商业策略:不限制功能只弹窗提醒,让个人免费使用形成生态,迫使企业批量采购授权,同时开放解压代码但封闭压缩算法以维持市场壁垒。
一位开发者尝试使用ASCII字符和deflate-raw压缩技术,在500字节内创建可识别的世界地图,尽管未压缩文本为8,523字节,仍实现了445字节的压缩地图。
LeanCTX已更新,作为管理AI代理工具输出的网关,压缩大数据,擦除秘密,并通过MCP集成外部工具,以防止令牌爆炸。