标签
A detailed walkthrough explains how Claude Shannon's 1948 information theory underlies LLMs and shows that the 'next-token prediction' story is misleading, linking compression and prediction mathematically.
K 和 Q 编程语言的新运行时,利用 SIMD、并行、融合和压缩技术重新构想执行方式,以更好地发挥现代硬件的性能。
SelKV 是一个无需训练的 KV 缓存压缩框架,它使用软余弦门进行选择性合并,并通过注意力比例补偿机制纠正 softmax 不平衡,在仅保留 25% 缓存大小的情况下实现近乎无损的生成,在 LongBench 上取得 3.3 倍解码加速。
PostgreSQL 19 计划将默认的 TOAST 压缩算法从 pglz 改为 LZ4,提供更好的性能和效率。文章介绍了 Postgres 压缩的历史以及切换的原因。
一个由爱好者组成的社区成功在15000美元的预算下,使用REAP剪枝和2位GGUF量化,以接近无损质量运行了753B参数的GLM-5.2混合专家模型,牺牲吞吐量以降低成本。
介绍VarRate,一种无训练的KV缓存压缩方法,根据查询显著性为每个令牌分配可变低秩预算,避免了不可逆的令牌驱逐,并且在LongBench上以匹配的内存预算优于均匀秩方法。
提出循环隐注意力(LLA),一种训练后编解码器,通过利用递归步骤间的低秩结构压缩循环变压器中的KV缓存,在保持性能的同时实现显著压缩比。
本文提出一种视频编解码器,将视频和音频存储为正弦表示网络(SIREN)的权重,利用知识蒸馏和量化进行压缩。实验显示,与原始网络相比压缩比为2.61倍,但质量落后于H.264和HEVC等标准编解码器。
一位从业者推荐了一场免费的33分钟关于交叉熵的讲座,该讲座将语言模型重新定义为压缩而非下一个词预测,并比作斯坦福机器学习博士资格考试。
研究人员提出Latent Thought Flows,将256个文本令牌压缩为8个连续潜变量,实现单步生成,在推理计算与生成质量的帕累托前沿上优于自回归基线。
推荐6个免费开源的Mac实用工具,包括IINA视频播放器、Stats系统监控、MonitorControl外接显示器控制、Ice菜单栏管理、AltTab窗口切换、Keka压缩解压。
ShortOPD提出了一种短到长的在策略蒸馏方案,通过将训练集中在有效前缀上,恢复用于自由形式生成的剪枝后大语言模型,相较于未恢复模型实现了高达9倍的改进,并以四分之一的训练时间达到了长视界蒸馏的效果。
该工具将6000万个文本块从201GB压缩到6GB,用于RAG且精度无损,使得在笔记本上实现强大的本地检索增强生成成为可能。
misa77 是一种基于 LZ 的新型编解码器,其解压吞吐量比 LZ4 快达 2 倍,同时还能提供更好的压缩比。它适用于一次写入多次读取的工作负载,并且内存占用恒定。
Google 开源了一个向量索引,将 31GB 的 AI 内存压缩到 4GB,可容纳 1000 万文档,搜索速度比 FAISS 更快,且无需训练或 GPU。
本文在查询无关协议下审计了六种KV-cache压缩方法,发现与查询感知评估相比,排名发生了显著变化,这对长上下文推理中的缓存重用具有重要意义。
本文对KV缓存压缩方案(TurboQuant和SpectralQuant)进行了系统的比较研究,介绍了一种统计验证方法,并针对高效Transformer推理提供了特定场景下的建议。
uv 的锁文件大小通过压缩环境标记减少了 40-50%。
一篇技术博客文章,探讨在ComputerCraft程序环境下,通过选择最优表示方式(引号字符串与原始字符串)来减小Lua字符串字面量大小的方法,实现了400字节的节省。