标签
介绍了一种名为Uncheatable Eval的动态基准测试方法,该方法利用压缩率评估语言模型性能,并能有效缓解数据污染问题。
一位开发者分享了使用 zigzag delta 编码和 LZ4 进行索引值块压缩的进展,旨在通过提高压缩效率节省大约 4 TB 的磁盘空间。
提出了粒球量子聚类(GBQC),该框架结合粒球结构抽象与量子特征学习,以减少计算开销,并在多种数据集上提升聚类准确性和鲁棒性。
BZip3 是一种高性能的压缩工具,与前驱 BZip2 相比,提供更优的压缩率和速度,利用先进的算法如上下文混合熵编码和 Burrows-Wheeler 变换。
InferenceFS 是一款文件系统工具,利用大型语言模型的潜空间从文件名推断文件内容,通过依赖外部AI后端如Claude和Gemini,提供理论上的无限压缩。
一条推文强调实现了64倍压缩比,且质量几乎无损失,赞扬了 @yjoonjang 的工作。
KATok是一种自适应视频分词器,通过选择性丢弃信息量不足的令牌来实现数据依赖压缩,提升基于扩散的视频生成中的空间一致性。
本文分析了基于机器学习的数据压缩的环境收支平衡点,估算了训练和推理的碳当量成本,并与减少磁盘存储带来的节省进行对比。
介绍了迭代张量网络变换(ITNTs),用于在张量列上高效逐元素评估非线性函数,实现对大规模数据集的数据处理和优化,应用领域包括反应流场和Max-SAT问题。
本文介绍ALP,一种针对IEEE 754浮点数据的最先进的无损压缩算法,利用十进制和高精度模式。它在解码速度、压缩比和压缩速度方面表现出色,获得了SIGMOD最佳构物奖。
Iwo Kadziela 创建了一种方法,利用 deflate 压缩和 JavaScript 的 DecompressionStream API,仅用445字节数据生成可信的ASCII世界地图。
解释Burrows-Wheeler变换的两种变体(循环移位和后缀)以及快速计算方法,面向数据压缩爱好者。
探讨了是否可以通过刻意对训练数据进行过拟合来使用小型语言模型(SLMs)实现无损数据压缩,反思机器学习中通常对过拟合的厌恶。
一位开发者使用一个小型900KB的Transformer模型进行过拟合,将100MB的CSV文件压缩到7MB,展示了一种使用过拟合神经网络进行数据压缩的新颖方法。
这篇博客分析了PivCo-Huffman论文,该论文引入了并行Huffman解码的“合并”操作,无需交错开销即可实现高效的向量化和GPU友好解码。
一个新的开源仓库将6000万个文本块从201 GB压缩到6 GB,且准确率零损失,这使得向量数据库在许多使用场景下可能变得过时。
本文探讨了使用变分自编码器学习大规模X射线散射数据的潜在表征,从而实现高效的数据压缩和分析。
这个仓库将201GB文本压缩至6GB,且无精度损失,比向量数据库小97%。它可本地运行,并为Claude提供即插即用的MCP,完全开源且私密。