data-compression

标签

Cards List
#data-compression

Uncheatable Eval:基于动态压缩的语言模型评估方法

arXiv cs.CL ↗ · 5天前 缓存

介绍了一种名为Uncheatable Eval的动态基准测试方法,该方法利用压缩率评估语言模型性能,并能有效缓解数据污染问题。

0 人收藏 0 人点赞
#data-compression

你这周在做什么?

Lobsters Hottest ↗ · 2026-09-21 缓存

一位开发者分享了使用 zigzag delta 编码和 LZ4 进行索引值块压缩的进展,旨在通过提高压缩效率节省大约 4 TB 的磁盘空间。

0 人收藏 0 人点赞
#data-compression

将布尔标志压缩至11位

Hacker News Top ↗ · 2026-09-12

本文讨论了一种将布尔标志压缩至11位的方法,重点在于高效的数据编码技术。

0 人收藏 0 人点赞
#data-compression

资源高效且鲁棒学习的粒球量子聚类

arXiv cs.LG ↗ · 2026-09-10 缓存

提出了粒球量子聚类(GBQC),该框架结合粒球结构抽象与量子特征学习,以减少计算开销,并在多种数据集上提升聚类准确性和鲁棒性。

0 人收藏 0 人点赞
#data-compression

BZip3

Hacker News Top ↗ · 2026-09-07 缓存

BZip3 是一种高性能的压缩工具,与前驱 BZip2 相比,提供更优的压缩率和速度,利用先进的算法如上下文混合熵编码和 Burrows-Wheeler 变换。

0 人收藏 0 人点赞
#data-compression

InferenceFS:再也不用担心数据了!(真的!)

Lobsters Hottest ↗ · 2026-08-29 缓存

InferenceFS 是一款文件系统工具,利用大型语言模型的潜空间从文件名推断文件内容,通过依赖外部AI后端如Claude和Gemini,提供理论上的无限压缩。

0 人收藏 0 人点赞
#data-compression

@lateinteraction: 这显然是一个64倍压缩比,且质量几乎无损失——@yjoonjang 的作品真的很好!

X AI KOLs Following ↗ · 2026-08-27

一条推文强调实现了64倍压缩比,且质量几乎无损失,赞扬了 @yjoonjang 的工作。

0 人收藏 0 人点赞
#data-compression

KATok:用于紧凑视频表示的自适应分词器(保留或丢弃?)

Hugging Face Daily Papers ↗ · 2026-08-25 缓存

KATok是一种自适应视频分词器,通过选择性丢弃信息量不足的令牌来实现数据依赖压缩,提升基于扩散的视频生成中的空间一致性。

0 人收藏 0 人点赞
#data-compression

Green BOA:确定基于机器学习的数据压缩的环境收支平衡点

arXiv cs.LG ↗ · 2026-08-21 缓存

本文分析了基于机器学习的数据压缩的环境收支平衡点,估算了训练和推理的碳当量成本,并与减少磁盘存储带来的节省进行对比。

0 人收藏 0 人点赞
#data-compression

用于逐元素评估初等和滤波函数的迭代张量网络变换

arXiv cs.LG ↗ · 2026-08-19 缓存

介绍了迭代张量网络变换(ITNTs),用于在张量列上高效逐元素评估非线性函数,实现对大规模数据集的数据处理和优化,应用领域包括反应流场和Max-SAT问题。

0 人收藏 0 人点赞
#data-compression

ALP: 自适应无损浮点压缩

Lobsters Hottest ↗ · 2026-07-24 缓存

本文介绍ALP,一种针对IEEE 754浮点数据的最先进的无损压缩算法,利用十进制和高精度模式。它在解码速度、压缩比和压缩速度方面表现出色,获得了SIGMOD最佳构物奖。

0 人收藏 0 人点赞
#data-compression

仅用500字节构建世界地图

Simon Willison's Blog ↗ · 2026-07-04 缓存

Iwo Kadziela 创建了一种方法,利用 deflate 压缩和 JavaScript 的 DecompressionStream API,仅用445字节数据生成可信的ASCII世界地图。

0 人收藏 0 人点赞
#data-compression

后缀BWT与循环移位BWT及快速计算

Lobsters Hottest ↗ · 2026-07-04 缓存

解释Burrows-Wheeler变换的两种变体(循环移位和后缀)以及快速计算方法,面向数据压缩爱好者。

0 人收藏 0 人点赞
#data-compression

我们可以用SLMs压缩数据吗?

Reddit r/LocalLLaMA ↗ · 2026-07-03

探讨了是否可以通过刻意对训练数据进行过拟合来使用小型语言模型(SLMs)实现无损数据压缩,反思机器学习中通常对过拟合的厌恶。

0 人收藏 0 人点赞
#data-compression

将900KB Transformer过拟合,把100MB CSV压缩到7MB

Hacker News Top ↗ · 2026-06-23 缓存

一位开发者使用一个小型900KB的Transformer模型进行过拟合,将100MB的CSV文件压缩到7MB,展示了一种使用过拟合神经网络进行数据压缩的新颖方法。

0 人收藏 0 人点赞
#data-compression

PivCo-Huffman “合并”操作

Lobsters Hottest ↗ · 2026-06-22 缓存

这篇博客分析了PivCo-Huffman论文,该论文引入了并行Huffman解码的“合并”操作,无需交错开销即可实现高效的向量化和GPU友好解码。

0 人收藏 0 人点赞
#data-compression

@HowToPrompt__:向量数据库正式被终结。这个仓库将6000万个文本块从201GB压缩到仅6GB,且没有任何损失……

X AI KOLs Timeline ↗ · 2026-06-17 缓存

一个新的开源仓库将6000万个文本块从201 GB压缩到6 GB,且准确率零损失,这使得向量数据库在许多使用场景下可能变得过时。

0 人收藏 0 人点赞
#data-compression

数据压缩详解(2012)

Hacker News Top ↗ · 2026-06-16 缓存

一本全面介绍数据压缩技术的书籍,涵盖信息论、编码方法、建模和变换,面向具备数学能力的程序员。

0 人收藏 0 人点赞
#data-compression

解锁潜在维度:使用变分自编码器探索大规模X射线散射数据的表征

arXiv cs.LG ↗ · 2026-06-16 缓存

本文探讨了使用变分自编码器学习大规模X射线散射数据的潜在表征,从而实现高效的数据压缩和分析。

0 人收藏 0 人点赞
#data-compression

@HowToAI_: 这个仓库将201GB文本压缩至6GB,且不损失任何精度。→ 比向量数据库小97% → 本地运行 →…

X AI KOLs Timeline ↗ · 2026-05-15 缓存

这个仓库将201GB文本压缩至6GB,且无精度损失,比向量数据库小97%。它可本地运行,并为Claude提供即插即用的MCP,完全开源且私密。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈