@nathanrs:我前几天发现,任何压缩工具都可以被扭曲用于语言建模。结果发现 gzip 可以生成…
摘要
该推文说明了任何压缩工具(包括 gzip)都能被改装用于语言建模,而且 gzip 可以生成颇为类似莎士比亚风格的文本。并附有相关文章链接。
我前几天发现,任何压缩工具都可以被扭曲用于语言建模。结果发现 gzip 可以生成有些*类似*莎士比亚的文本。短篇撰文链接如下:https://t.co/KfRi5P3gRo
查看缓存全文
缓存时间: 2026/06/17 01:42
我前几天发现,任何压缩工具都可以扭曲成做语言建模。原来 gzip 能生成一些有点像莎士比亚风格的文本。简短的文章链接如下 https://t.co/KfRi5P3gRo
相似文章
gzip能成为语言模型吗?
本文探讨了将gzip压缩算法用作语言模型的可行性,展示了压缩算法可以通过基于压缩长度对候选续文进行评分并利用束搜索来生成文本。
@0x0SojalSec: 这个工具将6000万个文本块从201GB压缩到仅6GB,且精度无损,可在本地笔记本上运行
该工具将6000万个文本块从201GB压缩到6GB,用于RAG且精度无损,使得在笔记本上实现强大的本地检索增强生成成为可能。
@HongcanGuo: 一种全新的文本建模方法
一位名叫HongcanGuo的研究人员透露了一种全新的文本建模方法,但推文未提供技术细节。
# 巴别塔的大语言模型
本文反思了文本生成的历史,在现代大语言模型(如 GPT-4)与豪尔赫·路易斯·博尔赫斯和克劳德·香农的早期概念之间建立了联系。文章探讨了香农的概率实验以及博尔赫斯“巴别图书馆”的隐喻,如何有助于阐明关于生成文本本质和数据结构的根本问题。
@mihirp98: 图像、视频、音频、动作——生成式建模已趋同于一个范式:压缩成连续潜变量,生成…
研究人员提出Latent Thought Flows,将256个文本令牌压缩为8个连续潜变量,实现单步生成,在推理计算与生成质量的帕累托前沿上优于自回归基线。