compression

标签

Cards List
#compression

@nathanrs:我前几天发现,任何压缩工具都可以被扭曲用于语言建模。结果发现 gzip 可以生成…

X AI KOLs Following · 2026-06-16 缓存

该推文说明了任何压缩工具(包括 gzip)都能被改装用于语言建模,而且 gzip 可以生成颇为类似莎士比亚风格的文本。并附有相关文章链接。

0 人收藏 0 人点赞
#compression

Firefox 中的 zlib-rs

Lobsters Hottest · 2026-06-16 缓存

Firefox 现在使用 zlib-rs 进行 gzip 压缩,提升了性能和安全性,不过集成时需要为 Intel Raptor Lake CPU 的一个 bug 进行变通处理。

0 人收藏 0 人点赞
#compression

超越逐层稀疏性中的层重要性:一种层间扰动吸收视角

arXiv cs.CL · 2026-06-16 缓存

本文提出了一种用于大语言模型逐层稀疏性的层间扰动吸收视角,表明不同层对剪枝扰动表现出异质性响应,并引入了一种吸收感知校正方法,通过降低困惑度和提升准确率来改进现有剪枝方法。

0 人收藏 0 人点赞
#compression

@yukangchen_: 我们很高兴分享一篇新的技术文章《KV缓存压缩及其基础设施问题》。https://research.nvidia.…

X AI KOLs Timeline · 2026-06-16 缓存

NVIDIA Research发布了一篇技术博客,探讨KV缓存压缩技术及其基础设施问题,包括FlashAttention和paged attention如何为长上下文LLM的生产部署带来实际障碍,并提出了一个使用RoPE的几何解决方案。

0 人收藏 0 人点赞
#compression

TimescaleDB 如何压缩时间序列数据

Hacker News Top · 2026-06-15 缓存

本文解释了 TimescaleDB 的 hypercore 引擎如何通过列式存储以及 delta 编码和 Gorilla XOR 等专门算法,为时间序列数据实现高达 98% 的压缩率,并将其与 PostgreSQL 的 TOAST 进行了对比。

0 人收藏 0 人点赞
#compression

@songhan_mit:探索我们在KV缓存压缩方面的持续努力:

X AI KOLs Following · 2026-06-15 缓存

来自Song Han的一条推文强调了在KV缓存压缩方面的持续工作,其中介绍了Weian Mao的一篇博客,讨论了论文中常常被忽视的系统级方面。

0 人收藏 0 人点赞
#compression

创造性整合:一个可判定的创造力标准

arXiv cs.CL · 2026-06-15 缓存

本论文提出了一种基于冲突压缩比的可判定创造性整合标准,并通过可证伪测试进行验证。它操作化了真正的创造力压缩冲突这一概念。

0 人收藏 0 人点赞
#compression

TENP: 用于混合专家的梯形专家神经元剪枝

arXiv cs.LG · 2026-06-10 缓存

TENP 提出了一种用于混合专家大语言模型的结构化剪枝框架,该框架保留重要专家,对较不重要的专家进行神经元剪枝,从而在 Qwen 和 DeepSeek 模型上实现高稀疏度且精度损失极小。

0 人收藏 0 人点赞
#compression

UniSVQ: 2-bit统一标量-向量量化

arXiv cs.CL · 2026-06-10 缓存

UniSVQ提出了一种统一的2位量化框架,通过将码字参数化为整数格点的仿射变换,桥接了标量量化与向量量化,在标量方法中达到了最先进水平,并与向量方法性能相当且具有更高的吞吐量。

0 人收藏 0 人点赞
#compression

面向大语言模型的自适应多分辨率程序性知识压缩

Hugging Face Daily Papers · 2026-06-10 缓存

SKIM是一个自适应多分辨率软令牌压缩框架,用于压缩面向LLM的程序性技能,在降低预填充成本和延迟的同时保持任务性能。

0 人收藏 0 人点赞
#compression

@hasantoxr:向量数据库不再是云产品。它们正在变成 pip install。一个名为 turbovec 的新开源项目……

X AI KOLs Timeline · 2026-06-09 缓存

一个名为 turbovec 的开源项目在 GitHub 上获得了 1 万星标。它是一个基于 Rust、带有 Python 绑定的向量索引,使用谷歌研究的 TurboQuant 算法将嵌入压缩到接近理论香农极限,使得完全本地的 RAG(检索增强生成)成为可能——1000 万文档仅需 4 GB RAM,且搜索速度快于 FAISS。

0 人收藏 0 人点赞
#compression

决策感知记忆卡:面向工具使用LLM代理的反事实启发式上下文选择与压缩

arXiv cs.AI · 2026-06-09 缓存

介绍了CICL,一种决策感知上下文层,通过将上下文视为决策时刻的干预,使用反事实启发式评分和类型化记忆卡(受令牌预算限制),为工具使用的LLM代理选择和压缩证据。在SWE-bench和RepoBench上的实验显示,在检索准确性和行动关键性方面取得了实际提升。

0 人收藏 0 人点赞
#compression

语义缓存蒸馏:通过重用与选择性修补实现高效状态转移

arXiv cs.LG · 2026-06-09 缓存

本文提出语义缓存蒸馏(SCD),一种带损失约束的框架,用紧凑的语义码替换原始KV缓存传输,在保持生成质量在oracle的5% F1内的同时,实现高达2.65倍的TTFT加速。

0 人收藏 0 人点赞
#compression

NanoQuant的一种实现:一种灵活的二进制量化方法

Reddit r/LocalLLaMA · 2026-06-08

NanoQuant是一种灵活的二进制量化方法,可将稠密Transformer压缩至每个权重低于1比特。本仓库提供了一个PyTorch实现,仍在开发中,能够量化Qwen3-0.6B和Qwen3-4B等模型。

0 人收藏 0 人点赞
#compression

@Hesamation: 3Blue1Brown 的新视频解释了为什么每个LLM实际上都是一台压缩机器。每个人都把预训练描述为“下一个...”

X AI KOLs Timeline · 2026-06-08 缓存

3Blue1Brown 的新视频解释了LLM本质上是压缩机器,将下一个词预测与人类知识的高效编码联系起来,从而带来更好的抽象和推理能力。

0 人收藏 0 人点赞
#compression

@RoundtableSpace: 谷歌刚刚找到一种方法,将AI内存从31GB压缩到4GB

X AI KOLs Timeline · 2026-06-06 缓存

谷歌开发了一种方法,将AI内存使用量从31GB压缩到4GB,代表了AI模型效率的重大突破。

0 人收藏 0 人点赞
#compression

PivCo-Huffman

Lobsters Hottest · 2026-06-05 缓存

本文介绍了PivCo-Huffman,一种利用小波树中的枢轴编码进行霍夫曼编码的新方法,实现了高性能的SIMD友好编码和解码。它始终优于最先进的霍夫曼编解码器,并展示了如何将ANS编码选择性地应用于偏斜节点,以接近ANS压缩比,同时保持高解压缩速度。

0 人收藏 0 人点赞
#compression

面向通信高效流水线并行的学习子空间压缩

arXiv cs.LG · 2026-06-05 缓存

本文介绍 MAPL,一种针对流水线并行中激活值进行学习型正交压缩的方法,通过 Stiefel 流形约束和逐阶段分解锚定嵌入,在保持性能的同时降低通信开销。

0 人收藏 0 人点赞
#compression

从KV缓存压缩的角度重新思考LoRA内存

arXiv cs.CL · 2026-06-05 缓存

本文研究了文档级问答中参数侧内存(LoRA适配器)与上下文侧内存(KV缓存)之间的交互。研究发现,当KV缓存被大幅压缩时,文档LoRA变得最有价值,可恢复13–21个ROUGE-L点,并且经过问答监督的适配器优于基于下一词预测的适配器。

0 人收藏 0 人点赞
#compression

proveKV – 诚实的36倍无损(vs f32,18倍 vs fp16)KV缓存压缩用于LLM(零PPL回归)

Reddit r/LocalLLaMA · 2026-06-05

一个开源仓库proveKV展示了一种可复现的KV缓存压缩技术,在SmolLM2-1.7B上实现了36倍无损(vs f32)和68倍有损内存减少,且PPL回归为零,包括Rust示例和审计管道。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈