compression

标签

Cards List
#compression

KV缓存压缩的消融、统计推断与验证

arXiv cs.LG · 2026-07-14 缓存

本文对KV缓存压缩方案(TurboQuant和SpectralQuant)进行了系统的比较研究,介绍了一种统计验证方法,并针对高效Transformer推理提供了特定场景下的建议。

0 人收藏 0 人点赞
#compression

@charliermarsh: 我们发现了一些优化,通过“压缩”环境标记来减小 uv.lock 文件的大小。…

X AI KOLs Timeline · 2026-07-13 缓存

uv 的锁文件大小通过压缩环境标记减少了 40-50%。

0 人收藏 0 人点赞
#compression

优化Lua字符串字面量以节省400字节

Hacker News Top · 2026-07-13 缓存

一篇技术博客文章,探讨在ComputerCraft程序环境下,通过选择最优表示方式(引号字符串与原始字符串)来减小Lua字符串字面量大小的方法,实现了400字节的节省。

0 人收藏 0 人点赞
#compression

潜空间作为新媒介

Hacker News Top · 2026-07-13 缓存

Kevin Kelly 认为,AI模型中的潜空间代表所有人类知识的压缩形式,这种潜空间将成为一种新的创造性媒介,使得新颖的艺术和科学探索成为可能。

0 人收藏 0 人点赞
#compression

@brianbellx: 我在不对模型做任何改变的情况下,从 GLM-5.2 中移除了 423 GB。1,403 GB → 980 GB。753B 权重。逐比特精确。无需量化…

X AI KOLs Timeline · 2026-07-12 缓存

一种无需量化或重新训练即可从 GLM-5.2(753B 权重)中移除 423 GB 的技术,通过在 VRAM 中保持权重压缩状态实现逐比特精确压缩。

0 人收藏 0 人点赞
#compression

Handsum: 一种LQIP图像文件格式

Lobsters Hottest · 2026-07-11 缓存

Nigel Tao介绍了Handsum,一种基于DCT的新型固定大小LQIP图像文件格式,与JPEG相比,提供可预测的文件大小和简单性。

0 人收藏 0 人点赞
#compression

@VukRosic99: 大多数KV缓存压缩仅对键进行SVD,或者联合嵌入查询和键。两者都忽略了显而易见的目标…

X AI KOLs Timeline · 2026-07-10 缓存

KQ-SVD是一种新的KV缓存压缩方法,它通过最优低秩分解直接近似注意力矩阵,在LLaMA和Mistral模型上实现了比仅键SVD低5-10倍的误差。

0 人收藏 0 人点赞
#compression

修剪不良专家需要MAESTRO

arXiv cs.CL · 2026-07-10 缓存

本文介绍了Maestro,一种针对混合专家语言模型的结构化剪枝框架。该框架利用马尔可夫链对专家激活轨迹进行建模,实现全局感知剪枝,在50%压缩率下,性能优于基线模型最高达10.61%。

0 人收藏 0 人点赞
#compression

@omarsar0: 信息论的可视化介绍(收藏)信息论是如此美丽而强大的主题……

X AI KOLs Following · 2026-07-09 缓存

一篇直观、可视化的信息论入门介绍,涵盖熵、互信息和信道容量,仅需基础概率知识。该论文阐述了压缩和传输的基本极限。

0 人收藏 0 人点赞
#compression

基于可控性-可观测性测试的深度神经网络经验最小实现压缩

arXiv cs.LG · 2026-07-08 缓存

本文提出了一种基于可控性-可观测性的框架,通过减少隐藏状态冗余来压缩深度神经网络,在MNIST和CIFAR-10数据集上实现了显著压缩,且精度损失极小。

0 人收藏 0 人点赞
#compression

基于嵌套与层次重复的文本距离:一种压缩视角

arXiv cs.CL · 2026-07-08 缓存

本文提出了一种新的结构序列分析方法,采用Ladderpath方法提取嵌套和层次重复结构,定义了三种距离度量,在分布外和少样本文本分类任务中优于基于gzip的NCD和BERT,提供了一种轻量级、可解释的替代方案。

0 人收藏 0 人点赞
#compression

面向长上下文服务的KV-Cache优化:任务质量与系统性能的基准测试

arXiv cs.CL · 2026-07-08 缓存

本文提出了一个负载感知的基准测试,在长上下文LLM服务任务上比较了KV-cache压缩技术(量化、剪枝、合并),发现仅压缩比不足以预测性能,并倡导负载感知的选择。

0 人收藏 0 人点赞
#compression

Fable创建了新颖的4D splat格式

Hacker News Top · 2026-07-04 缓存

一种名为.splat4d的新型4D高斯splat格式,具有可调误差边界,对原始splat的压缩比为16-58倍,并支持动态场景的原生HTTP Range流式传输,代码和演示已提供。

0 人收藏 0 人点赞
#compression

@JunchenJiang:这会终止关于压缩KV缓存可能会搞砸LLM推理的争论吗?

X AI KOLs Timeline · 2026-07-04 缓存

这条推文质疑一项新发现是否能够解决关于压缩KV缓存是否损害LLM推理性能的争论。

0 人收藏 0 人点赞
#compression

KV缓存压缩的风险

arXiv cs.LG · 2026-07-03 缓存

本文从理论上刻画了变压器中KV缓存压缩的极小极大风险,为因果掩码下的精确压缩提供了设计原则,并将其实例化到实用算法中,在LongBench上取得了有前景的结果。

0 人收藏 0 人点赞
#compression

我们可以用SLMs压缩数据吗?

Reddit r/LocalLLaMA · 2026-07-03

探讨了是否可以通过刻意对训练数据进行过拟合来使用小型语言模型(SLMs)实现无损数据压缩,反思机器学习中通常对过拟合的厌恶。

0 人收藏 0 人点赞
#compression

MosaicKV:使用动态二维KV缓存压缩服务长上下文LLM

arXiv cs.LG · 2026-07-02 缓存

MosaicKV引入了用于长上下文LLM服务的动态二维KV缓存压缩,实现了高达16倍的注意力加速和3倍的内存减少,且精度损失极小。

0 人收藏 0 人点赞
#compression

@wikeygo: 藏在 WinRAR 里,俄罗斯程序员封神三十年的天才设计! WinRAR 背后的俄罗斯程序员尤金・罗沙尔,出身苏联 “坦克城” 车里雅宾斯克,早年靠着仅有 96KB 内存的仿制苹果电脑编程,从小养成极致节约字节、追求高效代码的习惯。 19…

X AI KOLs Timeline · 2026-07-02 缓存

本文讲述了WinRAR背后的俄罗斯程序员尤金·罗沙尔的故事,包括他在苏联时期的编程背景、1993年自研压缩算法、1995年推出WinRAR,以及40天试用设计的精妙商业策略:不限制功能只弹窗提醒,让个人免费使用形成生态,迫使企业批量采购授权,同时开放解压代码但封闭压缩算法以维持市场壁垒。

0 人收藏 0 人点赞
#compression

你能在500字节内构建一个可识别的世界地图吗?

Hacker News Top · 2026-07-01 缓存

一位开发者尝试使用ASCII字符和deflate-raw压缩技术,在500字节内创建可识别的世界地图,尽管未压缩文本为8,523字节,仍实现了445字节的压缩地图。

0 人收藏 0 人点赞
#compression

我构建了一种方法,防止巨大的工具输出撑爆AI代理的上下文窗口

Reddit r/AI_Agents · 2026-06-30

LeanCTX已更新,作为管理AI代理工具输出的网关,压缩大数据,擦除秘密,并通过MCP集成外部工具,以防止令牌爆炸。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈