compression

标签

Cards List
#compression

HARD-KV: 解码时 KV 压缩的头部自适应正则化

arXiv cs.LG · 2026-06-30 缓存

Hard-KV 引入了级联缓存层次结构和 Logits 校准机制,以解决头部自适应 KV 缓存压缩中的静态-动态不匹配问题,在长上下文 LLM 推理中实现了高达 2 倍的吞吐量提升。

0 人收藏 0 人点赞
#compression

使用可解释量子自编码器的脑MRI压缩驱动异常检测

arXiv cs.AI · 2026-06-29 缓存

本文提出了一种用于脑MRI压缩驱动异常检测的量子自编码器,实现了高ROC-AUC分数,优于经典基线方法,并提供了可解释的异常热力图。

0 人收藏 0 人点赞
#compression

压缩 Whisper large-v3-turbo 至 368 MB 采用 Q3_K 匹配的量化感知训练 — 多语言 WER 结果

Reddit r/openclaw · 2026-06-28

Whisper large-v3-turbo 已压缩至 368 MB,采用 Q3_K 匹配的量化感知训练,并报告了多语言词错误率结果。

0 人收藏 0 人点赞
#compression

@_avichawla: 一个棘手的LLM面试题:你在vLLM上部署推理模型,长序列时GPU内存总是不够用。于是你加入KV缓存压缩,驱逐了90%的缓存token。显存占用依旧,GPU仍然内存不足。为什么?

X AI KOLs Timeline · 2026-06-27 缓存

解释了为什么在vLLM上部署推理模型时,驱逐90%的KV缓存token无法释放GPU内存,原因是分页注意力碎片化。同时介绍了NVIDIA的TriAttention解决方案,可实现2.5倍加速和10.7倍内存缩减。

0 人收藏 0 人点赞
#compression

OpenZL

Lobsters Hottest · 2026-06-27 缓存

OpenZL 是一个压缩库,能够为特定数据格式生成专门的压缩器,以高速实现高压缩比,适用于数据中心工作负载,如 AI 处理。

0 人收藏 0 人点赞
#compression

13KB的Quake (2021)

Hacker News Top · 2026-06-26

探讨了游戏Quake如何被压缩到仅有13KB,展示了极致的优化技术。

0 人收藏 0 人点赞
#compression

面向长推理的信息感知KV缓存压缩

arXiv cs.CL · 2026-06-26 缓存

本文提出InfoKV,一种熵感知的KV缓存压缩框架,结合了token级别的预测不确定性和注意力分数,以提高长上下文推理效率。实验表明,它在Llama-3.1、Llama-3.2和DeepSeek-R1上优于现有的基于注意力的方法。

0 人收藏 0 人点赞
#compression

ReFreeKV:迈向无阈值的KV缓存压缩

Hugging Face Daily Papers · 2026-06-26 缓存

ReFreeKV引入了一种无阈值的KV缓存压缩方法,自适应分配预算,消除了对输入特定阈值的需求,同时在各种数据集和模型大小上保持全缓存性能。

0 人收藏 0 人点赞
#compression

@rohanpaul_ai: 大型语言模型可能不需要人类风格的语言。即,未来的人工智能系统可能会通过使用密集的、模型可读的消息来节省上下文空间,而不是冗长的常规散文。

X AI KOLs Following · 2026-06-25 缓存

本文介绍了BabelTele,一种压缩写作风格,通过使用缩写、符号和多语言片段将文本长度减少72.1%,同时为LLM保留了99.5%的语义保真度,论证了人类可读性与机器可恢复性是可分离的。

0 人收藏 0 人点赞
#compression

面向物联网降雨预测的联邦分裂学习中的自适应联合压缩与同步

arXiv cs.LG · 2026-06-25 缓存

本文提出了一种面向联邦分裂学习的自适应联合压缩与同步机制,用于减少物联网降雨预测中的通信开销,在不显著损失预测质量的前提下实现了显著的流量减少。

0 人收藏 0 人点赞
#compression

GetCompress

Product Hunt · 2026-06-24

GetCompress 是一个无损媒体压缩工具,无需切换上下文。

0 人收藏 0 人点赞
#compression

一把标尺:图宾根双变量因果方向的同手重新评估,附带无参数压缩基线

arXiv cs.LG · 2026-06-24 缓存

本文对图宾根因果对数据集上的双变量因果方向方法进行了同手重新评估,引入了一种无参数压缩基线,其表现与SLOPE持平。文章记录了已发表准确率因协议差异而虚高的情况,并公开了所有代码和数据。

0 人收藏 0 人点赞
#compression

将900KB Transformer过拟合,把100MB CSV压缩到7MB

Hacker News Top · 2026-06-23 缓存

一位开发者使用一个小型900KB的Transformer模型进行过拟合,将100MB的CSV文件压缩到7MB,展示了一种使用过拟合神经网络进行数据压缩的新颖方法。

0 人收藏 0 人点赞
#compression

通过穷举搜索实现无损GIF压缩

Hacker News Top · 2026-06-23 缓存

博客文章探讨了通过对LZW编码进行穷举搜索来实现GIF图像的无损重新压缩,类似于PNG的Zopfli方法,以达到更小的文件大小。

0 人收藏 0 人点赞
#compression

极其缓慢的 Level 13 Deflate 压缩

Hacker News Top · 2026-06-22 缓存

文章描述了 libdeflate 新的级别13,这是一种故意减慢的 DEFLATE 压缩级别,在 Silesia 数据集上仅能实现微不足道的压缩提升(0.134%),但代价是比级别12慢56倍,专为数据压缩一次、解压多次的场景设计。

0 人收藏 0 人点赞
#compression

@mattpocockuk: “X技术可减少Y% token”这种潮流已经过时了,真不敢相信还有人会上当。

X AI KOLs Following · 2026-06-21 缓存

一条推文批评了token缩减的潮流,同时重点介绍了Headroom,这是Netflix工程师开发的开源工具,可在本地压缩LLM载荷,降低成本高达95%。

0 人收藏 0 人点赞
#compression

@DivyanshT91162: LVector数据库迎来重大变革——这个开源项目将2.01亿个文本块从201GB压缩至6GB,同时保持检索质量

X AI KOLs Timeline · 2026-06-18 缓存

一个开源项目将6000万个文本块从201GB压缩至6GB,同时保持检索质量,实现97%的存储缩减,且无需GPU即可在普通笔记本上运行。

0 人收藏 0 人点赞
#compression

基准幻觉:经过剪枝的大语言模型可以通过多项选择题但无法回答问题

arXiv cs.CL · 2026-06-17 缓存

本文揭示了“基准幻觉”现象:经过剪枝的大语言模型在多项选择基准测试中表现良好,但在开放生成中却无法回答相同的问题,这表明压缩模型应针对生成任务进行测试,而不仅仅是识别任务。

0 人收藏 0 人点赞
#compression

小初始化对大语言模型至关重要

arXiv cs.AI · 2026-06-17 缓存

本文表明,降低参数初始化规模能持续改善大型语言模型的预训练,且在推理密集型任务上收益最大。它发现了一种平衡推理与训练的关键初始化,并提出一个简单的γ-初始化规则。

0 人收藏 0 人点赞
#compression

gzip能成为语言模型吗?

Lobsters Hottest · 2026-06-16 缓存

本文探讨了将gzip压缩算法用作语言模型的可行性,展示了压缩算法可以通过基于压缩长度对候选续文进行评分并利用束搜索来生成文本。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈