compression

标签

Cards List
#compression

@JakeKAllDay: 华为发布了一篇关于一种名为KVarN的新型KV压缩方法的论文:它证明了低至 *2 bit* 量化时损失极小…

X AI KOLs Timeline · 2026-06-04 缓存

华为发布了一篇关于KVarN的论文,这是一种新型KV缓存压缩方法,在2位量化下与FP16相比实现了极小损失,优于TurboQuant和KIVI等方法,且几乎不引入推理延迟。

0 人收藏 0 人点赞
#compression

JPEG XL 发展之路:开源实验塑造了图像编码的未来

Hacker News Top · 2026-06-03 缓存

谷歌工程师回顾 JPEG XL 背后长达十年的开源历程,重点介绍了 WebP Lossless、Butteraugli 和 Guetzli 等关键实验如何塑造了下一代图像标准。

0 人收藏 0 人点赞
#compression

从长新闻到精准预测:重要性感知融合与PRM引导的反思在时间序列预测中的应用

arXiv cs.AI · 2026-06-03 缓存

本文介绍了一个时间序列预测框架,该框架利用重要性感知的新闻压缩和过程奖励模型引导的检索,在固定上下文长度内融入长新闻文章,从而提高金融、能源、交通和比特币基准上的预测精度。

0 人收藏 0 人点赞
#compression

量化如何改变可解释特征:语言模型的稀疏自编码器分析

arXiv cs.LG · 2026-06-03 缓存

本文研究了在全精度语言模型中由稀疏自编码器识别的可解释特征在量化后是否仍然忠实,发现系统性的退化,而像困惑度这样的行为指标可能无法捕捉到这种退化。

0 人收藏 0 人点赞
#compression

针对推理模型的价值感知随机KV缓存驱逐方法

Hugging Face Daily Papers · 2026-06-02 缓存

VaSE是一种无需训练的KV缓存驱逐方法,它保护大数值幅度的值状态,并引入随机性,以提高压缩下推理模型的准确性,超越了现有方法。

0 人收藏 0 人点赞
#compression

SEAOTTER:传感器嵌入式自编码与一次性转码实现高效重建

Hugging Face Daily Papers · 2026-06-02 缓存

介绍 SEAOTTER,一种用于云机器人的压缩框架,该框架将学习到的潜在表示与标准 JPEG 兼容性相结合,在极端压缩比下实现了更快的编码/解码速度和更高的准确性。

0 人收藏 0 人点赞
#compression

@charliermarsh: 来自 Trifecta Tech 的纯 Rust zstandard 解码器实现!很荣幸与 Chainguard 共同资助了这项工作……

X AI KOLs Timeline · 2026-06-01 缓存

一个纯 Rust 的 zstandard 解码器实现已经发布,由 Trifecta Tech、Chainguard 和 NLnet 基金会资助。

0 人收藏 0 人点赞
#compression

宣布推出Rust版Zstandard

Lobsters Hottest · 2026-06-01 缓存

Trifecta Tech Foundation 宣布首次发布 libzstd-rs-sys,这是一个纯 Rust 实现的 Zstandard 压缩格式,可作为 C 参考实现的直接替代品,在轻微性能损失下提供更好的可移植性和内存安全性。

0 人收藏 0 人点赞
#compression

为什么ASTC使用ISE而其他几乎都不使用?

Lobsters Hottest · 2026-06-01 缓存

这篇技术博文解释了为什么ASTC纹理压缩格式使用整数序列编码(ISE)而不是更简单的前缀编码。它比较了ISE与前缀码在小整数范围内的效率,表明ISE的节省虽然有限,但在某些场景下仍然值得。

0 人收藏 0 人点赞
#compression

@omarsar0: // The Efficiency Frontier // 关于上下文管理的有趣论文。随着代理在多次交互中重复使用相同的文档和历史记录……

X AI KOLs Following · 2026-05-31 缓存

本文介绍了The Efficiency Frontier,一个用于LLM上下文管理成本-性能优化的统一框架,它将上下文策略选择建模为一个部署感知的优化问题,通过摊销内存压缩,与全上下文提示相比,实现了25%的token使用量减少和超过50%的token成本降低。

0 人收藏 0 人点赞
#compression

AV2 v1.0.0 规范

Lobsters Hottest · 2026-05-31 缓存

开放媒体联盟(Alliance for Open Media)发布了 AV2 v1.0.0 规范,这是一种新一代视频编码标准,为流媒体、广播和实时视频会议提供卓越的压缩效率。

0 人收藏 0 人点赞
#compression

NestedKV: 嵌套内存路由用于长上下文KV缓存压缩

arXiv cs.CL · 2026-05-27 缓存

NestedKV是一种无需训练的KV缓存压缩方法,它采用嵌套内存路由和多时间尺度异常评分,提升长上下文语言模型的效率,在RULER和LongBench等基准测试上取得了显著效果。

0 人收藏 0 人点赞
#compression

量化键偷走注意力:视频扩散中KV缓存压缩的偏差校正

arXiv cs.LG · 2026-05-27 缓存

本文指出,在分块自回归视频扩散的KV缓存压缩中,对键进行量化会导致注意力权重出现偏差,并提出了一种每注意力分数校正方法,该方法以可忽略的开销消除偏差,在INT2量化下恢复接近BF16的视频质量。

0 人收藏 0 人点赞
#compression

Shard - 实现10倍KV缓存压缩

Reddit r/LocalLLaMA · 2026-05-26 缓存

Shard是一个即插即用的HuggingFace缓存,通过使用PCA加int4量化处理K(键),以及Hadamard旋转加向量量化处理V(值),为Llama-3.1-8B实现了10倍的KV缓存压缩,且在基准测试中无精度损失。

0 人收藏 0 人点赞
#compression

Latent Cache Flow:无需文本的模型间通信

arXiv cs.LG · 2026-05-25 缓存

本文介绍了 Latent Cache Flow(LCF),一种通过交换压缩后的KV缓存而非文本来实现高效模型间通信的方法,从而减少了适配器大小并实现了跨上下文通信。

0 人收藏 0 人点赞
#compression

@Michaelzsguo: KV缓存是模型在生成期间的工作记忆。随着上下文窗口变长,模型必须保留更多…

X AI KOLs Timeline · 2026-05-23 缓存

DeepSeek的KV缓存压缩创新,包括MLA和CSA/HCA,将KV缓存大小减少了93%,实现了高效的长上下文推理和基于SSD的缓存,正如antirez的ds4.c项目所展示的那样。

0 人收藏 0 人点赞
#compression

本地压缩的助益

Reddit r/AI_Agents · 2026-05-22

一位用户分享了一个技巧:在代理工作流程中使用 Ollama 本地的 llama3.1:8b 模型压缩对话上下文,相较于将上下文发送给提供商,能降低延迟并减少 token 使用量。

0 人收藏 0 人点赞
#compression

@morganlinton: 我向Teknium请教,他可能是世界上最聪明的智能体开发者之一,问他最近在工具调用加速方面做了什么……

X AI KOLs Following · 2026-05-21 缓存

Teknium分享了AI智能体中工具调用的最新性能改进,包括延迟导入、减少每轮对话47%的函数调用、以及延迟压缩可行性检查,并附有GitHub上可运行代码的链接。

0 人收藏 0 人点赞
#compression

Gorilla:一种快速、可扩展的内存时间序列数据库(2016)

Hacker News Top · 2026-05-20 缓存

本文介绍了Gorilla,一个由Facebook开发的内存时间序列数据库,通过一种新颖的压缩算法实现了高性能,能够存储数十亿时间序列并支持生产监控的快速查询。

0 人收藏 0 人点赞
#compression

TencentDB 的智能体内存非常适合压缩,但我不确定压缩就是全部问题

Reddit r/AI_Agents · 2026-05-20

对比 TencentDB 的智能体内存(擅长压缩混乱的执行记录以节省 token)与 Memos 本地插件(专注于通过反馈循环将执行历史转化为可复用的习惯和长期学习)。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈