@lauriewired:真有意思。三星几天前几乎悄无声息地发布了一篇论文:在CXL内存池上卸载KV缓存。R…

X AI KOLs Timeline 论文

摘要

三星发表了一篇关于通过CXL内存池卸载KV缓存的论文,展示了即使使用早期版本的CXL硬件,GPU也能像使用真实DRAM一样高效地获取数据,使得该方法易于复现。

真有意思。三星几天前几乎悄无声息地发布了一篇论文: 在CXL内存池上卸载KV缓存。 而且设置非常简陋。这*不是*未来科技。早期版本的CXL栈(2.0)、老式交换机,但仅仅是将KV缓存跨CXL模块进行简单交错,就能让GPU像使用真实DRAM一样保持高效供给! 虽然远非最先进技术,但应该很容易复现!
查看原文
查看缓存全文

缓存时间: 2026/07/12 23:02

真有意思。三星前几天悄无声息地发布了一篇论文:

通过CXL内存池实现KV缓存卸载。

设置也很简陋。这可不是什么未来科技——用的是初代CXL堆栈(2.0)、老式交换机,但仅仅通过简单地将KV缓存交错分布在CXL模块上,就能让GPU像使用真实DRAM一样被充分喂饱!

虽然不是最先进的方案,但应该很容易复现!

当然,这篇(7月8日发布的)白皮书符合三星的利益,图10有点……误导性

(没错,700GB缓存装不进512GB DRAM,多一个CXL内存池当然有帮助!)

不过,它确实暗示了最基础的软件技巧如何能吸收大部分延迟开销,而无需大改操作系统。

https://semiconductor.samsung.com/news-events/tech-blog/breaking-ai-memory-limits-with-cxl-memory-pooling/…

我经常想,如果当年是IBM赢了而不是UNIX,世界会是什么样子。

IBM的i操作系统美极了(而且仍在更新!)——万物皆对象,没有原生二进制(全是翻译后的字节码,几乎像是Java虚拟机的风格),而且所有指针都带有海量的(有用的)元数据。

从技术上讲,它隐藏了大量底层系统……你甚至无法选择对象是放在RAM还是磁盘上!但有趣的是,去想想软件会因此变得多安全。

或许有些过度设计,但真的很漂亮。这让我想起Symbolics,就像另一个平行宇宙里的LISP机器,万物皆对象。

相似文章

Xcena和三星的近内存计算CXL设备

Hacker News Top

Xcena和三星宣布了MX1,这是一款配备3072个用于近内存计算的RISC-V核心的CXL内存扩展设备,旨在解决机器学习工作负载的内存需求,在Hot Chips 2026上发布。

也许将KV缓存卸载到RAM并不差

Reddit r/LocalLLaMA

一位用户分享了在llama.cpp中将KV缓存卸载到RAM的经验,在释放显存以便运行更大模型和上下文窗口的同时,实现了相近的速度,表明这种权衡通常是值得的。