@lauriewired:真有意思。三星几天前几乎悄无声息地发布了一篇论文:在CXL内存池上卸载KV缓存。R…
摘要
三星发表了一篇关于通过CXL内存池卸载KV缓存的论文,展示了即使使用早期版本的CXL硬件,GPU也能像使用真实DRAM一样高效地获取数据,使得该方法易于复现。
查看缓存全文
缓存时间: 2026/07/12 23:02
真有意思。三星前几天悄无声息地发布了一篇论文:
通过CXL内存池实现KV缓存卸载。
设置也很简陋。这可不是什么未来科技——用的是初代CXL堆栈(2.0)、老式交换机,但仅仅通过简单地将KV缓存交错分布在CXL模块上,就能让GPU像使用真实DRAM一样被充分喂饱!
虽然不是最先进的方案,但应该很容易复现!
当然,这篇(7月8日发布的)白皮书符合三星的利益,图10有点……误导性
(没错,700GB缓存装不进512GB DRAM,多一个CXL内存池当然有帮助!)
不过,它确实暗示了最基础的软件技巧如何能吸收大部分延迟开销,而无需大改操作系统。
https://semiconductor.samsung.com/news-events/tech-blog/breaking-ai-memory-limits-with-cxl-memory-pooling/…
我经常想,如果当年是IBM赢了而不是UNIX,世界会是什么样子。
IBM的i操作系统美极了(而且仍在更新!)——万物皆对象,没有原生二进制(全是翻译后的字节码,几乎像是Java虚拟机的风格),而且所有指针都带有海量的(有用的)元数据。
从技术上讲,它隐藏了大量底层系统……你甚至无法选择对象是放在RAM还是磁盘上!但有趣的是,去想想软件会因此变得多安全。
或许有些过度设计,但真的很漂亮。这让我想起Symbolics,就像另一个平行宇宙里的LISP机器,万物皆对象。
相似文章
Xcena和三星的近内存计算CXL设备
Xcena和三星宣布了MX1,这是一款配备3072个用于近内存计算的RISC-V核心的CXL内存扩展设备,旨在解决机器学习工作负载的内存需求,在Hot Chips 2026上发布。
@yukangchen_: 我们很高兴分享一篇新的技术文章《KV缓存压缩及其基础设施问题》。https://research.nvidia.…
NVIDIA Research发布了一篇技术博客,探讨KV缓存压缩技术及其基础设施问题,包括FlashAttention和paged attention如何为长上下文LLM的生产部署带来实际障碍,并提出了一个使用RoPE的几何解决方案。
也许将KV缓存卸载到RAM并不差
一位用户分享了在llama.cpp中将KV缓存卸载到RAM的经验,在释放显存以便运行更大模型和上下文窗口的同时,实现了相近的速度,表明这种权衡通常是值得的。
@KVCache_AI: Mooncake现在支持KV缓存的SSD卸载。随着智能体工作负载成为常态,KV缓存的生存时间正在…
Mooncake宣布支持KV缓存的SSD卸载,能够经济高效地将KV缓存容量扩展到DRAM之外,适用于长时间运行的智能体工作负载。分析显示,双峰复用模式使得分层存储更加高效。
@SKhynix:认识一下CMM-Ax,这是@SKhynix与Marvell Technology共同开发的基于ASIC的CXL-PNM解决方案。旨在克服内存瓶…
SK海力士推出CMM-Ax,这是与Marvell Technology共同开发的基于ASIC的CXL-PNM解决方案,旨在克服长上下文LLM推理中的内存瓶颈,吞吐量比仅使用GPU的系统最高提升5.5倍。