标签
文章表达了对未来AI模型的期望,这些模型采用KVCache和Engram等优化技术来减少内存使用,使得更大的模型能够在显存有限的消费级GPU上运行。
本文解释了RadixAttention,这是SGLang中的一项技术,使用基数树来高效缓存和重用AI服务中跨分支请求的重叠KV缓存。
宣布发布 Luce KVFlash,这是一个在 Lucebox 中以 256k 上下文运行模型的工具,无需担心 KVCache 和 OOM,通过推测预填充和动态卸载,在长上下文场景下解码速度提升高达 2.9 倍。
一款逐门定制的数字芯片,在仅80 MHz频率下运行含KV缓存的Transformer,实现每秒超过56,000 tokens,并在FPGA上完成原型验证。
一份详细的基准测试,比较 ByteShape 和 Unsloth 对 Qwen3.6-35B-A3B 的量化在工具调用性能、KV 缓存量化效果以及使用 llama.cpp 和 tool-eval-bench 的长上下文退化情况。
ZCube是一种新的网络架构,通过打平拓扑并混合单/多轨接入,优化了长上下文和PD分离场景下的KV Cache传输,在GLM-5.1生产集群中实现了交换机/光模块成本降低33%、GPU推理吞吐提升15%、TTFT P99下降40.6%。