kvcache

标签

Cards List
#kvcache

@davideciffa:非常自豪地宣布,我们刚刚发布了 Luce KVFlash。在 Lucebox 中以 256k 上下文运行您偏好的模型,无需…

X AI KOLs Timeline · 2026-06-14 缓存

宣布发布 Luce KVFlash,这是一个在 Lucebox 中以 256k 上下文运行模型的工具,无需担心 KVCache 和 OOM,通过推测预填充和动态卸载,在长上下文场景下解码速度提升高达 2.9 倍。

0 人收藏 0 人点赞
#kvcache

@FGuzmanAI: 仅80 MHz下每秒56,000+ tokens。我将完整Transformer(含KV缓存)烧录到定制芯片中。逐门设计……

X AI KOLs Timeline · 2026-06-13 缓存

一款逐门定制的数字芯片,在仅80 MHz频率下运行含KV缓存的Transformer,实现每秒超过56,000 tokens,并在FPGA上完成原型验证。

0 人收藏 0 人点赞
#kvcache

Qwen3.6-35B-A3B 工具调用基准测试:ByteShape 对比 Unsloth GGUFs、KV 缓存量化及长上下文性能

Reddit r/LocalLLaMA · 2026-06-08

一份详细的基准测试,比较 ByteShape 和 Unsloth 对 Qwen3.6-35B-A3B 的量化在工具调用性能、KV 缓存量化效果以及使用 llama.cpp 和 tool-eval-bench 的长上下文退化情况。

0 人收藏 0 人点赞
#kvcache

@MaxForAI: http://Z.ai和清华这篇ZCube,做Infra的家人们值得看下。 很多人聊AI infra,第一反应还是GPU、显存、量化、推理框架。 但到长上下文和Prefill-Decode分离之后,网络已经不再是机房里的「配角」了。 每一…

X AI KOLs Timeline · 2026-05-21

ZCube是一种新的网络架构,通过打平拓扑并混合单/多轨接入,优化了长上下文和PD分离场景下的KV Cache传输,在GLM-5.1生产集群中实现了交换机/光模块成本降低33%、GPU推理吞吐提升15%、TTFT P99下降40.6%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈